arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-08 至 2026-07-08 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 15 篇

2607.06522 2026-07-08 cs.AI cs.CV 新提交 87%

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) The University of California, Merced(加州大学默塞德分校)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。

Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05196 2026-07-08 cs.CL cs.AI cs.LG cs.SD eess.AS 新提交 67%

Unified Audio Intelligence Without Regressing on Text Intelligence

不退化文本智能的统一音频智能

Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。

Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06527 2026-07-08 cs.CL cs.AI 新提交 62%

RSF-GLLM: Bridging the Semantic Gap in Multi-Hop Knowledge Graph QA via Recurrent Soft-Flow and Decoupled LLM Generation

RSF-GLLM:通过循环软流和去耦语言模型生成弥合多跳知识图谱问答中的语义鸿沟

Sambaran Bandyopadhyay, Ananth Muppidi

机构 * Adobe Research(Adobe研究院) Adobe Systems(Adobe系统公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究多跳知识图谱问答中传统方法的语义鸿沟问题,提出RSF-GLLM框架,通过循环软流模块传播分数、引入正则化保证收敛,提取路径微调LLM,实验证明该方法性能优且推理效率高。

Comments Accepted for publication in ICML 2026 as a full research paper; 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05545 2026-07-08 cs.CL cs.AI 新提交 62%

Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks

大多数大语言模型的从众现象无需说话者:在同伴压力基准测试中测量无说话者底线

Yibo Hu, Jiaming Qu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型从众现象,发现多数从众在去除同伴后仍存。因标准提示混杂线索致现有基准无法分辨。引入无来源条件测试,发现其在多数案例中致有害修正,还揭示来源框架对底线的调节作用及相关问题,强调从众基准测试应先测无说话者底线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05405 2026-07-08 cs.CY cs.AI cs.CL 新提交 62%

CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries

CCBENCH:通过健康查询使用隐式信号规范评估大语言模型的文化能力

Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :CoT(abstract);分类 cs.CL、cs.AI

AI总结 该研究引入CCBENCH框架,以健康领域为案例创建CCBENCH-Health评估大语言模型文化能力。通过60个角色、3120次互动对五个领先模型进行基准测试,发现模型文化恰当回应比例低,提示关注文化线索能适度提升性能,还揭示了模型与文化线索互动的一些特点。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05001 2026-07-08 cs.CR cs.AI cs.LG cs.MA 新提交 62%

TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction

TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队

Mouhamed Amine Bouchiha, Gregory Blanc

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。

Comments 20 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14761 2026-07-08 cs.LG cs.AI cs.CV 版本更新 62%

Universal Algorithm-Implicit Learning

通用算法隐式学习

Stefano Woerner, Seong Joon Oh, Christian F. Baumgartner

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对当前元学习方法局限性,引入理论框架定义实际通用性及算法显隐式学习。提出基于Transformer的TAIL算法,有随机投影等创新,在少样本基准测试中性能领先,能推广到未见领域和模态,处理更多类别任务且节省计算成本。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07364 2026-07-08 cs.AI cs.LG 版本更新 62%

Base Models Know How to Reason, Thinking Models Learn When

基础模型知道如何推理,思维模型在训练中学习时机

Constantin Venhoff, Iván Arcuschin, Philip Torr, Arthur Conmy, Neel Nanda

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究思维语言模型训练中比基础模型多学到了什么,提出无监督方法和建设性模型差异分析,通过九个基础/思维模型对实验发现强化学习教编排基础机制启发式,监督微调蒸馏装新机制,为训练范式及推理模型开发提供新视角。

Comments Accepted as a Spotlight at the International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06101 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 57%

Agents That Teach: Towards Designing Incidental Learning Back into AI-Assisted Software Development

教学型智能体:将偶然学习重新融入人工智能辅助软件开发的设计探索

Rohit Mehra, Samdyuti Suri, Prithviraj K Tagadinamani, Kapil Singi, Vikrant Kaulgud, Adam P. Burden

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, USA(Accenture,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 探讨人工智能编码智能体使开发者过度依赖而失去偶然学习机会并积累知识债务的问题,提出六项设计原则,展示基于“教学型智能体”概念的“SHIELD”系统,推动形成生产力与学习互补的学习感知开发环境。

Comments 5 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (New Ideas and Emerging Results Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05790 2026-07-08 cs.AI 新提交 57%

Controlling Tool Use with Heading-Specific Activation Steering

通过特定标题激活控制工具使用

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究工具增强大语言模型中工具使用决策的稳定内部表示,通过从标题锚点位置提取引导向量对工具调用行为进行双向因果控制,发现其因果有效性与线性结构不符,还区分了工具使用引导向量与参数化概念的引导向量,二者关系待解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05680 2026-07-08 cs.CY cs.AI cs.HC 新提交 57%

Beyond Accuracy: How Humans Evaluate Legally Correct but Socially Controversial Legal Advice from Machines

超越准确性:人类如何评估来自机器的法律正确但社会有争议的法律建议

Benjamin Minhao Chen, Zhiyu Li

机构 * University of Hong Kong(香港大学) Durham University(达灵顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨人类如何评估机器给出的法律正确但有社会争议的建议。通过对3348名中国大陆成年人的调查实验发现,归因于人工智能系统对感知合理性无净影响,提供法律推理可提高合理性,公众反应受规范期望平衡影响,对相关理论和系统设计有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06014 2026-07-08 cs.SD 新提交 50%

Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

摆脱普罗克汝斯忒斯之床:用于音频语言模型的分组正交连接器

Ho-Lam Chung, Ke-Han Lu, Yi-Cheng Lin, Guan-Ting Lin, Yiming Chen, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所) ASUS AICS

专题命中 其他推理 :reasoning(abstract)

AI总结 研究音频语言模型压缩中存在的问题,提出ORCA方法,通过分组使查询输出指向不同方向,在SAKURA多跳推理中表现出色,提升分数,减少查询冗余并提高跨说话者方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06004 2026-07-08 cs.SE 新提交 50%

Large Language Models Have Unreliable Understanding of Software Engineering Terminology

大语言模型对软件工程术语的理解不可靠

Huzaifa Ejaz, Fabian C. Peña, Steffen Herbold

专题命中 其他推理 :reasoning(abstract)

AI总结 研究大语言模型对软件工程术语的理解程度,通过用正确及伪造定义提示,测量分类准确率与推理令牌合理性,发现多数模型虽能检测伪造定义,但存在拒绝正确定义的偏差,明确推理未持续改善结果,揭示了LLMs在术语理解上的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05712 2026-07-08 cs.IR 新提交 50%

Retrieving a Set, Not Independent Passages: Set-Level Compatibility Learning for Efficient Set Exploration

检索一个集合,而非独立段落:用于高效集合探索的集合级兼容性学习

Mooho Song, Jay-Yoon Lee

专题命中 其他推理 :reasoning(abstract)

AI总结 针对多跳问答等任务中证据段落选择问题,提出集合级检索框架,通过查询-集合兼容性评分训练,用ParaSet和SetCE两个评分器实例化,提升了检索性能及下游问答任务性能,且集合级检索器有互补特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07056 2026-07-08 cs.CY cs.HC cs.SI stat.AP 版本更新 50%

The University AI Didn't Replace -- Rethinking Universities in the AI Era

人工智能未取代大学——人工智能时代大学的重新思考

Karol P. Binkowski, Andrew Hopkins

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了人工智能在高等教育中的影响,提出大学AI采用的四个层级框架,并通过案例研究展示如何从孤立创新转向战略整合,以推动教育变革。

Comments 8 pages, 1 figure. Position paper on Generative AI and the transition from isolated educational innovation to institutionally supported adoption in higher education

详情

展开后加载摘要…

URL PDF HTML 收藏