arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-08 至 2026-07-08 共收录 98 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 15 篇

2510.07364 2026-07-08 cs.AI cs.LG 版本更新 62%

Base Models Know How to Reason, Thinking Models Learn When

基础模型知道如何推理,思维模型在训练中学习时机

Constantin Venhoff, Iván Arcuschin, Philip Torr, Arthur Conmy, Neel Nanda

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究思维语言模型训练中比基础模型多学到了什么,提出无监督方法和建设性模型差异分析,通过九个基础/思维模型对实验发现强化学习教编排基础机制启发式,监督微调蒸馏装新机制,为训练范式及推理模型开发提供新视角。

Comments Accepted as a Spotlight at the International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06101 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 57%

Agents That Teach: Towards Designing Incidental Learning Back into AI-Assisted Software Development

教学型智能体:将偶然学习重新融入人工智能辅助软件开发的设计探索

Rohit Mehra, Samdyuti Suri, Prithviraj K Tagadinamani, Kapil Singi, Vikrant Kaulgud, Adam P. Burden

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, USA(Accenture,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 探讨人工智能编码智能体使开发者过度依赖而失去偶然学习机会并积累知识债务的问题,提出六项设计原则,展示基于“教学型智能体”概念的“SHIELD”系统,推动形成生产力与学习互补的学习感知开发环境。

Comments 5 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (New Ideas and Emerging Results Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05790 2026-07-08 cs.AI 新提交 57%

Controlling Tool Use with Heading-Specific Activation Steering

通过特定标题激活控制工具使用

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究工具增强大语言模型中工具使用决策的稳定内部表示,通过从标题锚点位置提取引导向量对工具调用行为进行双向因果控制,发现其因果有效性与线性结构不符,还区分了工具使用引导向量与参数化概念的引导向量,二者关系待解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05680 2026-07-08 cs.CY cs.AI cs.HC 新提交 57%

Beyond Accuracy: How Humans Evaluate Legally Correct but Socially Controversial Legal Advice from Machines

超越准确性:人类如何评估来自机器的法律正确但社会有争议的法律建议

Benjamin Minhao Chen, Zhiyu Li

机构 * University of Hong Kong(香港大学) Durham University(达灵顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨人类如何评估机器给出的法律正确但有社会争议的建议。通过对3348名中国大陆成年人的调查实验发现,归因于人工智能系统对感知合理性无净影响,提供法律推理可提高合理性,公众反应受规范期望平衡影响,对相关理论和系统设计有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06014 2026-07-08 cs.SD 新提交 50%

Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

摆脱普罗克汝斯忒斯之床:用于音频语言模型的分组正交连接器

Ho-Lam Chung, Ke-Han Lu, Yi-Cheng Lin, Guan-Ting Lin, Yiming Chen, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所) ASUS AICS

专题命中 其他推理 :reasoning(abstract)

AI总结 研究音频语言模型压缩中存在的问题,提出ORCA方法,通过分组使查询输出指向不同方向,在SAKURA多跳推理中表现出色,提升分数,减少查询冗余并提高跨说话者方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06004 2026-07-08 cs.SE 新提交 50%

Large Language Models Have Unreliable Understanding of Software Engineering Terminology

大语言模型对软件工程术语的理解不可靠

Huzaifa Ejaz, Fabian C. Peña, Steffen Herbold

专题命中 其他推理 :reasoning(abstract)

AI总结 研究大语言模型对软件工程术语的理解程度,通过用正确及伪造定义提示,测量分类准确率与推理令牌合理性,发现多数模型虽能检测伪造定义,但存在拒绝正确定义的偏差,明确推理未持续改善结果,揭示了LLMs在术语理解上的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05712 2026-07-08 cs.IR 新提交 50%

Retrieving a Set, Not Independent Passages: Set-Level Compatibility Learning for Efficient Set Exploration

检索一个集合,而非独立段落:用于高效集合探索的集合级兼容性学习

Mooho Song, Jay-Yoon Lee

专题命中 其他推理 :reasoning(abstract)

AI总结 针对多跳问答等任务中证据段落选择问题,提出集合级检索框架,通过查询-集合兼容性评分训练,用ParaSet和SetCE两个评分器实例化,提升了检索性能及下游问答任务性能,且集合级检索器有互补特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07056 2026-07-08 cs.CY cs.HC cs.SI stat.AP 版本更新 50%

The University AI Didn't Replace -- Rethinking Universities in the AI Era

人工智能未取代大学——人工智能时代大学的重新思考

Karol P. Binkowski, Andrew Hopkins

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了人工智能在高等教育中的影响,提出大学AI采用的四个层级框架,并通过案例研究展示如何从孤立创新转向战略整合,以推动教育变革。

Comments 8 pages, 1 figure. Position paper on Generative AI and the transition from isolated educational innovation to institutionally supported adoption in higher education

详情

展开后加载摘要…

URL PDF HTML 收藏