arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-27 至 2026-07-27 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2602.13935 2026-07-27 cs.AI cs.LG stat.ML 版本更新 84%

Statistical Early Stopping for Reasoning Models

统计早停法用于推理模型

Yangxinyu Xie, Tao Wang, Soham Mallick, Yan Sun, Georgy Noarov, Mengxin Yu, Tanwi Mallick, Edgar Dobriban

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17770 2026-07-27 cs.AI cs.CL 版本更新 81%

Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

熵梯度反转:迈向大型推理模型的内部机制

Junyao Yang, Chen Qian, Kun Wang, Linfeng Zhang, Quanshi Zhang, Yong Liu, Dongrui Liu

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30789 2026-07-27 cs.LG cs.AI 版本更新 62%

Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

小型模型是GRPO中策略级多样性的自然探索者

Yiran Xu, Yiming Ren, Zicheng Lin, Chufan Shi, Yukang Chen, Dingdong Wang, Tianhe Wu, Junjie Wang, Yujiu Yang, Yu Qiao, Ruihang Chu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27618 2026-07-27 cs.AI cs.CY cs.HC cs.LG cs.SI 版本更新 62%

Math Education Digital Shadows for Investigating Learning with GenAI: Mathematics Performance, Anxiety, and Confidence in LLMs

数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现

Naomi Esposito, Anthony Tricarico, Luisa Porzio, Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2606.17981 2026-07-27 cs.SE 版本更新 78%

Planning to Hammer: Difficulty-Aware Decomposition for Automating Rocq Proofs

规划锤击:面向自动化Rocq证明的难度感知分解

Ning Zhang, Nongyu Di, Zenan Li, Yuan Yao, Xiaoxing Ma

专题命中 代码与定理证明 :planning(title,abstract)

AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。

Comments 26 pages, 8 figures; submitted to OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2410.19738 2026-07-27 cs.AI cs.LO cs.PL 版本更新 79%

Integrating Reasoning Systems for Trustworthy AI, Proceedings of the 4th Workshop on Logic and Practice of Programming (LPOP)

用于可信人工智能的推理系统集成,第4届编程逻辑与实践研讨会(LPOP)会议录

Anil Nerode, Yanhong A. Liu

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 第4届编程逻辑与实践研讨会聚焦于可信人工智能的推理系统集成,将与第40届国际逻辑编程会议联合于2024年10月13日在美国达拉斯以混合形式举行,重点是集成不同编程模型与规则和约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21461 2026-07-27 cs.AI 版本更新 57%

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX:迈向深度研究的递归自我改进智能体

Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Jianlyu Chen, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京通用人工智能研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对深度研究中发现与验证答案的不对称性,提出递归自我改进智能体AREX。它通过内部研究与外部自我改进循环交替工作,学习自主上下文更新工具,经训练后在多个基准测试中显著优于同等规模基线,与参数更多模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13731 2026-07-27 cs.SC cs.LG 版本更新 57%

Breaking the Data Barrier in Learning Symbolic Computation: A Case Study on Variable Ordering Suggestion for Cylindrical Algebraic Decomposition

突破学习符号计算的数据障碍:变量顺序建议的圆柱代数分解案例研究

Rui-Juan Jing, Yuegang Zhao, Changbo Chen

机构 * School of Mathematical Sciences, Jiangsu University(江苏大学数学科学学院) Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究通过预训练和微调Transformer模型,改进了圆柱代数分解中变量顺序建议的效率,提升了符号计算的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08951 2026-07-27 cs.AI cs.CY 版本更新 57%

Analyzing the Ethical Logic of Eight Large Language Models

分析八个大语言模型的伦理逻辑

W. Russell Neuman, Chad Coleman, Manan Shah

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究分析OpenAI等八个大语言模型的伦理逻辑,通过让模型回答伦理原则问题和道德困境,用多种理论分析其回答,发现模型伦理判断趋同但在做决定意愿等方面有差异,还能增进对人工智能工作及增强人类伦理行为的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 6 篇

2505.02024 2026-07-27 cs.AI 版本更新 70%

From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent

从心智到机器:Manus AI作为完全自主数字代理的崛起

Minjie Shen, Yanshu Li, Lulu Chen, Zhichao Fan, Yanhang Li, Qikai Yang, Haochen Yang

机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Brown University(布朗大学计算机科学系) Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03534 2026-07-27 cs.CL cs.IR cs.LG 版本更新 62%

SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation

SURE-RAG:用于选择性检索增强生成的充分性和不确定性感知证据验证

Jingxi Qiu, Zeyu Han, Cheng Huang

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 研究选择性检索增强生成的证据充分性验证问题,提出SURE-RAG聚合协议,通过共享验证器生成局部关系分布并聚合为特征块,产生三向决策和可审计分数,实验表明其性能优于多种方法,还对比了与GPT-4o在不同任务上的表现。

Comments 8 pages, 2 figures, 8 tables. Submitted to IEEE PRAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12447 2026-07-27 cs.LG cs.AI 版本更新 62%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24668 2026-07-27 cs.CL cs.AI 版本更新 62%

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 62%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09678 2026-07-27 cs.CY cs.AI 版本更新 57%

Administrative Law's Fourth Settlement: AI and the Scrutable State

行政法的第四次 settlements:人工智能与能力-问责陷阱

Nicholas Caputo

机构 * University of Oxford(牛津大学) Oxford Martin AI Governance Initiative(牛津马丁人工智能治理倡议)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨行政法在人工智能时代如何摆脱能力与问责之间的困境,提出通过建立可审计的AI系统框架,提升政府透明度与问责机制。

Comments 87 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 2 篇

2604.15670 2026-07-27 cs.CV 版本更新 82%

PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

PixDLM:一种用于无人机推理分割的双路径多模态语言模型

Shuyan Ke, Yifan Mei, Changli Wu, Yonghan Zheng, Jiayi Ji, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。

Comments Accepted to CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14514 2026-07-27 cs.CV cs.AI 版本更新 57%

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 3 篇

2507.01551 2026-07-27 cs.LG cs.AI cs.CL 版本更新 67%

Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning

基于重新定义的逐步优势的自引导过程奖励优化用于过程强化学习

Wu Fei, Shuxian Liang, Yibo Yang, Yang Lin, Jing Tang, Lei Chen, Xiansheng Hua, Hao Kong

机构 * Terminus Group(Terminus集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对过程强化学习中引入奖励模型计算开销大且缺乏统一优势估计框架的问题,提出SPRO框架,通过从策略模型导出奖励及重新定义优势进行过程感知强化学习,实验显示其训练效率高、准确率提升且无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新 62%

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21453 2026-07-27 cs.LG 版本更新 57%

Test-Time Scaling via Error Localization

通过错误定位进行测试时缩放

Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究针对大型语言模型复杂任务性能提升问题,提出通过错误定位进行测试时缩放(TTEL)算法,利用反馈定位错误步骤,截断轨迹并分支新一代,重用有效前缀,在多个基准测试中优于竞争基线。

Comments 10 pages, 8 figures (With appendix: 27 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 3 篇

2508.05618 2026-07-27 cs.CL 版本更新 57%

Learning to Reason for Factuality

学习进行事实性推理

Xilun Chen, Ilia Kulikov, Vincent-Pierre Berges, Barlas Oğuz, Rulin Shao, Gargi Ghosh, Jason Weston, Wen-tau Yih

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18681 2026-07-27 cs.CV 版本更新 50%

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs

超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型

Jaeyeon Lee, Shunjie Wen, Dong-Wan Choi

机构 * Inha University(延世大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出SPARE方法,将令牌剪枝重构为子空间重建问题,通过迭代选择投影残差大的令牌进行剪枝,并引入反相关性机制保留上下文信息,在LLaVA上剪枝94%令牌仍保持95%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00368 2026-07-27 cs.DC 版本更新 50%

TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving

TENT:一种用于高性能和容错数据移动的声明式切片喷射引擎

Feng Ren, Ruoyu Qin, Teng Ma, Shangming Cai, Zheng Liu, Chao Lei, Dejiang Zhu, Ke Yang, Zheming Li, Jialei Cui, Weixiao Huang, Yikai Zhao, Yineng Zhang, Hao Wu, Xiang Gao, Yuhao Fu, Jinlei Jiang, Yongwei Wu, Mingxing Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TENT通过解耦传输意图与物理执行,统一异构互连技术为动态资源池,实现高效、容错的数据传输,提升LLM推理和RL流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 4 篇

2607.20491 2026-07-27 cs.AI cs.CL cs.LG 版本更新 67%

DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

DFAH-Bench:金融决策中可观测智能体不稳定性的基准测试

Raffi Khatchadourian

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究金融决策中智能体行为稳定性,引入DFAH-Bench基准,通过多渠道衡量。发现仅结果一致性不能完全反映稳定性,前沿模型存在决策与工具路径一致性差距,识别出三种行为模式,并开源相关代码和数据。

Comments 15 pages, 3 figures. Code, sanitized replay logs, one-command reproduction (make reproduce-paper), and an interactive results explorer: https://github.com/ibm-client-engineering/output-drift-financial-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10428 2026-07-27 cs.CL 版本更新 57%

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判

Jinglan Gong, Jiefan Lu, Hewei Guo, Kehan Li, Zhiyuan Han, Jihang Jiang, Wenwen Tong, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他推理 3 篇

2511.02130 2026-07-27 cs.AI cs.LG 版本更新 87%

Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning

Re-FORC:用于高效思维链推理的自适应奖励预测

Renos Zabounidis, Aditya Golatkar, Michael Kleinman, Alessandro Achille, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS智能代理部门) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI、cs.LG

AI总结 研究提出Re-FORC自适应奖励预测方法,通过在推理模型上训练轻量级适配器,实现早期停止无前景推理链、优化模型和思维长度选择以及自适应测试时缩放,有效提升推理效率和准确率。

Comments Accepted at ICML 2026; previously accepted as a non-archival paper at the Efficient Reasoning Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 67%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02770 2026-07-27 cs.CL cs.AI 版本更新 62%

Gemma 4 Technical Report

Gemma 4技术报告

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。

Comments 17 pages, 2 figures, technical report, updated

详情

展开后加载摘要…

URL PDF HTML 收藏