arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-11 至 2026-08-11 共收录 319 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 30 篇

2608.07952 2026-08-11 cs.LG cs.AI cs.CR cs.SE 新提交 62%

Persistent Semantic Entities in Tool-Augmented LLM Systems

工具增强型大语言模型系统中的持久语义实体

Zhaohui Wang

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 该研究定义工具增强型LLM系统的持久语义实体(PSEs),证实其在24款不同规模模型中普遍存在,偏好/指令污染难自校正,上下文隔离自验证可降低污染,为智能体系统安全提供关键发现。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version; 32 pages . The openreview url is https://openreview.net/forum?id=zPjmtawzT8&noteId=CXB95ws5so and ICML poster url is https://icml.cc/virtual/2026/poster/60521

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-11 cs.AI cs.LG 版本更新 62%

Emergence Invariance: From Symbolized Thought to Structural Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

Comments 51 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30345 2026-08-11 cs.LG cs.AI 版本更新 62%

DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练

Haisen Luo, Yiwei Liu, Haoning Wang, Dan Liu, Junxi Yin, Haotian Wang, Lei Zhang, Xiaoyu Tian, Shuaiting Chen, Yuansheng Song, Baoyan Guo, Xiongfei Yan, Bolan Yang, Chengwei Liu, Ming Cui, Jiong Chen

机构 * Tsinghua University(清华大学) ENS Paris-Saclay(巴黎-萨克雷大学) Beike Language and Intelligence(贝克语言与智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06211 2026-08-11 cs.CL cs.AI eess.AS 版本更新 62%

LF${}^{2}$AR: Accounting for Layerwise Dynamics to Improve Multimodal Adaptation of Language Models

LF²AR:考虑分层动态以改进语言模型的多模态适配

Santiago Cuervo, Adel Moumen, Yanis Labrak, Sameer Khurana, Antoine Laurent, Mickael Rouvier, Phil Woodland, Ricard Marxer

机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) Department of Engineering, University of Cambridge, UK(剑桥大学工程系) Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) LIA, Avignon Université, France(法国阿维尼翁大学LIA) LIUM, Le Mans Université, France(法国勒芒大学LIUM) Zenidoc, Marseille, France(法国马赛Zenidoc)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交 57%

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09253 2026-08-11 cs.AI 新提交 57%

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09044 2026-08-11 cs.CL 新提交 57%

Tree-of-Experience: Hierarchical Experience Management for Self-Evolving Agents

经验树:面向自我进化智能体的分层经验管理

Zihao Deng, Yining Zhu, Leiming Wang, Jingfei Lu, Junbo Wang, Chuncheng Ran, Yu Yang, Dixuan Yang, Jikun Shen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出经验树(ToE)框架,将经验组织与LLM智能体分层推理对齐,在“24点游戏”和“金融进化基准”上大幅提升了解题性能与效率,解决了现有经验表示与推理过程脱节的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08569 2026-08-11 cs.AI cs.SD 新提交 57%

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Meituan(美团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08219 2026-08-11 cs.CV cs.AI 新提交 57%

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:面向视频异常检测的可视化工具编排

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) School of Digital Media & Design Art(数字媒体与设计艺术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07978 2026-08-11 cs.SE cs.AI 新提交 57%

Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计

Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。

Comments 20 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13884 2026-08-11 cs.AI 版本更新 57%

Experience Memory Graph: One-Shot Error Correction for Agents

经验记忆图:智能体的一次性错误纠正

Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体在复杂任务中易出错且难恢复的问题,提出经验记忆图框架,将失败恢复转化为图匹配问题,训练时提取相关子图和路径存储,测试时指导智能体,实验证明其性能优于现有基线且无需测试时反复试验。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 57%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17902 2026-08-11 cs.AI cs.MA cs.SE physics.chem-ph 版本更新 57%

El Agente Gráfico: A Semantic Execution Runtime for Scientific Agents

图形代理:用于科学代理的结构化执行图

Jiaru Bai, Abdulrahman Aldossary, Thomas Swanick, Marcel Müller, Yeonghun Kang, Changhyeok Choi, Naruki Yoshikawa, Zijian Zhang, Jin Won Lee, Tsz Wai Ko, Aiwei Yin, Mohammad Ghazi Vakili, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02927 2026-08-11 cs.CV cs.AI 57%

PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding

PrismVAU: 用于多模态视频异常理解的提示优化推理系统

Iñaki Erregue, Kamal Nasrollahi, Sergio Escalera

机构 * Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Aalborg University(奥胡斯大学) Milestone Systems(Milestone系统)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 PrismVAU通过轻量级系统和自动提示工程实现高效的多模态视频异常理解,无需复杂标注和外部模块。

Comments This paper has been accepted to the 6th Workshop on Real-World Surveillance: Applications and Challenges (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08497 2026-08-11 cs.HC cs.MA cs.SI 新提交 50%

SocialFiVis: A Visual Analytics Sandbox for LLM-Grounded Multi-Agent Simulation in Social Finance

SocialFiVis:面向社会金融中基于大语言模型的多智能体模拟的可视分析沙箱

Yi-Fan Cao, Qing Shi, Liangwei Wang, Leo Yu-Ho Lo, Lin Chen, Yuzi Han, Yang Wang, Kani Chen

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究提出嵌入IAD框架的可视分析沙箱SocialFiVis,结合LLM与PRA引擎模拟多智能体,支持探索社会金融领域反事实政策并解释相关涌现现象。

Comments 11 pages, 7 figures, 2 tables. Accepted to IEEE VIS 2026; to appear in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08413 2026-08-11 cs.SE 新提交 50%

Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications

Tangent:基于大语言模型的智能体应用测试实践的实证研究

Rangeet Pan, Tyler Stennett, Divya Sankar, Bridget McGinn, Alessandro Orso, Raju Pavuluri, Saurabh Sinha, Maja Vukovic

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Tangent通过对开源项目和行业从业者的研究,分析了LLM智能体应用的测试现状,发现其以单元测试为主、存在覆盖不足等问题,并提出了相关研究方向。

Comments Accepted at ASE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23065 2026-08-11 cs.HC 版本更新 50%

Touching or Chatting: The Utility of LLMs and Tactile Charts for Learning about Complex Chart Types by BLV Individuals

触摸还是聊天:大语言模型和触觉图表对视力障碍者学习复杂图表类型的效用

Tingying He, Maggie McCracken, Daniel Hajas, Sarah Creem-Regehr, Alexander Lex

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究探讨大语言模型对视力障碍者图表类型学习的影响及触觉学习的作用,通过扩展触觉图表学习工具并比较两种学习形式,发现触觉模板有助于形成心理模型,利于后续数据探索,无触觉支持的文本加LLM解释在空间推理任务中有弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16623 2026-08-11 cs.NE 版本更新 50%

How to Build Marcus's Algebraic Mind: From Minsky's Emotion-Machine Viewpoint

如何构建马库斯的代数思维:从明斯基的情感机器视角出发

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文从明斯基的《情感机器》视角解读VaCoAl架构,探讨如何构建马库斯的代数思维。通过精确可逆性实现内省,将思考分三层,还承载泛类比和信用分配观点,有助于提升到内省层次并找到交叉点,为构建代数思维提供新视角。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16573 2026-08-11 cs.NE 版本更新 50%

How to Build Marcus's Algebraic Mind: From Thagard's Brain--Mind Viewpoint

如何构建马库斯的代数思维:从萨伽德的脑-心观点出发

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究从萨伽德的脑-心观点出发,探讨如何构建马库斯的代数思维。提出VaCoAl和PyVaCoAl架构,其绑定操作具有可逆等特性,能填补马库斯代数思维组件空缺,消除卷积退化,还通过相关主张阐述了能力、必要性及自身立场。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 83 篇

2608.08640 2026-08-11 cs.AI 新提交 89%

SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests

SkillReason:面向隐式用户请求的推理增强型智能体技能检索

Donghong Jiang, Endian Lin, Luoping Cui, Hanqing Liu, Mingjie Liu, Fan Yang, Hong Wang, Zhao Yang, Chuang Zhu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09666 2026-08-11 cs.AI 新提交 86%

Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

开放评估智能体:视觉生成模型的高效且可提示的评估

Shulin Tian, Ziqi Huang, Fan Zhang, Hongyuan Zhu, Yu Qiao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Agency for Science, Technology and Research (A*STAR)(科学、技术与研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出Evaluation Agent框架及基于其构建的Open-EA,可高效评估视觉生成模型,将评估时间减至传统方法的10%,还通过EA-CoT-10K和EA-3B减少对专有骨干的依赖,验证了其在多基准及跨家族的有效性。

Comments Journal extension of our ACL 2025 paper (arXiv:2412.09645). 12 pages. Code: https://github.com/Vchitect/Evaluation-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07621 2026-08-11 cs.AI cs.CV cs.RO 新提交 85%

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

CMU-Drive与V2V-VLA:具备推理能力的协同多智能体统一驾驶基准及车对车视觉-语言-动作模型

Hsu-kuang Chiu, Stephen F. Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出协同多智能体统一驾驶基准CMU-Drive及车对车视觉-语言-动作模型V2V-VLA,解决现有VLA模型缺乏协同能力的问题,构建了协同自动驾驶研究的首个基准并将相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24210 2026-08-11 cs.CL cs.AI 版本更新 84%

From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves

从泄露思维到私有推理:控制LRM对自己说的话

Haritz Puerto, Haonan Li, Xudong Han, Timothy Baldwin, Iryna Gurevych

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大型推理模型(LRM)推理过程中隐私泄露问题,提出通过指令跟随(IF)训练和分阶段解码策略(Staged Decoding)增强隐私保护,在IF和隐私基准上分别提升高达20.9和51.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22016 2026-08-11 cs.LG cs.AI cs.CL 版本更新 83%

ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention

ROM:通过流式检测和干预实时抑制过度思考

Xinyan Wang, Xiaogeng Liu, Ming Pei, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract_cn);self-correction(abstract)

AI总结 ROM通过流式检测和干预框架减少大推理模型的过度思考,提升准确率并缩短响应长度,在多个数据集上均取得显著效果。

Comments Code is available at https://github.com/SaFo-Lab/ROM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09072 2026-08-11 cs.SE cs.AI 新提交 83%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28590 2026-08-11 cs.AI 版本更新 83%

MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

MonitorBench: 一个用于大型语言模型链式思维可监控性的综合基准

Han Wang, Yifan Sun, Brian Ko, Mann Talati, Jiawen Gong, Zimeng Li, Naicheng Yu, Xucheng Yu, Wei Shen, Vedant Jolly, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出MonitorBench,通过1514个测试实例和两种压力测试设置,评估LLM链式思维的可监控性,发现决策关键因素对中间推理过程的影响程度影响可监控性,更高级的LLM表现出更低的可监控性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08910 2026-08-11 cs.CL 版本更新 83%

SciTaRC: A Plan-Annotated Scientific Tabular QA Benchmark for Language Reasoning and Complex Computation

SciTaRC:基于科学表格数据的问答基准测试,需语言推理与复杂计算

Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai, Rongkun Zhou, Elina Baral, Philipp Koehn

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 SciTaRC是一个针对科学表格数据的问答基准测试,揭示了现有AI模型在语言推理和复杂计算任务上的不足。

Comments COLM 2026 (Conference on Language Modeling). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09432 2026-08-11 cs.CL cs.AI 新提交 82%

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现

Róisín Luo

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09888 2026-08-11 cs.NE cs.AI cs.LG stat.ML 新提交 81%

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

BDH-CQ:结合循环潜态推理的上下文学习

Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出BDH-CQ模型,结合上下文学习与循环潜态推理,在ARC-AGI-1评估集上实现高成本效率,突破了该基准的成本-准确率帕累托前沿。

Comments https://github.com/pathwaycom/arc-task-gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08447 2026-08-11 cs.CL cs.AI 新提交 81%

Hidden Language Consistency Phenomena in Reasoning LLMs

推理大语言模型中的隐藏语言一致性现象

Muhammad Ali Shafique, Kelly Marchisio

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究以PolyMath基准测试集探究推理模型的语言一致性,发现难度提升会导致多语言模型输出语言一致性骤降,量化对一致性的影响独立于准确率,多语言能力需结合准确率、一致性与难度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏