arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2608.07838 2026-08-11 cs.AI 新提交 86%

Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge

针对异构知识下大语言模型事实一致性与顺序鲁棒接地推理的反事实基准测试与训练

Shibo Chu, Yuze Liu, Tiehua Zhang, Zhishu Shen, Lianghua He, Haofen Wang, Zhijun Ding

机构 * Tongji University(同济大学) Swinburne University of Technology(斯威本科技大学) Wuhan University of Technology(武汉理工大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究构建异构知识下LLM事实一致性基准TKFQA,提出训练框架ORLF,可提升LLM的推理与顺序鲁棒性,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00417 2026-08-11 cs.AI 版本更新 86%

SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs

SymboUQ:面向大语言模型空间推理的符号化不确定性量化框架

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SymboUQ是面向LLMs空间推理的符号化不确定性量化框架,通过区分可符号性与语义确定性,整合三类分数估计最终答案可靠性,在五个空间推理基准的四个冻结LLM骨干上,使AUROC相对提升约8%、Brier损失相对降低7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06574 2026-08-11 cs.LG 版本更新 86%

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

跳过一层还是循环它?学习LLM中的层程序

Ziyue Li, Yang Li, Tianyi Zhou

机构 * Ziyue Li, Yang Li, Tianyi Zhou(李子悦、李阳、周天毅)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PoLar方法,通过轻量级预测网络学习为每个输入动态跳过或重复预训练层,在数学推理任务上以更少层数提升准确率。

Comments Accepted at ICML 2026. Substantially extends arXiv:2507.07996. Updated DART-Math experiments by removing duplicate examples; conclusions remain unchanged. Code: https://github.com/tianyi-lab/PoLar

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06741 2026-08-10 cs.LG cs.GT 新提交 86%

Solver-Guided Reasoning for Mixed-Equilibrium Strategies

求解器引导的混合策略均衡推理

Han Wang, Philippe Beardsell, Boning Li, Aaron Sasmita, Shuai Li, Hongyuan Zha, Baoxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) GTO Wizard Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出混合策略决策树(MDT),用求解器输出引导LLM在博弈中的均衡推理,在无限制德州扑克8种LLM配置下,将与均衡的L1距离降低52.6%,且策略可移植性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18519 2026-08-07 cs.RO cs.AI 版本更新 86%

As You Wish: Mission Planning with Formal Verification using LLMs in Precision Agriculture

如您所愿:利用LLM在精准农业中进行形式化验证的任务规划

Marcos Abel Zuzuárregui, Stefano Carpin

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。

Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05004 2026-08-06 cs.CL 新提交 86%

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02805 2026-08-05 cs.CV cs.AI 新提交 86%

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation

用于DeepLesion检测、分割及简短报告生成的统一二维框架

Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究开发了一个整合LLM推理、病变检测、分割及报告生成的统一二维框架,在DeepLesion数据集上取得了各项指标提升,解决了其分割难题并开源了相关资源。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00747 2026-08-05 cs.RO cs.AI cs.CR cs.MA 版本更新 86%

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

当提示控制机器人时:多智能体机器人系统中的提示注入攻击

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02422 2026-08-04 cs.CR cs.AI 新提交 86%

Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning

基于数字孪生增强多尺度规划的智能体事件响应

Yiran Gao, Tao Li, Kim Hammar

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有智能体事件响应方法的局限,提出结合决策论规划与LLM的多尺度方法,经实验验证可显著缩短恢复时间、提升恢复率。

Comments 31st European Symposium on Research in Computer Security (ESORICS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06423 2026-08-04 cs.CL 版本更新 86%

On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation

在想象之翼上:用于幽默标题生成的冲突脚本多角色框架

Wenbo Shang, Yuxi Sun, Jing Ma, Xin Huang

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。

Comments Paper published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27130 2026-07-30 cs.AI 新提交 86%

AgentMap: Joint Equivalence and Subsumption Discovery for Ontology Matching

AgentMap:用于本体匹配的联合等价与包含关系发现

Yiping Song, Jiaoyan Chen, Renate Schmidt, Hui Yang, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26588 2026-07-30 cs.AI 新提交 86%

Eco3S: Complex Socio-Economic System Simulation via Agent-Based Models

Eco3S:基于智能体模型的复杂社会经济系统仿真

Shaopeng Wei, Yufei Cheng, Wenxi Sun, Yepeng Ding, Yu Zhao, Gang Kou

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Eco3S是面向经济研究与政策分析的社会经济系统仿真框架,通过三种关键机制解决现有LLM-based ABM的挑战,经多场景实验验证其有效性、可扩展性与通用性。

Comments 18 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24492 2026-07-28 cs.CL 新提交 86%

SINT-Flow: Schema Integration using Large Language Model Workflows

SINT-Flow:使用大语言模型工作流进行模式集成

Keti Korini, Christian Bizer

机构 * University of Mannheim(曼海姆大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出SINT-Flow框架,由五个基于大语言模型的算子组成工作流,用于全自动端到端模式集成,能处理非规范化源表。通过SINT-Bench基准评估,在多种任务上取得高F1分数,消融研究证明了策略和审查循环的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22954 2026-07-28 cs.CL stat.AP 新提交 86%

Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

迈向电子健康记录中文档不一致性的自动检测

Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

机构 * Duke University(杜克大学) Columbia University Medical Center(哥伦比亚大学医学中心) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22591 2026-07-28 cs.AI cs.MA 新提交 86%

Lexical discovery in unknown environments orchestrated by Large Language Models

由大语言模型编排的未知环境中的词汇发现

Rafael Sendra-Arranz, Iñaki Dellibarda Varela, Eduardo Rocon, Álvaro Gutiérrez, Manuel Cebrian

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 针对未知环境中智能体需开发共享词汇的问题,提出神经符号词汇发现框架,让基于大语言模型的智能体群体进行指称博弈自组织词汇表,通过语义锚定扩展人类词汇,模拟达成共识并表征收敛动态,为自主探索预部署规划迈出第一步。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06278 2026-07-28 cs.AI 版本更新 86%

TableMind: An Autonomous Programmatic Agent for Tool-Augmented Table Reasoning

TableMind: 一种用于工具增强表格推理的自主程序化代理

Chuang Jiang, Mingyue Cheng, Xiaoyu Tao, Qingyang Mao, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 TableMind通过两阶段训练策略提升表格推理能力,实现自主程序化代理的高效推理与代码生成。

Comments Comments: 10 pages, 6 figures. Submitted to WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11358 2026-07-14 cs.CL 新提交 86%

RefineEvo: Planning-Guided Heuristic Evolution with Bidirectional Experience

RefineEvo:基于双向经验的规划引导启发式进化

Yang Wu, Junran Pan, Yifan Zhang, Ning Xu, Fanshuo Zeng, Jian Cheng

机构 * C$^2$DL, Institute of Automation, Chinese Academy of Sciences(C2DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing(人工智能学院,中国科学院大学,北京) University of Chinese Academy of Sciences, Nanjing(中国科学院大学,南京)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对自动启发式设计中基于LLM方法的不足,提出RefineEvo框架,通过规划器和反射器,结合双向经验池动态调度进化算子,在经典组合优化基准测试中表现出色,提升了解质量和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09839 2026-07-14 cs.AI cs.CV cs.HC 新提交 86%

Exploring Agentic Workflows for Generating High Quality Math Visual Aids

探索用于生成高质量数学视觉辅助工具的智能工作流程

Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院) Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对中学数学图表可靠生成难的问题,引入智能工作流程,让 LLM 智能体评估并迭代改进生成的视觉效果,通过探索性评估确定改进关键领域,初步证明可提高 AI 生成数学图表的可靠性和教育价值。

Comments 13 pages, 9 figures. Exploratory course project on agentic workflows for generating and evaluating K 12 mathematical diagrams

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12265 2026-07-09 cs.CL 版本更新 86%

Fast, Slow, and Tool-augmented Thinking for LLMs: A Review

大语言模型的快速、慢速和工具增强思维:综述

Xinda Jia, Jinpeng Li, Zezhong Wang, Jingjing Li, Xingshan Zeng, Yasheng Wang, Weinan Zhang, Yong Yu, Weiwen Liu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学机械工程学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) Huawei Technologies Co., Ltd., Beijing 100084, China(华为技术有限公司) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学系统工程与工程管理系) Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学计算机科学与工程系) Huawei Hong Kong Research Center, Hong Kong 999077, China(华为香港研究中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述大语言模型推理进展,基于认知心理学提出LLM推理策略分类法,沿快速/慢速、内部/外部两个知识边界分类,系统调查相关工作并依关键因素归类方法,指出其面临的挑战与未来方向。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-51673-0}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31285 2026-07-03 cs.AI 新提交 86%

Spatial Reasoning via Modality Switching Between Language and Symbolic Representation

通过语言与符号表示之间的模态切换进行空间推理

Shreya Rajpal, Tanawan Premsri, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多跳文本空间故事中,将语言推理切换到几何感知模态(如布局或网格)能否提升推理性能,并提出基于可信度和复杂度的切换指标,实现原则性模态选择,使LLM性能提升高达42%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29354 2026-06-30 cs.AI cs.NE 86%

When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning

当大语言模型发展语言:用于高效多智能体推理的符号通信

Zhengqi Pei, Qingming Huang, Shuhui Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CLSR框架,让多个LLM智能体自主发明和演化紧凑符号语言,通过路由器自适应选择以优化准确率与token成本的权衡,在保持准确率的同时将推理token数减少3-6倍。

Comments ICML2026 Regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03269 2026-06-29 cs.AI 版本更新 86%

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

从LLM中蒸馏答案集编程规则用于神经符号视觉问答

Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) Jönköping University(约克灵厄普大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01969 2026-06-26 cs.CL cs.IR 版本更新 86%

Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models

正交层次分解:面向结构感知的大语言模型表格理解

Bin Cao, Huixian Lu, Chenwen Ma, Ting Wang, Ruizhe Li, Jing Fan

机构 * Zhejiang University of Technology, China(浙江工业大学,中国) Zhejiang Key Laboratory of Visual Information Intelligent Processing, China(浙江视觉信息智能处理重点实验室,中国) University of Aberdeen, UK(爱丁堡大学,英国)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 针对复杂表格中多级表头、合并单元格等结构导致大语言模型理解困难的问题,提出正交层次分解(OHD)框架,通过空间-语义联合约束的正交树归纳方法将不规则表格分解为列树和行树,并设计双路径关联协议重构单元格语义,在AITQA和HiTab基准上优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21228 2026-06-24 cs.LG 新提交 86%

Sakana Fugu Technical Report

Sakana Fugu 技术报告

Yujin Tang, Edoardo Cetin, Jinglue Xu, Qi Sun, Stefan Nielsen, Vincent Richard, Haruto Goda, Iaroslav Tymchenko, Nhan Nguyen, Hyunin Lee, Mari Ashiga, Shashank Kotyan, So Kuroki, Tarin Clanuwat

机构 * Sakana AI

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Fugu系列协调模型,通过动态代理框架组合多个LLM专长,在多项基准上达到最优性能,并描述其训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17070 2026-06-24 cs.RO cs.AI 版本更新 86%

MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems

MuTRAP: 攻击机器人任务规划系统的多触发器木马

Mohaiminul Al Nahian, Zainab Altaweel, David Reitano, Sabbir Ahmed, Shiqi Zhang, Adnan Siraj Rakin

机构 * Binghamton University (SUNY)(宾夕法尼亚州立大学布林顿分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出首个针对LLM辅助机器人任务规划器的多触发器木马攻击MuTRAP,通过少量任务特定参数注入后门,并优化触发器词以激活特定恶意行为,揭示当前基于LLM的规划器的安全漏洞。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交 86%

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23107 2026-06-23 cs.CL 新提交 86%

A Dual-Track Framework for Template-Constrained LaTeX Conversion

双轨框架:模板约束下的LaTeX转换

Chung Cheuk Hei, Liu Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出双轨框架,通过离线提取模板约束与在线混合执行,将LLM用于推理密集型任务、规则引擎处理确定性任务,在7个模板和56篇论文上实现更高结构保真度和编译成功率。

Comments 6 pages (excluding references), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21470 2026-06-23 cs.RO cs.CV cs.LG 新提交 86%

ASCII Art Turns LLMs into VLA Controllers

ASCII艺术将LLMs转化为VLA控制器

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17648 2026-06-17 cs.AI 新提交 86%

From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

从酝酿到解析:追踪LLM中代码推理的内部生命周期

Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学) Guangzhou College of Technology and Business(广州工商学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16152 2026-06-16 cs.AI 新提交 86%

The Quality-Utility Paradox: Why High-Reward Data Impairs Small Model Mathematical Reasoning

质量-效用悖论:为什么高奖励数据会损害小模型的数学推理

Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :SLM(summary_cn,abstract);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 发现数学推理蒸馏中的质量-效用悖论:Oracle精炼的高奖励数据因分布漂移增加适应成本,反而不如SLM自生成数据;提出风格对齐精炼方法恢复效用。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏