arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 863 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 863 篇

2601.18157 2026-07-07 cs.CV cs.LG 版本更新 70%

Agentic Very Long Video Understanding

智能体超长视频理解

Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim

机构 * Reality Labs Research at Meta(Meta 实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对智能眼镜等设备带来的长视频理解需求,以实体场景图为核心构建增强智能体框架EGAgent,实现结构化搜索、推理及跨模态能力,在相关数据集实验中取得较好表现。

Comments 29 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14095 2026-07-07 cs.AI cs.CR 版本更新 70%

NEST: Nascent Encoded Steganographic Thoughts

NEST:新生编码隐写思想

Artem Karpov

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 探讨模型在无害文本中隐藏秘密推理的隐写思维链,通过分类系统评估34个模型的隐写能力极限,测量相关指标并与基线比较,发现前沿模型无法联合推理嵌入,编码能力已达标,强调持续评估隐写风险的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15141 2026-07-07 cs.LG 版本更新 70%

CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning

CLEANER:自我净化轨迹助力智能强化学习

Tianshi Xu, Yuteng Chen, Meng Li

机构 * Peking University(北京大学) NTU, Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究参数受限模型探索阶段因执行失败产生噪声轨迹影响策略优化的问题,提出CLEANER,利用模型自我纠错能力净化轨迹,其SAAR机制提升平均准确率,减少训练步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05747 2026-07-07 cs.AI 版本更新 70%

CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization

CoT-X: 一种跨模型思维链迁移与优化的自适应框架

Ziqian Bi, Yinzhi Wang, Tianyang Wang, Junfeng Hao, Benji Peng, Wenqian Weng, Jiayi Gu, Jacqueline Pang, Xinyuan Song

机构 * Purdue University(普渡大学) Baruch College, City University of New York(纽约市立大学巴鲁克学院) The Ohio State University(俄亥俄州立大学) AI Agent Lab(AI Agent实验室) Appcubic Emory University(埃默里大学)

专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出自适应推理摘要框架,通过语义分割、预算感知压缩和连贯性重建,在减少token用量的同时保留关键推理步骤,实现跨模型高效CoT迁移,在7501道医学题上准确率提升40%,评估成本降低84%。

Comments TKDD 2025 minor revision version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20412 2026-07-07 cs.SE cs.AI cs.OS 版本更新 70%

kAgent: An execution-guided crash resolution agent for the Linux kernel

kAgent:一种用于Linux内核的执行引导式崩溃修复代理

Alex Mathai, Chenxi Huang, Suwei Ma, Jihwan Kim, Hailie Mitchell, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Junfeng Yang, Baishakhi Ray

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Google Inc.(谷歌公司) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对Linux内核崩溃修复难题,以内核开发者修复方式为灵感构建kAgent及支持工具栈,通过检查日志等步骤修复崩溃,消融特性定量分析,评估显示其能有效修复多种崩溃。

Comments Accepted to ICML, 2026; in the Deep Learning for Code Workshop. This paper was previously circulated as "CrashFixer"

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09045 2026-07-01 cs.AI cs.CR cs.SE 版本更新 70%

Containment Verification: AI Safety Guarantees Independent of Alignment

包含性验证:与对齐无关的AI安全保证

Royce Moon, Lav R. Varshney

机构 * AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出包含性验证,通过代理框架本身提供安全保证。通过前向模拟细化和Dafny机制化,证明了在模型类型动作边界内对所有AI输出的边界策略强制性,首次实现了代理框架的演绎形式验证。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03031 2026-07-01 cs.LG 版本更新 70%

Step-Level Sparse Autoencoder for Reasoning Process Interpretation

步骤级稀疏自编码器用于推理过程解释

Xuan Yang, Jiayu Liu, Yuhang Lai, Hao Xu, Zhenya Huang, Ning Miao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出步骤级稀疏自编码器(SSAE),通过条件稀疏化形成信息瓶颈,将推理步骤中的增量信息与背景信息分离为稀疏特征,用于解释大语言模型的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03401 2026-06-29 cs.HC cs.AI cs.CV 版本更新 70%

Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

LLMs能否进行注意力推理?多模态课堂行为的零样本分析

Nolan Platt, Sehrish Nizamani, Alp Tural, Elif Tural, Saad Nizamani, Andrew Katz, Yoonje Lee, Nada Basit

机构 * Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一个隐私保护的分析流程,利用OpenPose和Gaze-LLE提取学生注意力信息,并通过QwQ-32B-Reasoning进行零样本分析,探讨LLMs在多模态行为理解中的潜力与局限。

Comments 8 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04883 2026-06-24 cs.CL cs.LO 版本更新 70%

Optimizing the Cost-Quality Tradeoff of Agentic Theorem Provers in Lean

优化 Lean 中智能定理证明器的成本-质量权衡

Kári Rögnvaldsson, Chenhao Sun, Jasper Dekoninck, Martin Vechev

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种包含数据平面和控制平面的动作路由智能体,通过观察失败轨迹并估计成功概率与成本来动态决定继续证明或重新分解,在 PutnamBench 子集上平均降低 25.8% 成本且保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01482 2026-06-24 cs.AI 版本更新 70%

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

通过群体相对策略优化在结构因果模型中 grounding 多跳推理

Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13236 2026-06-23 cs.CL 版本更新 70%

IfcLLM: Natural Language Querying of IFC Models through Complementary Relational and Graph Representations

一种融合关系和图表示的IFC模型自然语言查询混合框架

Rabindra Lamsal, Sisi Zlatanova, Haowen Xu, Yafei Sun, Johnson Xuesong Shen

机构 * GRID Lab, School of Built Environment, The University of New South Wales(建筑环境学院,新南威尔士大学GRID实验室) School of Civil and Environmental Engineering, The University of New South Wales(土木与环境工程学院,新南威尔士大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出IfcLLM混合框架,通过关系和图表示结合迭代推理,提升非专家用户对IFC模型的自然语言查询能力,并支持常规BIM分析任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14145 2026-06-23 cs.CL cs.CV 版本更新 70%

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Bryan Catanzaro, Mohammad Shoeybi, Wei Ping

机构 * NVIDIA, USA(NVIDIA美国分公司) University of Maryland, College Park, USA(马里兰大学帕克分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。

Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20531 2026-06-19 cs.LO cs.LG 版本更新 70%

Pseudo-Formalization for Automatic Proof Verification

伪形式化用于自动证明验证

Slim Barkallah, Luke Bailey, Kaiyue Wen, Mohammed Abouzaid, Tengyu Ma

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种名为伪形式化的证明格式,该格式在保持自然语言灵活性的同时,保留了形式证明的模块性和精确性,通过块验证算法实现了对自然语言证明的高效验证,其在错误发现的精度和召回率上优于现有基线方法。

Comments 31 pages, code available at https://github.com/Slim205/pseudo-formalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07593 2026-06-19 cs.AI 版本更新 70%

Too long; didn't solve

太长;没解决

Lucía M. Cabrera, Isaac Saxton-Knight, Jocelyn D'Arcy

机构 * Instituto Balseiro(巴塞罗那研究所) Poindexter Labs(波因迪克斯实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提示长度和解答长度与大型语言模型在数学问题上的性能关系,发现两者与模型失败率正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12252 2026-06-19 cs.CV cs.CL 版本更新 70%

EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models

EndoCoT:扩散模型中的内生思维链推理扩展

Xuanlang Dai, Yujie Zhou, Long Xing, Jiazi Bu, Xilin Wei, Yuhong Liu, Beichen Zhang, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出EndoCoT框架,通过迭代思维引导模块激活MLLM的推理潜力,并利用终端思维接地模块确保推理轨迹与文本监督对齐,使DiT逐步执行复杂任务,在多个基准上平均准确率达92.1%。

Comments 23 pages, 18 figures, The code and dataset are publicly available at https://internlm.github.io/EndoCoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23248 2026-06-19 cs.AI 版本更新 70%

Mitigating Legibility Tax with Decoupled Prover-Verifier Games

通过解耦证明者-验证者游戏减轻可读性代价

Yegon Kim, Juho Lee

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出解耦证明者-验证者游戏(DPVG),通过分离正确性与可检查性训练一个翻译器模型,将固定求解器的解转化为可检查形式,在保持答案正确性的同时提高可检查性,解决了可读性代价问题。

Comments ICLR 2026 Workshop Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08939 2026-06-17 cs.AI 版本更新 70%

CausalT5k: Diagnosing Refusal and Failure Modes in Trustworthy Causal Reasoning Across Causal Rungs

CausalT5k: 诊断可信因果推理中的拒绝与失败模式——跨越因果阶梯

Longling Geng, Andy Ouyang, Theodore Wu, Daphne Barretto, Matthew John Hayes, Rachael Cooper, Yuqiao Zeng, Sameer Vijay, Gia Ancone, Ankit Rai, Matthew Wolfman, Patrick Flanagan, Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CTK基准,通过5,147个案例诊断大语言模型在因果推理中的失败模式,包括因果阶梯、陷阱类型、压力敏感性和拒绝质量等标注,揭示聚合准确率隐藏的缺陷。

Comments 12 pages, 17 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02881 2026-06-17 cs.SE cs.AI 版本更新 70%

Learning-Infused Formal Reasoning: From Contract Synthesis to Artifact Reuse and Formal Semantics

学习增强的形式化推理:从合约合成到工件复用和形式语义

Arshad Beg, Diarmuid O'Donoghue, Rosemary Monahan

机构 * Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出将形式化方法与人工智能融合的长期研究愿景,通过自动化合约合成、语义工件复用和精化理论,构建知识驱动的验证生态系统,加速未来保障。

Comments LNCS Proceedings Submitted Version. 17 pages. Accepted and presented at VERIFAI-2026: The Interplay between Artificial Intelligence and Software Verification LASER center, Villebrumier, France, March 8-11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00215 2026-06-17 cs.CV cs.CL 版本更新 70%

Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design

通过奖励设计解耦多模态大语言模型中的感知与推理

Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究多模态大模型中感知与推理的瓶颈,发现感知是主要约束,并通过奖励设计提升视觉基础推理,平均提升5.56分。

Comments 24 pages, 15 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01613 2026-06-16 cs.IR cs.AI cs.MA 版本更新 70%

TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning

TechGraphRAG:面向技术文献推理的智能图增强RAG框架

Kanwar Bharat Singh

机构 * Global Tire Intelligence and Solutions (GTIS)(全球轮胎智能与解决方案(GTIS)) The Goodyear Tire & Rubber Company(固特异轮胎与橡胶公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种13步自主流水线的智能检索增强生成框架,通过证据充分性评分、知识图谱遍历和自校正生成,支持领域特定技术文献推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03417 2026-06-16 cs.CR cs.AI 版本更新 70%

Parallel Test-Time Scaling with Multi-Sequence Verifiers

并行测试时扩展与多序列验证器

Yegon Kim, Seungyoo Lee, Chaeyun Jang, Hyungi Lee, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出多序列验证器(MSV),通过条件化候选集预测正确性,改善校准性,提升最佳选择准确率并实现早停策略,在数学推理任务中以不到一半延迟达到相同精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02028 2026-06-16 cs.AI 版本更新 70%

Edit Knowledge, Not Just Facts via Multi-Step Reasoning over Background Stories

编辑知识,而不仅仅是事实:基于背景故事的多步推理

Ya Gao, Kalle Kujanpää, Pekka Marttinen, Harri Valpola, Alexander Ilin

机构 * Aalto University(阿莱大学) Amazon.com(亚马逊公司) System 2 AI(系统2人工智能)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出将知识更新视为推理问题,通过背景故事引入新知识、自生成多跳问题训练和知识蒸馏,使模型在多步推理中灵活运用新信息。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05746 2026-06-16 cs.AI 版本更新 70%

DynaDebate: Breaking Homogeneity in Multi-Agent Debate with Dynamic Path Generation

DynaDebate: 通过动态路径生成打破多智能体辩论中的同质性

Zhenghao Li, Zhi Zheng, Wei Chen, Jielun Zhao, Yong Chen, Tong Xu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) North Automatic Control Technology Institute(北自动控制技术研究所) Shenzhen Institute for Advanced Study, UESTC(深圳先进研究 institute, 电子科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DynaDebate框架,通过动态路径生成、过程中心辩论和触发式验证机制,解决多智能体辩论中推理路径同质化问题,提升辩论效果。

Comments 19pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02274 2026-06-12 q-bio.QM cs.AI 版本更新 70%

Contextual Invertible World Models: A Neuro-Symbolic Agentic Framework for Colorectal Cancer Drug Response

上下文可逆世界模型:用于结直肠癌药物反应的神经符号智能框架

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang

机构 * School of Electronics, Electrical Engineering and Computer Science(电子工程与计算机科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出上下文可逆世界模型(CIWM),结合机器学习模拟器与大语言模型推理层,通过逆推理进行CRISPR扰动,揭示KRAS突变在5-氟尿嘧啶耐药中的主导作用及PIK3CA修复的意外效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06652 2026-06-12 cs.CV cs.AI 版本更新 70%

PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment

PaLMR: 通过多模态过程对齐实现忠实视觉推理

Yantao Li, Qiang Hui, Chenyang Yan, Kanzhi Cheng, Fang Zhao, Chao Tan, Huanling Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Data Science & Artificial Intelligence Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国unicom数据智能)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PaLMR框架,通过感知对齐数据层和过程对齐优化层,减少推理幻觉并提升视觉推理忠实度,在多个基准上取得最优结果。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-06-10 cs.CL 版本更新 70%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04852 2026-06-10 cs.AI cs.CV 版本更新 70%

Non-Parametric Structural Priors for Geometry Theorem Prediction

几何定理预测的非参数结构先验

Junbo Zhao, Ting Zhang, Can Li, Wei He, Jingdong Wang, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) Engineering Research Center of Intelligent Technology(智能技术与教育应用工程研究中心) Beijing Key Laboratory of Artificial Intelligence for Education, Beijing, China(北京人工智能教育重点实验室) Baidu, Beijing, China(百度)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对几何定理预测中参数模型泛化性差的问题,提出定理前驱图作为非参数结构先验,通过上下文学习实现无训练定理预测,在FormalGeo7k上达到89.29%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02240 2026-06-10 cs.CL 版本更新 70%

Lightweight Latent Reasoning for Narrative Tasks

面向叙事任务的轻量级潜在推理

Alexander Gurung, Esmeralda S. Whitammer, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) CIFAR Fellow

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02603 2026-06-10 cs.CL 版本更新 70%

CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency

CGES:面向高效准确自一致性的置信引导早停方法

Ehsan Aghazadeh, Ahmad Ghasemi, Hedyeh Beyhaghi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。

Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06114 2026-06-09 cs.AI 版本更新 70%

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

走向健康进化:探索人机交互在自我进化系统中的作用与机制

Dianxing Shi, Bowen Wang, Junqi He, Junhao Chen, Yuta Nakashima

机构 * The University of Osaka(大阪大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ANCHOR框架,通过模拟人类监督的反馈机制,在自我进化系统中缓解能力退化与安全漂移,实验表明有限监督可显著提升安全性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏