arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 14 篇

2605.23771 2026-05-25 cs.CV cs.AI cs.MA 77%

PhotoFlow: Agentic 3D Virtual Photography Missions

PhotoFlow: 智能体式3D虚拟摄影任务

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出PhotoFlow智能体框架,通过导演-评审-反思闭环搜索机制,在任意Blender场景中根据语言指令自动完成虚拟摄影,并引入VPhotoBench基准,实验表明其在外观质量对齐和成功率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23751 2026-05-25 cs.LG 70%

Approaching I/O-optimality for Approximate Attention

逼近近似注意力的I/O最优性

Pál András Papp, Aleksandros Sobczyk, Anastasios Zouzias

机构 * Computing Systems Lab(计算系统实验室) Huawei Technologies(华为技术)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对大语言模型中的注意力机制,提出一种基于近似注意力框架的I/O高效算法,使得I/O开销在大多数参数范围内几乎线性依赖于n,并证明其接近I/O最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23559 2026-05-25 cs.CV cs.AI 70%

PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA

PathNavigate: 一种无需训练的病理学代理,具有惊喜引导扫描和共享幻灯片记忆用于全切片图像VQA

Chunze Yang, Qidong Liu, Wenjie Zhao, Yue Tang, Jiusong Ge, Di Zhang, Jiashuai Liu, Lei Wu, Junbo Lu, Ni Zhang, Xian Wu, Zeyu Gao, Chen Li

机构 * School of Comp. Science & Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Tencent Jarvis Lab(腾讯Jarvis实验室) University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PathNavigate,一种无需训练的病理学代理,通过惊喜引导扫描和共享幻灯片记忆,在严格检查预算下高效定位证据并回答临床查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23258 2026-05-25 cs.LG 70%

A Simple Plug-in for Improving Eviction-Based KV Cache Compression

一种改进基于驱逐的KV缓存压缩的简单插件

Yuping Lin, Jiayuan Ding, Yue Xing, Pengfei He, Jiliang Tang, Subhabrata Mukherjee

机构 * Michigan State University(密歇根州立大学) Hippocratic AI(希波克拉底AI)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出VECTOR插件,通过引入保留、近似和驱逐的三路路由机制,利用可重构性信号恢复有价值信息,改善中高压缩率下的质量-内存权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23067 2026-05-25 cs.CL 70%

What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA

训练数据教会RL记忆体代理什么:记忆增强问答中课程效应的实证研究

Xinjie He, Zhiyuan Lin, Su Liu, Jialun Wu, Qiyang Xie, Weikai Zhou, Shuai Xiao

机构 * Columbia University(哥伦比亚大学) Independent Researcher(独立研究者) Johns Hopkins University(约翰霍普金斯大学) Northeastern University(东北大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过控制实验,研究训练课程(领域内、混合、领域外)对强化学习记忆体代理在记忆增强问答中的技能获取和专业化影响,发现课程组成作为专业化的细粒度杠杆,混合课程在整体F1上最优,而窄领域外课程可转移特定技能(如时间推理),并报告了将GRPO适配到单GPU环境的实用经验。

Comments 14 pages, 2 figures, 11 tables. Code, checkpoints, and evaluation artifacts available at https://github.com/EvaxHe/rl-memory-curriculum

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22850 2026-05-25 cs.DC cs.AI 70%

ObjectCache: Layerwise Object-Storage Retrieval for KV Cache Reuse

ObjectCache: 用于KV缓存重用的分层对象存储检索

Yu Zhu, Aditya Dhakal, Yunming Xiao, Dejan Milojicic, Gustavo Alonso

机构 * ETH Zurich(苏黎世联邦理工学院) HPE Labs(惠普实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ObjectCache系统,利用S3兼容对象存储存储KV缓存,通过协同设计存储协议和传输调度,在GPU消费顺序下交付数据,重叠数据传输与计算,从而在不增加集群成本的前提下最小化TTFT延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22884 2026-05-25 cs.LG cs.AI 62%

Tensor Cache: Eviction-conditioned Associative Memory for Transformers

Tensor Cache: 基于驱逐条件的Transformer联想记忆

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) IBM Research, Cambridge, MA, USA(IBM研究院) University of Toronto, Toronto, Canada(多伦多大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Tensor Cache,一种双层缓存结构,将滑动窗口注意力作为L1缓存,将窗口驱逐的KV对压缩为外积快速权重记忆作为L2缓存,通过门控融合和端到端训练,在有限状态基线中提升记忆-质量边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22872 2026-05-25 cs.LG cs.AI cs.CV 62%

MedExpMem: Adapting Experience Memory for Differential Diagnosis

MedExpMem:适应经验记忆用于鉴别诊断

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Yannian Gu, Winnie Chiu Wing Chu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MedExpMem经验记忆框架,通过存储和利用诊断失败中的判别经验,增强医学视觉语言模型的鉴别诊断能力,在放射学基准上最高提升7.0%准确率。

Comments MICCAI 2026 Early Accept. Submission Version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 35 篇

2605.23091 2026-05-25 cs.SE cs.AI cs.CR 92%

Security of LLM-generated Code: A Comparative Analysis

LLM生成代码的安全性:一项比较分析

Srivathsan G Morkonda, Mahmoud Selim, Hala Assal

机构 * Carleton University(卡尔顿大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过模拟开发者使用LLM生成代码的行为,评估了七种流行LLM生成代码的安全性,发现所有模型均生成包含漏洞的代码,且多数为严重或高危漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22976 2026-05-25 cs.SE cs.AI 92%

LLM Code Smells: A Taxonomy and Detection Approach

LLM 代码异味:分类与检测方法

Zacharie Chenail-Larcher, Brahim Mahmoudi, Naouel Moha, Quentin Stiévenart, Florent Avellaneda

机构 * École de technologie supérieure Université du Québec à Montréal

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出并完善了LLM代码异味的概念,构建了包含9种异味的分类体系,开发了静态检测工具SpecDetect4LLM,并在692个开源项目中验证了其检测效果(精确率91.3%,召回率71.8%),发现73.5%的项目存在此类异味。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06840 2026-05-25 cs.AI 92%

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning

从LLM推理轨迹中提取搜索树揭示短视规划

Sixing Chen, Ji-An Li, Saner Cakir, Sinan Akcali, Kayla Lee, Marcelo G. Mattar

机构 * Generality Inc.(Generality公司)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过从四子棋游戏推理轨迹中提取搜索树并拟合计算模型,发现LLM的规划是短视的,其决策主要由浅层节点驱动,而非深层搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19167 2026-05-25 cs.CL 90%

Evaluating Counterfactual Strategic Reasoning in Large Language Models

评估大型语言模型中的反事实策略推理

Dimitrios Georgousis, Maria Lymperaiou, Angeliki Dimitriou, Giorgos Filandrianos, Giorgos Stamou

机构 * National Technical University of Athens(希腊雅典国家技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过引入反事实变体(改变收益结构和行动标签)的囚徒困境和石头剪刀布博弈,评估大型语言模型的策略表现是否基于真正的推理而非记忆模式,并揭示其在激励敏感性、结构泛化和反事实环境中的策略推理方面的局限性。

Comments Accepted at GEM@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21851 2026-05-25 cs.LG cs.AI 90%

OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

OPPO: 用于LLM推理中令牌级信用分配的贝叶斯价值递归

Yu Li, Rui Miao, Tian Lan, Zhengling Qi

机构 * George Washington University(乔治华盛顿大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出OPPO方法,通过贝叶斯更新累积轨迹级成功概率,实现无需价值网络的令牌级优势估计,在数学、科学和代码推理基准上优于GRPO、DAPO和SDPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22870 2026-05-25 cs.LG cs.AI cs.CL 90%

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

读出捷径:位置数字复制主导小语言模型中的算术思维链读出

Ming Liu

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过前缀补全实验,发现小语言模型在算术思维链中主要依赖位置捷径(复制答案分隔符前的最后一个数字),而非逻辑推理,并分析了不同模型的行为差异。

Comments 18 pages (8 main + 10 appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22826 2026-05-25 cs.CL cs.AI cs.GT cs.MA 90%

Evaluating Large Language Models in a Complex Hidden Role Game

评估大型语言模型在复杂隐藏角色游戏中的表现

Niklas Bauer

机构 * University of Göttingen(哥廷根大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过社交推理游戏《秘密希特勒》评估大型语言模型的推理、说服和欺骗能力,引入新指标并发现当前模型在复杂多轮操纵中效果不佳。

Comments Master's thesis, University of Göttingen

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05472 2026-05-25 cs.AI 89%

ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation

ALIVE: 通过对抗学习和指导性语言评估唤醒LLM推理

Yiwen Duan, Jing Ye, Xinpei Zhao

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ALIVE框架,通过对抗学习与指导性语言反馈替代标量奖励,使模型内化推理逻辑,在数学、代码和逻辑推理任务中提升准确率、跨域泛化与自我修正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19858 2026-05-25 cs.CL 88%

Benchmarking Gaslighting Attacks Against Speech Large Language Models

针对语音大语言模型的气灯攻击基准测试

Jinyang Wu, Bin Zhu, Xiandong Zou, Qiquan Zhang, Xu Fang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) Tongyi Speech Lab(通义语音实验室) Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出五种气灯攻击策略(愤怒、认知干扰、讽刺、隐晦、专业否定),在5个语音和多模态大语言模型上测试,发现平均准确率下降24.3%,揭示语音模型的行为脆弱性。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23414 2026-05-25 cs.AI cs.LG 88%

When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems

当计划正确执行却失败时:基于LLM的多智能体系统的认知校准

Zehao Wang, Shilong Jin, Zhao Cao, Lanjun Wang

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学智能与计算学院) School of New Media and Communication, Tianjin University, Tianjin, China(天津大学新媒体与传播学院) Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对基于LLM的多智能体系统中因认知误校准导致计划失败的问题,提出认知计划校准代理工作流(EPC-AW),通过信息一致性计划选择和一致性引导的认知状态细化,平均提升系统成功率9.75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23384 2026-05-25 cs.CL cs.AI 88%

Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals

元认知作为奖励:通过知识和调节信号强化LLM推理

Sirui Chen, Lei Xu, Yuying Zhao, Yutian Chen, Yu Wang, Beier Zhu, Hanwang Zhang, Shengjie Zhao, Chaochao Lu

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) EPFL(苏黎世联邦理工学院) Wuhan University(武汉大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出元认知奖励(MaR)框架,利用元认知知识和调节信号作为过程奖励,提升LLM推理质量,在22个基准上平均提升7.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23574 2026-05-25 cs.LG cs.SE 85%

Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents

推动你的智能体:在长周期LLM智能体中测量和强制实现定量目标持续性

Yuandao Cai, Yuzhang Zhu, Liyou Gao, Wensheng Tang, Shengchao Qin

机构 * Independent Researcher(独立研究者) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);language agent(abstract);分类 cs.LG

AI总结 提出PushBench基准,通过状态追踪检索控制器和积压追踪工作单元控制器,测量和提升长周期语言智能体在定量目标持续性(QGP)上的表现,防止重复提交和虚假完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23023 2026-05-25 cs.MA cs.HC 85%

How to Steer Your Multi-Agent System: Human-LLM Collaborative Planning

如何操控你的多智能体系统:人-大语言模型协作规划

Zeyu He, Hannah Kim, Dan Zhang, Estevam Hruschka

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 本文通过定义人-大语言模型协同规划的设计空间(模式、范围、层次),并实现原型AMBIPOM支持过程级监督,结合用户研究和基准测试揭示了混合工作流与权衡,为更透明、可控、有效的人机协同规划提供设计洞见。

Comments ACM Conference on AI and Agentic Systems (CAIS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23315 2026-05-25 cs.CL cs.AI 84%

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

没有理解的趋同:当语言模型在表示上一致但在推理上分歧时

Muhammad Usama, Dong Eui Chang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析16个语言模型在800个推理问题上的表示相似性,发现模型在表示上趋同但推理策略不同,表明表示趋同反映的是共享的输入处理约束而非共享的推理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15224 2026-05-25 cs.CV cs.CL 83%

PROGRESSLM: Towards Progress Reasoning in Vision-Language Models

PROGRESSLM: 迈向视觉-语言模型中的进度推理

Jianshu Zhang, Chengxuan Qian, Haosen Sun, Haoran Lu, Dingcheng Wang, Letian Xue, Han Liu

机构 * Northwestern University(西北大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出Progress-Bench基准和ProgressLM-3B模型,通过两阶段进度推理范式,评估并提升视觉-语言模型从部分观测中推断任务进度的能力。

Comments ACL 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23861 2026-05-25 cs.LG cs.AI cs.CV 81%

Leveraging Foundation Models for Causal Generative Modeling

利用基础模型进行因果生成建模

Aneesh Komanduri, Xintao Wu

机构 * University of Arkansas(亚拉巴马大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FM-CGM框架,通过预训练基础模型实现零样本因果发现、干预和反事实生成,并引入因果语义引导机制确保忠实反事实图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23270 2026-05-25 cs.CV cs.AI cs.RO 79%

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

ChainFlow-VLA: 基于视觉语言模型的因果流规划

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

机构 * Afari Intelligent Drive(阿法瑞智能驾驶) Tianjin University(天津大学) University of Macau(澳门大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出ChainFlow-VLA框架,通过自回归生成因果轨迹模式与扩散残差校正的统一概率模型,结合视觉语言模型语义先验,实现自动驾驶中鲁棒的轨迹规划,在NAVSIM v1排行榜上达到94.85分,匹配人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23116 2026-05-25 cs.CV cs.AI 77%

CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection

CoReVAD: 一种无需训练的视频异常检测上下文推理框架

Hyeongmuk Lim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国釜山大学工业工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出CoReVAD框架,利用单一冻结视觉语言模型直接生成异常分数和时间描述,通过局部响应清洗和全局时序上下文精炼实现无需训练的视频异常检测,在UCF-Crime和XD-Violence数据集上取得竞争性能并提供可解释解释。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12787 2026-05-25 cs.AI cs.MA 77%

Ax-Prover: A Deep Reasoning Agentic Framework for Theorem Proving in Mathematics and Quantum Physics

Ax-Prover:用于数学和量子物理定理证明的深度推理智能体框架

Benjamin Breen, Marco Del Tredici, Jacob McCarran, Javier Aspuru Mijares, Weichen Winston Yin, Kfir Sulimany, Jacob M. Taylor, Frank H. L. Koppens, Dirk Englund

机构 * Axiomatic_AI(公理人工智能) Massachusetts Institute of Technology (MIT)(麻省理工学院) Institut de Ciències Fotòniques (ICFO)(光子科学研究所) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究与高等学院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出多智能体系统Ax-Prover,通过将大语言模型与Lean工具结合,实现跨科学领域的自动化定理证明,并在抽象代数和量子理论新基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23636 2026-05-25 eess.SY cs.SY 75%

RF Instrument Agent (RFIA): Empowering RF Instruments with Natural Language Understanding, Scheduling and Execution of Complex Tasks

RF仪器智能体 (RFIA): 赋予射频仪器自然语言理解、调度与执行复杂任务的能力

Chunhui Li, Wei Fan

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language agent(abstract)

AI总结 提出RFIA框架,通过解耦意图-规划-执行架构和结构化知识库,实现基于自然语言的可靠射频仪器控制,并在商用矢量网络分析仪上验证了多任务自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20201 2026-05-25 cs.CL cs.AI cs.LG 75%

Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning

基于代理思维链调优的长上下文推理

Miao Li, Irina Saparina, Alexander Gurung, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ProxyCoT训练框架,通过将短代理上下文中的推理能力迁移到完整长上下文中,以提升大语言模型在长上下文复杂推理任务上的表现。

Comments Long paper, ACL 2026 (Main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23897 2026-05-25 cs.CV cs.AI cs.CL 73%

ETCHR: Editing To Clarify and Harness Reasoning

ETCHR: 通过编辑来澄清和利用推理

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。

Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR

详情

展开后加载摘要…

URL PDF HTML 收藏