arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 92 篇

2605.27741 2026-05-28 cs.CL 77%

Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization

逃离语言先验:通过模态感知策略优化缓解音频推理中的后期模态崩溃

Cihan Xiao, Yiwen Shao, Chenxing Li, Xiang He, Zhenwen Liang, Steve Yves, Sanjeev Khudanpur, Liefeng Bo

机构 * Johns Hopkins University(约翰霍普金斯大学) Tencent Hunyuan(腾讯文言)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 针对多模态大语言模型在强化学习后训练中因统一策略梯度忽略模态依赖性而导致的后期模态崩溃问题,提出模态感知策略优化(MAPO)框架,通过模态相关性掩码和辅助注意力损失分支动态聚焦梯度并维持跨模态推理,在复杂音频推理基准上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27709 2026-05-28 cs.CL 77%

ReverseMath: Answer Inversion for Scalable and Verifiable Mathematical Problem Generation

ReverseMath: 面向可扩展和可验证数学问题生成的答案反转方法

Raoyuan Zhao, Yihong Liu, Yupei Du, Hinrich Schütze, Michael A. Hedderich

机构 * Center for Information and Language Processing(信息与语言处理中心) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心 (MCML)) Saarland University(萨尔兰州大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ReverseMath方法,通过反转原始问题的输入输出关系自动生成新数学问题,用于评估和训练,揭示记忆行为并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06511 2026-05-28 cs.LG 77%

EvoMAS: Evolutionary Generation of Multi-Agent Systems

EvoMAS:多智能体系统的进化生成

Yuntong Hu, Yuting Zhang, Matthew Trager, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出EvoMAS方法,将多智能体系统生成转化为结构化配置生成,通过进化算法在配置空间中优化,提升任务性能、可执行性和鲁棒性。

Comments ICML2026

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24941 2026-05-28 cs.LG 77%

Can Aha Moments Be Fake? Towards Quantifying Decorative and True Thinking in Chain-of-Thought

顿悟时刻可以是假的吗?——量化思维链中的装饰性思考与真实思考

Jiachen Zhao, Yiyou Sun, Weiyan Shi, Dawn Song

机构 * Northeastern University(东北大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出真实思考得分(TTS)量化思维链中每一步对最终答案的因果贡献,发现模型常混合真实思考与装饰性思考,并利用TTS实现有效剪枝与自训练,揭示前沿模型常表述未因果使用的推理步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00501 2026-05-28 cs.CV 75%

CPPO: Contrastive Perception Policy Optimization for VLM Agents

CPPO: 面向VLM智能体的对比感知策略优化

Ahmad Rezaei, Mohsen Gholami, Saeed Ranjbar Alvar, Kevin Cannons, Mohammad Asiful Hossain, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada Co. Ltd.(华为技术加拿大有限公司) Huawei Cloud(华为云)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出一种自监督的对比感知策略优化方法CPPO,通过对比感知损失增强视觉语言模型的视觉基础能力,无需额外模型或标注,在感知关键任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12586 2026-05-28 cs.AI 74%

Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models

能给我你的订单吗?扩散语言模型中插槽填充顺序的蒙特卡洛树搜索

Joshua Ong Jun Leang, Yu Zhao, Mihaela Cătălina Stoian, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

机构 * Imperial College London(帝国理工学院伦敦分校) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 针对掩码扩散模型(MDM)中计划-填充解码对插槽填充顺序敏感的问题,提出McDiffuSE框架,利用蒙特卡洛树搜索(MCTS)优化生成顺序,平均性能提升3.2%,在MBPP和MATH500上分别提升19.5%和4.9%。

Comments 8 pages, ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28487 2026-05-28 cs.AI cs.LG 73%

ProvMind: Provenance-grounded reasoning for materials synthesis

ProvMind:基于来源的材料合成推理

Yiming Zhang, Ryo Tamura, Koji Tsuda

机构 * Center for Basic Research on Materials, National Institute for Materials Science(材料基础研究センター,国家材料科学研究所) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出MatProcBench基准和ProvMind框架,通过来源图推理实现材料合成中的路线、条件和因果依赖优化,在双OOD分割上达到52.84%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28247 2026-05-28 cs.LG cs.AI 73%

IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

IRDS: 通过验证器耦合的稀疏自编码器覆盖实现可解释的RLVR数据选择

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六三研究所,南京)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出IRDS方法,基于稀疏自编码器簇和验证器耦合的覆盖目标,选择模型失败但可学习的RLVR训练实例,提升数学推理准确率并降低计算成本。

Comments 24 pages,3 figures,18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28120 2026-05-28 cs.CL cs.AI cs.MA 73%

LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning

LegalGraphRAG:面向可靠法律推理的多智能体图检索增强生成

Zerui Chen, Qinggang Zhang, Zhishang Xiang, Zhimin Wei, Linfeng Gao, Xiao Huang, Zhihong Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出LegalGraphRAG框架,通过分层法律图和多智能体系统(研究员、审计员、裁决员)实现可靠的法律推理,在准确性和可信度上超越现有GraphRAG基线。

Comments 30 pages, 18 figures, ACL 2026 Main Conference. Project page: https://github.com/XMUDeepLIT/LegalGraphRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27901 2026-05-28 cs.CL cs.AI 73%

The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

跨类型多样语言的思维链监控脆弱性

Eric Onyame, Runtao Zhou, Kowshik Thopalli, Bhavya Kailkhura, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过13种语言和7个前沿模型家族的评估,发现思维链监控在语言分布偏移下普遍不可靠(平均不可信率95.9%),模型会进行策略性操纵,且低资源语言中欺骗模式完全存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17003 2026-05-28 cs.CL cs.AI 73%

Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History

Persona2Web: 基于用户历史进行上下文推理的个性化Web智能体基准

Serin Kim, Sangam Lee, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(人工智能系,延世大学,首尔,大韩民国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Persona2Web基准,通过澄清-个性化原则评估Web智能体在真实开放网络中利用用户历史解决模糊查询的个性化能力,并引入推理感知评估框架。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17832 2026-05-28 cs.LG cs.AI cs.CR cs.CV 73%

MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks

MM-PoisonRAG:通过局部和全局投毒攻击破坏多模态RAG

Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel Kang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MM-PoisonRAG框架,通过局部投毒攻击(LPA)和全局投毒攻击(GPA)两种策略,系统研究多模态检索增强生成(RAG)在知识投毒下的脆弱性,实验表明攻击成功率高达56%且能绕过现有防御。

Comments Code is available at https://github.com/HyeonjeongHa/MM-PoisonRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06999 2026-05-28 cs.CV cs.CL cs.LG 73%

Learning Deliberately, Acting Intuitively: Unlocking Test-Time Reasoning in Multimodal LLMs

有意学习,直觉行动:解锁多模态大语言模型的测试时推理能力

Yahan Yu, Yuyang Dong, Masafumi Oyamada

机构 * Kyoto University(京都大学) Initial S NEC Corporation, Japan(日本NEC公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出D2I框架,通过训练时使用基于规则的格式奖励进行有意推理以增强模态对齐,推理时移除显式策略转为直觉推理,从而提升多模态大语言模型的推理能力,无需额外标注或复杂奖励。

Comments 22 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28705 2026-05-28 cs.LG 70%

Understanding Generalization and Forgetting in In-Context Continual Learning

理解上下文持续学习中的泛化与遗忘

Guangyu Li, Meng Ding, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University of Buffalo(布法罗大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出首个上下文持续学习理论框架,分析预训练Transformer在单提示中处理多序列任务时的泛化与遗忘行为,揭示注意力机制导致的干扰和偏差。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28433 2026-05-28 cs.CL 70%

Roles with Rails: Contract-Preserving Role Evolution in Multi-Agent Structured Reasoning

角色与轨道:多智能体结构化推理中保持契约的角色演化

Ling-Yue Ge, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SERO框架,通过契约保持的角色演化机制(信用引导检索、保护终端聚合器、条件验证器修复、上下文赌博机控制器)解决多智能体系统中角色漂移和契约破坏问题,在真实推理基准上验证有效性。

Comments 33 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28301 2026-05-28 cs.AI 70%

Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation

更高的准确率,更差的推理:医学思维链蒸馏的步骤级审计

Zhaoyang Jiang, Xuanqi Peng, Fei Teng, Zhizhong Fu, Yunsoo Kim, Jiacong Mi, Zicheng Li, Honghan Wu

机构 * School of Health & Wellbeing, University of Glasgow(健康与福祉学院,格拉斯哥大学) Department of Respiratory and Critical Care Medicine, Shanghai Sixth People’s Hospital, Shanghai Jiao Tong University School of Medicine(呼吸与危重医学科,上海第六人民医院,上海交通大学医学院) School of Life Science and Technology, University of Electronic Science and Technology of China(生命科学与技术学院,电子科技大学) Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过蒸馏大模型思维链训练小模型,发现医学问答中答案准确率提升但推理步骤的事实错误率上升,表明答案质量与推理真实性可能背道而驰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28063 2026-05-28 cs.SD cs.AI cs.MM 70%

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

自由文本提示的统一语音与声音合成

Yuyue Wang, Xihua Wang, Xin Cheng, Yijing Chen, Ruihua Song

机构 * Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出PlanAudio框架,利用大语言模型推理能力和语义潜在思维链机制,直接从自由文本生成包含语音和声音的统一音频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28047 2026-05-28 cs.CL 70%

Knowledge Dependency Estimation for Reliable Question Answering

面向可靠问答的知识依赖估计

Chaodong Tong, Qi Zhang, Nannan Sun, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) China Industrial Control Systems Cyber Emergency Response Team(中国工业控制系统网络应急响应团队)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出Knot方法,通过子集级反事实监督和潜在依赖因子覆盖建模,估计黑盒问答模型对不同知识单元的敏感性,以识别关键知识依赖。

Comments 12 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27764 2026-05-28 cs.CV cs.AI 70%

Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought

分割模型能理解世界吗?通过视觉思维链实现主动可供性推理

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SegWorld框架,通过多级视觉思维链在意图级指令下进行主动场景观察和可供性推理,实现从目标到部件的高效分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27570 2026-05-28 cs.AI 70%

LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation

LaneRoPE: 用于协同并行推理与生成的位置编码

Gabriele Cesa, Thomas Hehn, Aleix Torres-Camps, Àlex Batlle Casellas, Jordi Ros-Giralt, Arash Behboodi, Tribhuvanesh Orekondy

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出LaneRoPE方法,通过序列间注意力掩码和扩展的RoPE位置编码,使多个序列在生成时协同合作,提升数学推理任务在有限生成长度下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05897 2026-05-28 cs.CL 70%

Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models

停止奖励幻觉步骤:面向小型推理模型的忠实感知步骤级强化学习

Shuo Nie, Hexuan Deng, Chao Wang, Ruiyu Fang, Xuebo Liu, Shuangyong Song, Yu Li, Min Zhang, Xuelong Li

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(中国电信人工智能研究院) College of Integrated Circuits, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学集成电路学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对小型推理模型在中间推理步骤中容易产生忠实性幻觉的问题,提出忠实感知步骤级强化学习(FaithRL),通过过程奖励模型提供步骤级监督和隐式截断重采样策略,减少幻觉并提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08525 2026-05-28 cs.CL 70%

Which Heads Matter for Reasoning? RL-Guided KV Cache Compression

哪些注意力头对推理重要?RL引导的KV缓存压缩

Wenjie Du, Li Jiang, Keda Tao, Xue Liu, Huan Wang

机构 * Westlake University(西华大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究院) Zhejiang University(浙江大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德智能大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RLKV方法,利用强化学习识别对推理质量关键的注意力头,并对其保留完整KV缓存而对其他头进行激进压缩,实现20-60%缓存减少且性能近乎无损。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08311 2026-05-28 cs.SE cs.AI 70%

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28056 2026-05-28 cs.CV 67%

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

CogPortrait: 通过分层智能体规划实现肖像动画中的细粒度眼部区域控制

He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出CogPortrait两阶段框架,利用多模态大语言模型智能体从高层标签生成关键点,再通过DiT视频生成骨干合成动画,实现细粒度眼部控制,并引入EMH基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27960 2026-05-28 cs.CV 67%

Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

Mags-RL: 通过智能体强化学习为多模态大语言模型戴上放大镜以进行复杂场景推理

Xuanzhao Dong, Wenhui Zhu, Peijie Qiu, Xiwen Chen, Xiaobing Yu, Xin Li, Zhipeng Wang, Shao Tang, Gen Li, Yujian Xiong, Hao Wang, Yanxi Chen, Prayag Tiwari, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) Halmstad University(哈姆斯塔德大学) Florida State University(佛罗里达州立大学) Rice University(里士满大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出Mags-RL框架,通过智能体强化学习让多模态大语言模型调用超分辨率代理进行高分辨率细粒度检查,实现两轮推理以提升复杂场景下的视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27932 2026-05-28 cs.CV cs.AI cs.CL cs.CR cs.LG 67%

When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

当图文推理遇上安全:什么决定了多模态越狱鲁棒性?

Yuan Tian, Bing Hu, Fang Wu, Xiaomin Li, Binghang Lu, Neil Zhenqiang Gong

机构 * Independent Researcher(独立研究者) Stanford University(斯坦福大学) Harvard University(哈佛大学) Purdue University(普渡大学) Duke University(杜克大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。

Comments 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27773 2026-05-28 cs.CL cs.AI cs.LG 67%

Do Models Know Why They Changed Their Mind? Interpretability and Faithfulness of Chain-of-Thought Under Knowledge Conflict

模型是否知道它们为何改变主意?知识冲突下思维链的可解释性与忠实性

Pruthvinath Jeripity Venkata

机构 * Independent Researcher(独立研究员)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入内省忠实性,研究在知识冲突下语言模型的思维链推理是否忠实反映其决策机制,发现CoT高度稳定但置信度携带微弱真实信号。

Comments 12 pages, 8 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27564 2026-05-28 cs.CL cs.AI cs.LG 67%

The Future of Facts: Tracing the Factual Generation-Verification Gap

事实的未来:追踪事实生成-验证差距

Tim R. Davidson, Anja Surina, Caglar Gulcehre

机构 * EPFL(苏黎世联邦理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过训练阶段分析,发现语言模型在事实知识上存在生成-验证差距,验证能力先于生成能力习得且更稳健,事实更新可能导致模型处于“多宇宙”状态。

Comments Code for this project is available at https://github.com/anjasurina/factgap , blog post at https://www.trdavidson.com/fact-gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23282 2026-05-28 cs.CV cs.MM 67%

Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search

弥合姿态-语义鸿沟:基于文本的人物异常搜索的级联框架

Zequn Xie, Guijin Luo, Chuxin Wang, Sihang Cai, Tao Jin, Zhou Zhao, Yixuan Tang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出结构-语义解耦级联(SSDC)框架,通过两阶段检索(结构感知粗检索和多智能体语义验证)平衡效率与语义推理,在PAB基准上达到最优性能。

Comments Accepted to ACL 2026.10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11632 2026-05-28 cs.CV 67%

KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering

KG-ViP:在多模态大语言模型中桥接知识基础与视觉感知以进行视觉问答

Zhiyang Li, Ao Ke, Yukun Cao, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,中国科学技术大学) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出KG-ViP框架,通过检索与融合场景图和常识图,统一外部知识与细粒度视觉细节,缓解多模态大语言模型在视觉问答中的知识幻觉和视觉感知不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏