arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 832 篇

2607.20833 2026-07-30 cs.CL 版本更新 84%

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

REFACT:用于紧凑且忠实的思维链推理的自适应事实重述

Zhensheng Jin, Xin Dai, Zhenghao Liu, Chaojun Xiao, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究复杂任务中语言模型推理轨迹易偏离上下文的问题,提出REFACT自适应事实重述框架,经两阶段优化,实验证明其能提升长上下文问答等能力,减少令牌消耗,保留更多证据使推理轨迹更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14502 2026-07-24 cs.AI 版本更新 84%

From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI

从聊天机器人到数字同事:向持久自主人工智能的范式转变

Yongheng Zhang, Ziang Liu, Jiaxuan Zhu, Shuai Wang, Xiangqi Chen, Haojing Huang, Jiayi Kuang, Siyu Chen, Ao Shen, Hao Wu, Qiufeng Wang, Qian-Wen Zhang, Junnan Dong, Wenhao Jiang, Ying Shen, Hai-Tao Zheng, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM从聊天机器人向数字同事的范式转变,通过认知核心(思考型LLM)和工具增强任务执行(OpenClaw工作站系统)两个维度,实现持久工作、状态持久化、可重用技能和自改进能力。

Comments The paper is available on the project website: https://from-chatbot-to-digital-colleague.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29007 2026-07-21 cs.CL 版本更新 84%

Taxonomy-Targeted Error Generation for Quantitative Reasoning

错误作为透镜:通过合成误解生成探究LLM推理

Xinming Yang, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约市立大学皇后学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 84%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23129 2026-06-25 cs.LG 版本更新 84%

Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair

Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架

Aditya Kakade, Vivek Srivastava, Shirish Karande

机构 * TCS Research, India(印度TCS研究)

专题命中 推理与问题求解 :language model(title);small language model(title);分类 cs.LG

AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。

Comments Accepted to ACL 2026 (Findings). 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07774 2026-06-24 cs.IR cs.AI 版本更新 84%

GR2: Generative Reasoning Re-ranker

生成式推理重排序器

Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon

机构 * Meta AI

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05407 2026-06-15 cs.AI 版本更新 84%

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM: 感知与推理交错用于序列决策

Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

机构 * Institut National de la Recherche Scientifique (INRS)(国家科学研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过动态问答流水线紧密耦合视觉语言模型(VLM)和语言模型(LLM),实现任务驱动的感知,在ALFWorld和R2R基准上显著超越现有图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25171 2026-06-08 cs.CL 版本更新 84%

Re-defining Humor Data Objects for AI Humor Research

为AI幽默研究重新定义幽默数据对象

Anna Arnett, Bang Nguyen, Meng Jiang

机构 * Department of Computer Science and Engineering, University of Notre Dame(诺特大学计算机科学与工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究将幽默视为具有上下文和解释的社会互动,通过定义幽默推理数据对象并改进提示策略,使LLM生成更高质量的幽默解释,为AI幽默研究的数据合成与增强奠定基础。

Comments Added link to code and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18587 2026-08-11 cs.LG cs.AI stat.ML 版本更新 84%

An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning

面向大语言模型推理的强化学习的期望最大化视角

Tianbing Xu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出EM策略梯度(EMPG)框架,将大语言模型推理的强化学习转化为期望最大化问题,在简化优化流程的同时,在GSM8K、MATH Hard数据集上取得与GRPO相当或更优的性能,且能生成更简洁的结构化推理轨迹。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12519 2026-08-07 cs.CL cs.AI 版本更新 84%

Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models

通过可验证的推理过程监督获得正确答案:语言模型的可验证过程监督

Kyuyoung Kim, Kevin Wang, Yunfei Xie, Peiyang Xu, Peiyao Sheng, Chen Wei, Zhangyang Wang, Jinwoo Shin, Pramod Viswanath, Sewoong Oh

机构 * KAIST AI(KAIST人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Rice University(里士满大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Sentient Labs(Sentient实验室)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VPS框架,通过联合优化预测准确性和推理质量,在可验证领域使语言模型同时获得准确和可靠的推理能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06374 2026-08-05 cs.CL cs.LG 版本更新 84%

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

叠加的幻觉?语言模型中潜在思维的原理性分析

Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了连续链式思维(Latent CoT)中叠加现象的出现条件,发现仅从头训练的模型表现出叠加特性,而其他训练方式下模型倾向于使用捷径解法。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31693 2026-07-17 cs.IR cs.AI cs.CL 版本更新 84%

ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping

ShopX:面向智能购物中意图到商品实现的基础模型

Jiacheng Chen, Tao Zhang, Manxi Lin, Dunxian Huang, Teng Shi, Honghao Fu, Mengyan Li, Xinming Zhang, Chenchi Zhang, Xuan Lu, Xiaoxiong Du, Haibin Chen, Shaolin Ye, Hao Chang, Xiaoqi Li, Shuwen Xiao, Yujin Yuan, Jingxuan Feng, Shaopan Xiong, Huimin Yi, Ju Huang, Qiu Shen, Ying Chen, Junjun Zheng, Xiangheng Kong, Dan Ou, Haihong Tang, Yuning Jiang, Bo Zheng

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。

Comments The new version adds additional results and details

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09893 2026-06-23 cs.CL cs.AI 版本更新 84%

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

语言模型中的伪 deliberation:当推理无法使价值观与行动一致时

Sushrita Rakshit, Hanwen Zhang, Hua Shen

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。

Comments 9 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18957 2026-06-17 cs.CY cs.CL cs.LG cs.SI 版本更新 84%

Moderating Illicit Online Image Promotion for Unsafe User-Generated Content Games Using Large Vision-Language Models

使用大型视觉语言模型审核不安全的用户生成内容游戏中的非法在线图像推广

Keyan Guo, Ayush Utkarsh, Wenbo Ding, Isabelle Ondracek, Ziming Zhao, Guo Freeman, Nishant Vishwamitra, Hongxin Hu

机构 * University at Buffalo(布法罗大学) Northeastern University(东北大学) Clemson University(克莱姆森大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 针对社交媒体上非法推广不安全UGC游戏的图像,提出UGCG-Guard系统,利用大型视觉语言模型和条件提示策略实现零样本域适应,检测准确率达94%。

Comments In Proceedings of the 33rd USENIX Conference on Security Symposium (SEC '24), August 14-16, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13940 2026-06-16 cs.CL cs.AI 版本更新 84%

Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention

少即是多:用最小测试时干预提升大语言模型推理能力

Zhen Yang, Mingyang Zhang, Feng Chen, Ganggui Ding, Liang Hou, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Kuaishou Technology(快手科技) AIML(人工智能实验室) ZJU(浙江大学) Ant Group(蚂蚁集团) HKUST(香港科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中高计算成本问题,提出最小测试时干预(MTI)框架,通过仅在不确定位置应用分类器自由引导和轻量负提示引导,在保持高效的同时提升推理准确性和稳定性。

Comments Code: https://github.com/EnVision-Research/MTI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22954 2026-06-15 cs.CL cs.AI 版本更新 84%

Residual Context Diffusion Language Models

残差上下文扩散语言模型

Yuezhou Hu, Harman Singh, Monishwaran Maheswaran, Haocheng Xi, Coleman Hooper, Jintao Zhang, Aditya Tomar, Michael W. Mahoney, Sewon Min, Mehrdad Farajtabar, Kurt Keutzer, Amir Gholami, Chenfeng Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出残差上下文扩散(RCD)模块,通过回收丢弃令牌的上下文残差提高扩散语言模型的解码效率,在长/短CoT任务上以极少额外计算提升准确率4-11个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11074 2026-06-11 cs.CL cs.AI 版本更新 84%

Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models

建模复杂行为:视觉语言模型中的多人格组合与动态切换

Peiqi Jia, Haonan Jia, Ziqi Miao, Linkang Du, Yuntao Wang, Zhou Su

机构 * Xi'an Jiaotong University(西安交通大学) Beihang University(北京航空航天大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究在视觉语言模型中引入显式人格条件,建立包括单人格、多人格和人格切换的系统评估框架,发现人格提示可提升图像描述但损害精确推理任务,并观察到多特质组合与动态切换中的平衡与残留效应。

Comments 16 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10827 2026-06-17 cs.AI 版本更新 84%

Know Thy Reasoner: Not All Language Models Explore Alike

你的模型多样性,而非方法,决定推理策略

Moulik Choraria, Argyrios Gerogiannis, Anirban Das, Supriyo Chakraborty, Sourya Basu, Sambit Sahu, Lav R. Varshney

机构 * UIUC(伊利诺伊大学香槟分校) Capital One

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。

Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10694 2026-08-13 cs.LG cs.AI cs.CL cs.NE 版本更新 83%

Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimization

优化低成本部署强模型:面向进化优化的成本感知跨层迁移

Tal Oved, Roi Pony, Oshri Naparstek, Udi barzelay

机构 * IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出成本感知跨层迁移方法,解耦LLM角色,在低成本层级完成大部分搜索,跨层部署提示词,在多任务多模型上实现成本大幅降低且性能不劣于同层级优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14098 2026-08-13 cs.CV 版本更新 83%

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

ForgeryVCR: 通过高效的取证工具在MLLMs中实现视觉中心推理用于图像伪造检测与定位

Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 ForgeryVCR通过高效的取证工具实现视觉中心推理,提升图像伪造检测与定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01223 2026-07-21 cs.AI cs.CL cs.LG cs.LO cs.SE 版本更新 83%

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

Theoria: 非正式推理状态上的重写-可接受性验证

Michael Saldivar, Ben Slivinski

机构 * Independent Researchers(独立研究者)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Theoria验证架构,通过将候选解重写为带显式理由的序列化状态转换并验证变更完整性,在HLE-Verified Gold上以91.4%精确率认证105个问题,优于整体式LLM评判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23509 2026-07-21 cs.RO 版本更新 83%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14306 2026-06-26 cs.IR 版本更新 83%

Towards Recursive Self-Evolving Agentic Literature Retrieval

迈向自演化代理文献检索

Yuwen Du, Tian Jin, Jing Kang, Xianghe Pang, Jingyi Chai, Tingjia Miao, Fenyi Liu, WenHao Wang, Sikai Yao, Yuzhi Zhang, Siheng Chen

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出PaSaMaster系统,通过迭代意图分析、检索和排序,实现证据支持的文献推荐,解决传统关键词检索和生成式LLM的局限性,提升文献检索的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17301 2026-06-16 cs.CL cs.AI cs.HC cs.IR cs.LG 版本更新 83%

RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation

RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测

Juhyeon Lee, Wonduk Seo, Junseo Koh, Seunghyun Lee, Haihua Chen, Yi Bu

机构 * Peking University(北京大学) Enhans University of North Texas(北得克萨斯大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。

Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation

Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07316 2026-08-14 cs.MA cs.AI cs.DC 版本更新 83%

Certifiable Semantic Agreement Among LLM Agents: What the Admissibility Instrument Decides

面向拜占庭鲁棒的大语言模型智能体协作的分层认证语义承诺

Haoran Xu, Lei Zhang, Iadh Ounis, Xianbin Wang

机构 * University of Glasgow(格拉斯哥大学) University of Western Ontario(西部 Ontario 大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 提出H-CSC协议,将基于嵌入的终结性信号转换为三种类型输出(语义承诺、判决承诺或显式中止),实现大语言模型智能体拜占庭协作的最终性控制,在语义投毒和拜占庭攻击下保持低角度偏差和高中止率。

Comments 43 pages, 5 figures, 20 tables, 1 algorithm. Substantial revision: new title, new framing, new downstream-audit experiment; supersedes v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09096 2026-08-12 cs.CL 版本更新 83%

Evo-Bench: Can Language Models Improve Agent Harness?

Evo-Bench:语言模型能否改进智能体框架?

Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le, Yang Song, Wayne Xin Zhao, Tao Zhang

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究推出首个智能体框架进化基准Evo-Bench,评估语言模型的自主框架优化能力,发现其在通用、搜索任务中优于人工框架,在办公任务中表现不佳,且合成框架可迁移提升各类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20173 2026-08-12 cs.AI cs.SE 版本更新 83%

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

为生产大语言模型代理选择和组合运行时架构模式的方法

Vasundra Srinivasan

机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) Stanford School of Engineering(斯坦福大学工程学院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。

Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 83%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07796 2026-08-11 cs.CL 版本更新 83%

Thinking Is Not Telling: Information Disclosure in User-Service LLM Agents

思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果

Jiatong Li, Changdae Oh, Hyeong Kyu Choi, Jindong Wang, Sharon Li

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。

Comments 26 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 83%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 推理与问题求解 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏