arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 358 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 66 篇

2606.04974 2026-06-04 cs.CL 83%

SAID: Accelerating Diffusion-Based Language Models via Scaffold-Aware Iterative Decoding

SAID: 通过支架感知迭代解码加速基于扩散的语言模型

Na Li, Chengda Wang, Mingju Gao, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出SAID框架,通过将去噪计算重新分配给支架令牌来加速扩散语言模型,并引入CHLG为低置信度令牌分配额外步骤,在LLaDA模型上实现最高9.1倍加速且保持竞争性能。

Comments Code: https://github.com/TH-AI-Lab-PKU/SAID

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19852 2026-06-04 cs.CL 83%

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

工具总是有益的吗?学习自适应调用工具以实现双模式多模态大语言模型推理

Qinghe Ma, Zhen Zhao, Yiming Wu, Jian Zhang, Lei Bai, Yinghuan Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AutoTool模型,通过强化学习框架自适应决定是否调用工具,结合双模式推理策略和模式特定奖励函数,在提升准确率的同时降低推理开销。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05025 2026-06-04 cs.LG cs.AI 82%

Invariant Gradient Alignment for Robust Reasoning Distillation

不变梯度对齐用于鲁棒推理蒸馏

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学) FLock.io

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出不变梯度对齐(IGA)框架,通过逻辑同构集、连续梯度冲突掩码和截断SVD投影,对齐不同语义域但逻辑结构相同的梯度更新,提升大语言模型在分布外输入上的鲁棒性。

Comments 30 Pages

Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05009 2026-06-04 cs.CL cs.AI 82%

DAR: Deontic Reasoning with Agentic Harnesses

DAR: 基于智能体框架的道义推理

Guangyao Dou, William Jurayj, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出DAR框架,通过让模型按需与法规交互来提升基于LLM的道义推理能力,实验表明智能体框架可提升性能但存在非均匀改进和弱模型数值任务退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19921 2026-06-04 cs.CL cs.AI 82%

Demystifying Multi-Agent Debate: The Role of Confidence and Diversity

揭秘多智能体辩论:置信度与多样性的作用

Xiaochen Zhu, Caiqi Zhang, Yizhou Chi, Tom Stafford, Nigel Collier, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) University of Sheffield(谢菲尔德大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多智能体辩论(MAD)在提升大语言模型性能时效果不佳的问题,提出多样性感知初始化和置信度调节辩论协议两种轻量级干预方法,显著提升辩论有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08647 2026-06-04 cs.CL cs.AI 82%

Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression

推理路径作为输入仍然有效吗?将后推理与思维链压缩连接起来

Chengzhengxu Li, Xiaoming Liu, Zhaohan Zhang, Shengchao Liu, Guoxin Ma, Yu Lan, Cong Wang, Chao Shen

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Queen Mary University of London(伦敦大学玛丽女王学院) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出后推理范式,通过将思维链作为上下文输入来简化推理任务,并设计UCoT框架训练轻量级压缩器生成软令牌形式的上下文思维链,从而在保持推理能力的同时显著压缩输出长度。

Comments ACL 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04236 2026-06-04 cs.CL cs.AI cs.LG 82%

Supportive Token Revealing for Fast Diffusion Language Model Decoding

支持性标记揭示:快速扩散语言模型解码

Giries Abu Ayoub, Mario Barbara, Lluís Pastor-Pérez, Tanja Bien, Aneesh Barthakur, Alaa Maalouf, Loay Mualem

机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) IMPRS-IS

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AXON模块,通过选择注意力、不确定性和置信度信号中的锚点标记来改善扩散语言模型并行解码的质量-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04592 2026-06-04 cs.CY cs.AI cs.HC 81%

Synthetic Personalities: How Well Can LLMs Mimic Individual Respondents Using Socio-Economic Microdata?

合成人格:LLM 如何使用社会经济微观数据模仿个体受访者?

Leonard Kinzinger, Jochen Hartmann

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract);分类 cs.AI

AI总结 研究利用德国社会经济面板数据构建个体级数字孪生,通过评估不同构建方法(模型、信息深度、嵌入方式、推理模式)对200万以上孪生响应的准确性,发现信息深度在75%熵分位数达到成本效益帕累托点,最佳单元准确率达78.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04454 2026-06-04 cs.CL 81%

Stepwise Reasoning Enhancement for LLMs via External Subgraph Generation

通过外部子图生成增强大语言模型的逐步推理

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出SGR框架,通过从知识图谱生成查询相关子图来引导大语言模型进行逐步推理,提升复杂多步推理的准确性、鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03303 2026-06-04 cs.AI 81%

LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks

LEAP:利用智能体框架增强形式化数学的大语言模型

Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出LEAP智能体框架,通过分解问题、与Lean编译器交互及自我优化,使通用大模型在形式化定理证明上达到最先进性能,并在Putnam竞赛和Lean-IMO-Bench上超越专业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29928 2026-06-04 cs.HC cs.AI 81%

Label Over Logic? How Source Cues Bias Human Fallacy Judgments More Than LLMs

标签胜过逻辑?源标签如何比LLMs更严重地偏差人类的谬误判断

Mahjabin Nahar, Nafis Irtiza Tripto, Aiping Xiong, Ting-Hao 'Kenneth' Huang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 通过在线实验和LLM对比,发现人类在评估逻辑谬误时显著受到内容源标签(如人类、AI等)的影响,而LLM评估相对稳定,表明源标签偏差主要是人类的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20233 2026-06-04 cs.CL 81%

REFLEX: Self-Refining Explainable Fact-Checking via Verdict-Anchored Style Control

REFLEX: 通过裁决锚定风格控制实现自我精炼的可解释事实核查

Chuyi Kong, Wei Gao, Jing Ma, Hongzhan Lin, Yuxi Sun

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出REFLEX方法,利用自我分歧的真实性信号构建引导向量,以裁决锚定风格控制实现自我精炼的事实核查,仅需465个样本即达最优性能。

Comments 29 pages

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03956 2026-06-04 cs.MA cs.CL 81%

Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems

使用约束引导的多智能体系统解决斑马谜题

Shmuel Berman, Kathleen McKeown, Baishakhi Ray

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种多智能体系统ZPS,结合大语言模型与定理证明器,通过分解问题、生成SMT代码和智能体间反馈,显著提升复杂逻辑谜题的解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05106 2026-06-04 cs.CL cs.AI cs.CY 81%

Arithmetic Pedagogy for Language Models

语言模型的算术教学法

Andhika Bernard Lumbantobing, Hokky Situngkir

机构 * Bandung Fe Institute & Adjunct Science Fellow in InaAI(巴旦格Fe研究所及InaAI兼职科学研究员) AI Research Center IT Del & Bandung Fe Institute(IT Del人工智能研究中心及巴旦格Fe研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 借鉴人类数学教学法,通过将GASING方法操作化为链式思维监督训练小规模GPT-2模型,使其在算术推理上达到高准确率并展现出联想式心算能力。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07036 2026-06-04 cs.CL cs.AI cs.LG 80%

Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers

Mid-Think: 通过词元级触发器实现无需训练的中间预算推理

Wang Yang, Debargha Ganguly, Xinpeng Li, Chaoda Song, Shouren Wang, Vikash Singh, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析注意力机制和提示实验,发现推理行为主要由少量触发词元控制,并据此提出Mid-Think方法,通过组合触发词元实现中间预算推理,在准确率-长度权衡上优于基线,并能在强化学习训练中减少时间并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11214 2026-06-04 cs.CL 79%

T$^\star$: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning

T$^\star$:通过轨迹感知强化学习实现掩码扩散语言模型的渐进块缩放

Hanchen Xia, Baoyou Chen, Yutang Ge, Guojiang Zhao, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) School of Mathematical Sciences(数学科学学院) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 提出T$^\star$方法,利用基于TraceRL的训练课程,在掩码扩散语言模型中渐进增大块大小,实现高并行解码且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05277 2026-06-04 cs.CV cs.AI 79%

From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models

从片段到场景:自动驾驶中基于视觉语言模型的时间理解

Kevin Cannons, Saeed Ranjbar Alvar, Mohammad Asiful Hossain, Ahmad Rezaei, Mohsen Gholami, Alireza Heidarikhazaei, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04632 2026-06-04 cs.LG cs.CL 79%

VentAgent: When LLMs Learn to Breathe -- Multi-Objective Arbitration for ARDS Ventilation

VentAgent:当大语言模型学会呼吸——ARDS通气的多目标仲裁

Teqi Hao, Yuxuan Fu, Xiaoyu Tan, Shaojie Shi, Bohao Lv, Yinghui Xu, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出VentAgent分层框架,利用大语言模型作为透明仲裁者,通过感知-规划-编排三阶段将机械通气控制转化为动态多目标仲裁过程,在生理模拟器上优于强化学习和经典控制基线,并提供可解释的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28829 2026-06-04 cs.CL cs.AI cs.CY 79%

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

Aryabhata 2:扩展强化学习以提升高级STEM推理能力

Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

机构 * PhysicsWallah

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aryabhata 2,一个通过强化学习后训练在竞争性STEM考试中提升推理能力的语言模型,在JEE、NEET等基准上超越基础模型且输出token减少高达64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04944 2026-06-04 cs.CL cs.AI 79%

Inclusion-of-Thoughts: Mitigating Preference Instability via Purifying the Decision Space

包含思维:通过净化决策空间缓解偏好不稳定性

Mohammad Reza Ghasemi Madani, Soyeon Caren Han, Shuo Yang, Jey Han Lau

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出包含思维(IoT)策略,通过逐步自过滤干扰选项来重构多选题,从而稳定模型偏好并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04691 2026-06-04 cs.CL 77%

SMADE-IE: Sparse Multi-Agent Framework with Evidence-Driven Debate for Zero-Shot Information Extraction

SMADE-IE: 基于证据驱动辩论的稀疏多智能体框架用于零样本信息抽取

Kenfeng Huang, Yi Cai, Xin Wu, Zikun Deng, Li Yuan

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出SMADE-IE稀疏多智能体框架,通过自适应模式选择器和证据驱动辩论机制,在零样本信息抽取中减少冗余交互并提升性能。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14054 2026-06-04 cs.AI cs.CV 77%

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。

Comments Accepted by ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13272 2026-06-04 cs.CL 77%

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation

超越正确性:在检索增强生成中奖励忠实推理

Zhichao Xu, Zongyu Wu, Yun Zhou, Aosong Feng, Kang Zhou, Sangmin Woo, Kiran Ramnath, Yijun Tian, Xuan Qi, Weikang Qiu, Lin Lee Cheong, Haibo Ding

机构 * AWS AI Fundamental Research(AWS人工智能基础研究) The Pennsylvania State University(宾夕法尼亚州立大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出VERITAS框架,通过细粒度轮次级忠实性奖励强化学习,提升检索增强生成中推理步骤的忠实性,同时改善任务性能。

Comments TMLR Camera Ready Update

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17956 2026-06-04 cs.CL 77%

Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments

在跨语言和多语言环境中更好地理解程序思维推理

Patomporn Payoungkhamdee, Pume Tuchinda, Jinheon Baek, Samuel Cahyawijaya, Can Udomcharoenchaikit, Potsawee Manakul, Peerat Limkonchotiwat, Ekapol Chuangsuwanich, Sarana Nutanong

机构 * School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) KAIST(韩国科学技术院) Cohere SCB 10X AI Singapore(AI新加坡) Department of Computer Engineering, Chulalongkorn University(朱拉隆梭大学计算机工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 通过分离推理与代码执行,提出评估程序思维提示的框架,发现微调显著提升多语言推理能力,且推理质量与答案准确性强相关。

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05145 2026-06-04 cs.LG cs.AI cs.CL 75%

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

失败推理轨迹告诉你什么是可修复的(但仅凭阅读它们不行)

Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) CHU Sainte-Justine(圣约斯特医院)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过失败推理轨迹的分布特征而非文本内容来识别可修复的失败,并设计无训练的路由规则提升测试时干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04378 2026-06-04 cs.CL 74%

DLLG: Dynamic Logit-Level Gating of LLM Experts

DLLG: 大语言模型专家的动态logit级门控

Bingnan Li, Zhaoyang Zhang, Xiaoze Liu, Yantao Shen, Shuli Jiang, Shuo Yang, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL

AI总结 提出DLLG框架,通过轻量级门控模块学习token级专家融合权重,利用稀疏的响应级监督实现动态logit级集成,无需token级标签或专家重训练,在推理和代码基准上优于路由、启发式集成和参数合并方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01672 2026-06-04 cs.CL 74%

Adaptive Information Control for Search-Augmented LLM Reasoning

面向搜索增强型大语言模型推理的自适应信息控制

Siheng Xiong, Oguzhan Gungordu, James C. Kerce, Faramarz Fekri

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL

AI总结 提出基于信息效用的自适应控制框架DeepControl,通过控制检索的广度与分辨率,提升搜索增强推理的性能与训练稳定性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04661 2026-06-04 cs.CL cs.LG 73%

CRAFT: Cost-aware Refinement And Front-aware Tuning of Prompts

CRAFT: 成本感知的提示精炼与前沿感知的调优

Shanu Kumar, Shubhanshu Khandelwal, Akhila Yesantarao Venkata, Parag Agrawal, Yova Kementchedjhieva, Manish Gupta

机构 * MBZUAI Microsoft(微软)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出CRAFT方法,通过帕累托前沿优化提示的准确性和成本,避免标量化崩溃,在多个基准上实现更广泛的准确-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29861 2026-06-04 cs.CL cs.AI 73%

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

迈向可验证的多模态深度研究:用于交错报告生成的多智能体框架

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Xiaoxi Li, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架Ptah,通过规划、研究和写作阶段生成交错文本与视觉证据的多模态报告,并引入验证器确保事实准确性和跨模态一致性。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05054 2026-06-04 cs.CL 70%

Boosting Self-Consistency with Ranking

通过排序提升自洽性

Maria Marina, Daniil Moskovskiy, Sergey Pletenev, Mikhail Salnikov, Alexander Panchenko, Viktor Moskvoretskii

机构 * AIRI Skoltech(斯克利切夫斯基因工大学) EPFL(瑞士联邦理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RISC方法,将自洽性中的答案选择转化为排序问题,使用轻量级LambdaRank模型结合五个特征,在多个数据集上实现了比标准自洽性更好的准确率-效率权衡。

Comments 16 pages, 13 figures, accepted at ACL Student Research Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏