arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-05 至 2026-05-05 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 24 篇

2604.06091 2026-05-05 cs.CL cs.AI cs.MA 92%

Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives

社交动态作为削弱LLM集体客观决策的脆弱性

Changgeon Ko, Jisu Shin, Hoyun Song, Huije Lee, Eui Jun Hwang, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了社交动态如何影响LLM集体中代表代理的决策准确性,发现社交压力增加时,代理性能显著下降,且修辞策略会影响判断。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20055 2026-05-05 cs.CL cs.AI 92%

VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning

VERGE:可验证LLM推理的正式细化和指导引擎

Vikash Singh, Darion Cassel, Nathaniel Weir, Nick Feng, Sam Bayless

机构 * Case Western Reserve University(凯斯西储大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VERGE结合LLM与SMT求解器,通过迭代细化生成验证引导答案。其通过分解LLM输出为原子声明,自动形式化为一阶逻辑,并利用自动定理证明验证逻辑一致性。引入多模型共识、语义路由和精确逻辑错误定位等创新,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17677 2026-05-05 cs.AI 91%

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07731 2026-05-05 cs.AI cs.CL 88%

oMeBench: Towards Robust Benchmarking of LLMs in Organic Mechanism Elucidation and Reasoning

oMeBench:面向有机机制阐明和推理的鲁棒基准测试

Ruiling Xu, Yifan Zhang, Qingyun Wang, Carl Edwards, Heng Ji

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出oMeBench,首个大规模专家 curated 的有机机制推理基准,包含10000+注释步骤,评估LLM在化学一致性与多步推理能力,发现通过提示策略和领域微调可使性能提升50%。

Comments We need adjust some authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01399 2026-05-05 cs.CL cs.AI cs.IR 87%

Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning

Verbal-R3:作为检索与推理之间缺失桥梁的语义重排序

Sangkwon Park, Donghun Kang, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学人工智能研究所、人工智能研究室、智能网络研究中心和智能系统研究中心) DGIST(延世大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Verbal-R3框架,通过语义注释增强LLM的推理能力,实现检索与推理的高效整合,提升问答任务性能。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01048 2026-05-05 cs.CL cs.LG 86%

Compared to What? Baselines and Metrics for Counterfactual Prompting

与什么相比?反事实提示的基线和度量标准

Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

机构 * Northeastern University(东北大学) Bar-Ilan University(巴伊兰大学) Allen Institute for AI(人工智能研究所)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文探讨了反事实提示中基线和度量标准的重要性,指出单纯改变文本因素无法准确评估模型敏感性,提出通过统计检验比较干预差异与改写影响的框架,发现模型对患者性别等的敏感性在考虑一般模型敏感性后显著降低。

Comments 24 pages, 10 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01520 2026-05-05 cs.CV cs.CL 79%

MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

MIRL:基于互信息的强化学习用于视觉-语言模型

Yin Zhang, Jiaxuan Zhao, Zonghan Wu, Zengxiang Li, Junfeng Fang, Kun Wang, Qingsong Wen, Yilei Shao

机构 * School of Mathematics, Tianjin University, Tianjin, China(天津大学数学学院) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) Shanghai Advanced Institute of Finance (SAIFS), East China Normal University, Shanghai, China(上海先进金融研究所(SAIFS),东华大学) ENN Group, Digital Technology Research Institute, China(ENN集团,数字技术研究院) Nanyang Technological University, Singapore(南洋理工大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 MIRL通过利用生成描述与视觉输入之间的互信息,解决视觉语言模型在复杂推理任务中的感知误差和幻觉问题,提升回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01299 2026-05-05 cs.LG 77%

GA-VisAgent: A Multi-Agent application for code generation and visualization in interactive learning

GA-VisAgent:一种用于交互式学习中代码生成和可视化的多智能体应用

Wang Jian, Zhou Jianbo, Xiong Yuhao, Liu Zhenxia, Luo Wen, Yuan LinWang, Yu ZhaoYuan

机构 * School of Geography, Nanjing Normal University, Nanjing 210023, Jiangsu, China(地理学院,南京师范大学) School of Environment, Nanjing Normal University, Nanjing 210023, Jiangsu, China(环境学院,南京师范大学) Key Laboratory of Virtual Geographic Environment, Ministry of Education, Nanjing Normal University, Nanjing 210023, Jiangsu, China(虚拟地理环境重点实验室,南京师范大学) Jiangsu Center for Collaborative Innovation in Geographical Information Resource Development(江苏省地理信息资源开发与应用协同创新中心)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GA-VisAgent基于GAGPT提出多智能体应用,通过任务规划和ReAct策略生成代码并提供可视化,实验显示在40个典型Conformal GA任务中代码生成成功率达90%,比GPT-4o提升70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12464 2026-05-05 cs.AI 77%

Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction

推理模型可通过思维链重建实现准确剪枝

Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

机构 * LinkedIn, Sunnyvale, CA(LinkedIn,硅谷,加利福尼亚州) Massachusetts Institute of Technology, Cambridge, MA(麻省理工学院,剑桥,马萨诸塞州)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出通过重建思维链实现推理模型的高效剪枝,改进传统剪枝方法以适应推理任务,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01657 2026-05-05 cs.CV 75%

Act2See: Emergent Active Visual Perception for Video Reasoning

Act2See:面向视频推理的涌现式主动视觉感知

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01495 2026-05-05 cs.CL cs.AI 73%

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

FT-RAG:一种面向复杂表格推理的细粒度检索增强生成框架

Zebin Guo, Weidong Geng, Ruichen Mao

机构 * Georgia Institute of Technology(佐治亚理工学院) Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FT-RAG通过细粒度检索和多模态融合提升表格推理能力,引入多表RAG库增强训练数据,实现表格和单元格命中率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15037 2026-05-05 cs.AI cs.CL cs.SD 73%

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

从被动到主动:通过ProVoice-Bench评估语音代理的主动性

Ke Xu, Yuhao Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出ProVoice-Bench评估框架,通过四个新任务评估语音代理的主动性,揭示当前模型在过度触发和推理能力上的不足,为开发更自然的主动代理提供方向。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01293 2026-05-05 cs.AI 70%

Lifting Traces to Logic: Programmatic Skill Induction with Neuro-Symbolic Learning for Long-Horizon Agentic Tasks

将轨迹提升到逻辑:基于神经符号学习的程序化技能诱导用于长视界代理任务

Jie-Jing Shao, Haiyan Yin, Yueming Lyu, Xingrui Yu, Lan-Zhe Guo, Ivor Tsang, James Kwok, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) Centre for Frontier AI Research(前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,新加坡科技研究局) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, China(香港科学与技术大学计算机科学与工程系)

专题命中 推理与问题求解 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出NSI框架,通过将交互轨迹提升为模块化逻辑 grounded 程序,使代理能从少量示例中归纳技能并适应新目标,优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01245 2026-05-05 cs.HC cs.AI 70%

The Garden of Forking Paths: Narrative Arc-Conditioned Gameplay Planning

分叉花园:叙事弧条件下的游戏玩法规划

Yunge Wen, Chenliang Huang, Hangyu Zhou, Zhuo Zeng, Chun Ming Louis Po, Julian Togelius, Timothy Merino, Sam Earle

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Forking Garden框架,通过用户提供的故事情节生成分支游戏,采用弧引导约束算法构建 dungeon 图,实现游戏元素的多模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01164 2026-05-05 cs.AI 70%

LLMs Should Not Yet Be Credited with Decision Explanation

大语言模型不应被赋予决策解释的信用

Wenshuo Wang

机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文论证大语言模型尚不能被赋予决策解释的信用,指出当前研究将行为预测、合理解释和结果条件推理视为解释证据,可能过早定义解释进步。文章区分了决策预测、解释生成和决策解释三种主张,提出决策解释的信用标准,强调应根据证据强度合理分配信用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01102 2026-05-05 cs.AI physics.ao-ph 70%

Towards Multi-Agent Autonomous Reasoning in Hydrodynamics

向流体力学中的多智能体自主推理迈进

Jinpai Zhao, Albert Cerrone, Joannes Westerink, Clint Dawson

机构 * Oden Institute(奥登研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Notre Dame(北德克萨斯大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种多智能体系统,通过分层执行图协调专业智能体,解决单智能体在流体力学中的上下文饱和问题,实现高精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04106 2026-05-05 cs.AI 70%

InsTraj: Instructing Diffusion Models with Travel Intentions to Generate Real-world Trajectories

InsTraj: 通过旅行意图指导扩散模型生成真实世界轨迹

Yuanshao Zhu, Yuxuan Liang, Xiangyu Zhao, Liang Han, Xinwei Fang, Xun Zhou, Xuetao Wei, James Jianqiao Yu

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of York(约克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 InsTraj通过自然语言描述指导扩散模型生成真实、多样且符合指令的轨迹,解决传统方法在理解和生成复杂用户意图及约束条件上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05048 2026-05-05 cs.AI cs.HC 70%

MINT: Minimal Information Neuro-Symbolic Tree for Objective-Driven Knowledge-Gap Reasoning and Active Elicitation

MINT:最小信息神经符号树用于目标驱动的知识缺口推理和主动提取

Zeyu Fang, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MINT用于解决AI代理在目标驱动规划中主动提取人类输入的问题,通过神经符号树和自博弈优化策略,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01566 2026-05-05 cs.AI 57%

Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling

多智能体推理提升计算效率:帕累托最优测试时缩放

Florian Valentin Wunderlich, Lars Benedikt Kaesberg, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(戈滕堡大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文分析了多智能体推理策略的计算效率,通过实验确定在不同模型规模下,帕累托最优方法能以最低计算成本获得最高准确性,尤其在复杂任务中多智能体方法表现更优。

Comments Accepted at SRW at ACL 2026, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01329 2026-05-05 cs.AI cs.CY 57%

Truth or Tribe: How In-group Favoritism Prioritize Facts in Persona Agents

真实还是部落:群体偏好如何优先事实于拟人代理

Shijun Lei, Hongyu Wang, Yunji Liang, Haowen Zheng, Bin Guo, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Central University of Finance and Economics(中央财经大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究探讨了群体偏好在面对矛盾信息时对拟人代理的影响,提出Triadic交互框架和三种干预策略以缓解群体偏见。

Comments 21 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00914 2026-05-05 cs.MA cs.AI 57%

The Cost of Consensus: Isolated Self-Correction Prevails Over Unguided Homogeneous Multi-Agent Debate

共识的成本:孤立自我修正胜过无指导的同质多智能体辩论

Blaž Bertalanič, Carolina Fortuna

机构 * Jo z ef Stefan Institute Ljubljana Slovenia Jo z ef Stefan Institute

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 研究探讨了同质多智能体辩论中共识失败的机制,发现孤立自我修正在成本与准确性上优于无指导的同伴交流,尤其在参数规模7-8B时效果更佳。

Comments 19 pages, ACM Conference on AI and Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17815 2026-05-05 cs.HC cs.CL cs.CY 57%

Navigating the Conceptual Multiverse

在概念多元宇宙中导航

Andre Ye, Jenny Y. Huang, Alicia Guo, Rose Novick, Tamara Broderick, Mitchell L. Gordon

机构 * MIT EECS(麻省理工学院电子工程与计算机科学系) UW Allen School of CSE(华盛顿大学Allen学院计算机科学与工程系) UW Department of Philosophy(华盛顿大学哲学系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出概念多元宇宙,通过交互系统让用户透明地检查和改变概念决策,提升问题理解。在三个领域中,该系统帮助参与者更清晰地把握问题,如哲学学生改写论文、对齐标注者深入分析用户意图、诗人发现创作模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV 50%

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13209 2026-05-05 math.HO 50%

AI for Mathematics: Progress, Challenges, and Prospects

人工智能与数学:进展、挑战与前景

Haocheng Ju, Bin Dong

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文综述了AI4Math领域,探讨其在数学研究中的应用及发展,强调数学作为严格推理的测试场,推动通用推理能力的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏