arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 413 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 62 篇

2605.05886 2026-05-08 cs.CV 88%

Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models

无需训练的多模态大语言模型密集手部接触估计

Daniel Sungho Jung, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(电子工程与自动控制研究所,首尔国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出ContactPrompt,利用多模态大语言模型进行无需训练的密集手部接触估计,通过引入详细的部位分割和部分顶点网格表示,结合多阶段结构化接触推理,实现高精度的接触预测。

Comments Project page: https://contactprompt-release.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05566 2026-05-08 cs.AI cs.CL cs.LG 88%

Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

无意义帮助:提示空间扰动拓宽推理探索

Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LoPE框架,通过任务无关的提示空间扰动提升LLM推理能力,实验显示其在不同规模模型上均优于传统重采样方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06269 2026-05-08 q-bio.QM cs.AI 86%

MAT-Cell: A Multi-Agent Tree-Structured Reasoning Framework for Batch-Level Single-Cell Annotation

MAT-Cell: 一种多智能体树状推理框架用于批量单细胞注释

Yehui Yang, Zelin Zang, Xienan Zheng, Yuzhe Jia, Changxi Chi, Jingbo Zhou, Chang Yu, Jinlin Wu, Fuji Yang, Jiebo Luo, Zhen Lei, Stan Z. Li

机构 * Westlake University(西湖大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Center for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science and Innovation(香港科学与创新研究院) Chinese Academy of Sciences(中国科学院) University Key Laboratory of Information and Communication Security Backup and Recovery(信息与通信安全备份与恢复大学重点实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MAT-Cell通过分离证据基础与标签决策,结合反向验证查询和多轮辩论,提升批量单细胞注释的准确性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05873 2026-05-08 stat.ML cs.AI cs.LG math.ST stat.ME stat.TH 86%

CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency

CITE: 在大语言模型自我一致性中实现任意时间有效的统计推断

Hirofumi Ota, Naoto Iwase, Yuki Ichihara, Junpei Komiyama, Masaaki Imaizumi

机构 * Komaba Institute for Science, Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术科学研究生院Komaba研究所) Nagoya University(名古屋大学) NARA Institute of Science and Technology (NAIST) / Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(NAIST科学与技术研究所 / 摩洛哥本·泽德人工智能大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) / RIKEN AIP(摩洛哥本·泽德人工智能大学 / RIKEN AIP) Graduate School of Arts and Sciences, The University of Tokyo / RIKEN AIP / Kyoto University(东京大学艺术科学研究生院 / RIKEN AIP / 京都大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CITE算法,通过交并检验与E过程实现任意时间有效的模型响应分布唯一模式认证,无需预先知道可能答案集,并在扩散尾设置中提升认证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06121 2026-05-08 cs.CV 86%

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning

Pest-Thinker: 通过强化学习学习像昆虫学家一样思考和推理

Xueheng Li, Yu Wang, Tao Hu, Ji Huang, Ke Cao, Qize Yang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institute of Physical Science, Chinese Academy of Sciences(智能机器研究所、合肥物理科学研究所、中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科创新合肥科技研究院) Hefei University of Technology(合肥工业大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Pest-Thinker框架,通过强化学习提升多模态大语言模型对害虫形态的细粒度理解,构建了两个高精度害虫基准数据集,并通过监督微调和GRPO优化提升模型在农业害虫识别中的表现。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16745 2026-05-08 cs.LG cs.AI 85%

Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling

超越记忆:通过递归、记忆和测试时计算扩展推理深度

Ivan Rodkin, Daniil Orel, Konstantin Smirnov, Arman Bolatov, Bilal Elbouardi, Besher Hassan, Yuri Kuratov, Aydar Bulatov, Preslav Nakov, Timothy Baldwin, Artem Shelmanov, Mikhail Burtsev

机构 * MBZUAI(马克斯·普朗克智能研究院) MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过细胞自动机框架探讨多步推理机制,发现LLM在推理步骤增加时性能下降,递归、记忆和测试时计算能提升结果但有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00847 2026-05-08 cs.CL cs.AI cs.LG 85%

H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models

H-Probes:从语言模型的潜在表示中提取层次结构

Cutter Dawes, Aryan Sharma, Angelos Ioannis Lagos, Shivam Raval

机构 * Supervised Program for Alignment Research(对齐研究监督计划) Yale University(耶鲁大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 H-Probes通过线性探针从语言模型的潜在表示中提取层次结构,揭示模型在语法、概念及推理过程中的深层抽象能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06040 2026-05-08 cs.AI cs.CL 84%

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

基于新颖性的树状思维搜索用于大语言模型推理与规划

Leon Hamm, Zlatan Ajanovic

机构 * RWTH Aachen(亚琛工业大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于新颖性的树状思维搜索方法,通过引入新颖性概念优化语言领域推理与规划任务,减少搜索范围和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG 84%

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06660 2026-05-08 cs.LG cs.AI cs.CL 83%

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

基于验证器的数学推理硬问题生成

Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究所) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Statistics, University of Oxford(牛津大学统计系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VHG框架,通过引入独立验证器约束问题生成器的奖励,提升生成问题的有效性和难度,实验显示其在不定积分和数学推理任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05386 2026-05-08 cs.AI cs.CL cs.LG 83%

BALAR : A Bayesian Agentic Loop for Active Reasoning

BALAR:主动推理的贝叶斯代理循环

Aymen Echarghaoui, Dongxia Wu, Emily B. Fox

机构 * Department of Statistics, Stanford University(统计学系,斯坦福大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BALAR是一种无需微调的任务无关外环算法,通过维护潜在状态的结构信念,选择澄清问题以最大化预期互信息,并动态扩展状态表示,从而在三个基准测试中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05478 2026-05-08 cs.AI 83%

LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

LANTERN:基于大语言模型的神经符号迁移与经验门控推理网络

Mahyar Alinejad, Yue Wang, Amrit Singh Bedi, George Atia

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Central Florida(中央佛罗里达大学) Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LANTERN通过生成自动机、语义聚合和自适应门控方法,实现多源神经符号迁移,提升样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18857 2026-05-08 cs.AI cs.LG 82%

CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning

CORE:面向概念的强化学习,弥合定义与应用之间的数学推理差距

Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CORE通过引入概念导向的强化学习框架,解决大语言模型在数学推理中概念应用不足的问题,通过合成概念对齐习题和注入概念片段提升模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05893 2026-05-08 cs.CL cs.AI 82%

Logic-Regularized Verifier Elicits Reasoning from LLMs

逻辑正则化的验证器激发大语言模型的推理

Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li

机构 * Department of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术系) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOVER,一种基于逻辑规则的无监督验证器,通过内在激活和三个逻辑约束提升LLM推理能力,实验表明其性能优于无监督基线,接近监督验证器水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00742 2026-05-08 cs.AI cs.LG stat.ML 82%

Position: agentic AI orchestration should be Bayes-consistent

位置:代理AI协调应具有贝叶斯一致性

Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev

机构 * ESSEC Business School(ESSEC商学院) VinUniversity(文大学) Imperial College London(伦敦帝国理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所) Technical University of Denmark(丹麦技术大学) Pyramidal Inc.(Pyramidal公司) University of Notre Dame(诺特大学) Cognizant AI Lab(Cognizant人工智能实验室) University College London(伦敦大学学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Ghent University(根特大学) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在代理AI系统中,贝叶斯原则在协调层的应用,而非LLM参数,以提升决策一致性和协作效率。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06444 2026-05-08 cs.AI 81%

SCRuB: Social Concept Reasoning under Rubric-Based Evaluation

SCRuB:基于规则评估的社会概念推理

Jamelle Watson-Daniels, Himaghna Bhattacharjee, Skyler Wang, Brandon Handoko, Antonio Li, Anaelia Ovalle, Mahesh Pasupuleti, Candace Ross, Vidya Sarma, Arjun Subramonian, Karen Ullrich, Will van der Vaart, Yijing Xin, Maximilian Nickel

机构 * Meta McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCRuB框架,用于评估大语言模型在社会概念推理方面的能力,通过专家和模型响应对比,展示前沿模型在五个维度上优于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06403 2026-05-08 cs.CL cs.IR 81%

GATHER: Convergence-Centric Hyper-Entity Retrieval for Zero-Shot Cell-Type Annotation

GATHER:面向零样本细胞类型注释的收敛性超实体检索

Zhonghui Zhang, Feng Jiang, Shaowei Qin, Jiahao Zhao, Min Yang

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) Software College, Northeastern University(东北大学软件学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 GATHER通过全局多源图遍历识别拓扑收敛点,以高信息超实体捕捉实体协同,无需LLM参与检索,提升零样本细胞类型注释效率。

Comments Accepted to SIGIR 2026. 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19715 2026-05-08 cs.AI 81%

Neuro-Symbolic Proof Generation for Scaling Systems Software Verification

神经符号证明生成用于系统软件验证的扩展

Baoding He, Zenan Li, Wei Sun, Yuan Yao, Taolue Chen, Xiaoxing Ma, Zhendong Su

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Computer Science, Nanjing University, China(南京大学计算机科学学院) Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系) School of Computing and Mathematical Sciences, Birkbeck, University of London, UK(伦敦大学伯克贝克学院计算与数学科学学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种神经符号证明生成框架,通过结合大语言模型和交互式定理证明工具,实现系统级验证的自动化证明搜索,有效提升软件验证的可扩展性。

Comments Published as a conference paper at OSDI'2026, and code is available at \url{https://github.com/SoaringE/seL4-proof-search}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01270 2026-05-08 astro-ph.IM astro-ph.GA astro-ph.SR 80%

Egent: An Autonomous Agent for Equivalent Width Measurement

Egent:等效宽度测量的自主代理

Yuan-Sen Ting, Serat Mahmud Saad, Fan Liu, Yuting Shen

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 Egent结合传统多Voigt拟合与大语言模型视觉检查,实现自动化等效宽度测量,通过函数调用进行拟合推理,验证结果与专家测量一致,且能压缩专家工作量,提供开源代码和网页接口。

Comments 26 pages, 14 figures, 6 tables. Code available at https://github.com/tingyuansen/Egent. Published in the Open Journal of Astrophysics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21187 2026-05-08 cs.CV cs.LG 79%

FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models

FRISM:通过子空间级模型融合实现细粒度推理注入用于视觉-语言模型

Chenyu Huang, Peng Ye, Xudong Tan, Jinhan Mu, Shenghe Zheng, Li Shen, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院,中国) Shanghai Innovation Institute, China(上海创新研究院,中国) The Chinese University of Hong Kong, China(香港中文大学,中国) Harbin Institute of Technology, China(哈尔滨工业大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) Sun Yat-Sen University, Shenzhen, China(暨南大学深圳校区,中国)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 FRISM通过子空间级模型融合实现细粒度推理注入,有效提升视觉-语言模型的推理能力并保持视觉能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06188 2026-05-08 cs.AI cs.CL 79%

OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models

OPSD 压缩 RLVR 教授的内容:一种为推理模型设计的后 RL 压缩阶段

Jaehoon Kim, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 OPSD 在数学推理中作为压缩机制更可靠,通过仅训练正确轨迹可保持准确性并显著缩短响应,而训练错误轨迹则损害准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 78%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 77%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05963 2026-05-08 cs.AI cs.CL 73%

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11509 2026-05-08 cs.CL cs.AI cs.CV 73%

Multimodal Fact-Level Attribution for Verifiable Reasoning

多模态事实级归因用于可验证推理

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MuRGAt基准,用于评估多模态事实归因能力,要求模型在复杂推理中生成明确推理和精确引用,揭示强模型在正确推理下仍易产生幻觉,且增加推理深度或结构化归因会降低准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04065 2026-05-08 cs.CL cs.ET cs.LG 73%

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01327 2026-05-08 cs.AI cs.LG 73%

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

基于段落对齐的策略优化用于多模态推理

Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li

机构 * Fudan University(复旦大学) Southeast University(东南大学) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAPO方法,通过将推理步骤而非token或完整序列作为策略更新的基本单元,提升多模态推理任务的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27644 2026-05-08 cs.LG cs.AI cs.PL 73%

ANCORA: Learning to Question via Manifold-Anchored Self-Play for Verifiable Reasoning

ANCORA:通过曼哈顿锚定自我对战学习提问以实现可验证推理

Chengcao Yang

机构 * Wuhan University(武汉大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 ANCORA通过曼哈顿锚定自我对战学习提问,利用三种机制生成可验证问题并自我改进,提升推理能力,实验证明其在Verus上显著优于PSV自我对战。

Comments v2: Updated abstract; strengthened the proof of Proposition 4.1; corrected minor typos; corrected author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07516 2026-05-08 cs.AI cs.CL 73%

CompassLLM: A Multi-Agent Approach toward Geo-Spatial Reasoning for Popular Path Query

CompassLLM: 一种面向流行路径查询的多智能体方法

Md. Nazmul Islam Ananto, Shamit Fatin, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of Utah(犹他大学) Monash University(莫纳什大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CompassLLM通过多智能体框架解决流行路径查询问题,结合空间推理能力提升搜索和生成性能,实验显示其在准确性和成本效益方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06619 2026-05-08 cs.CL cs.CY 70%

Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

算法语言:隐藏在开放中的平衡:可理解性与检测规避之间的权衡

Jan Fillies, Ronald E. Robertson, Jeffrey Hancock

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了算法语言在内容生成和审核中的平衡问题,提出了多数可理解调制概念,并通过实验验证了可理解性与检测规避之间的关系。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏