arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 439 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 63 篇

2608.03028 2026-08-05 cs.AI 新提交 77%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20244 2026-08-05 cs.LO cs.AI cs.CL cs.LG cs.SE 版本更新 75%

Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search

Lean Refactor: 通过代理策略搜索实现多目标可控的证明优化

Jialin Lu, Soonho Kong, Rodrigo Stehling, Kaiyu Yang, Zhangyang Wang, Weiran Sun, Wuyang Chen

机构 * Simon Fraser University(西蒙弗雷泽大学) Amazon Web Services(亚马逊网络服务) MiroMind University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Lean Refactor框架,通过检索增强的代理策略搜索,解决多目标、可控和版本鲁棒的Lean证明重构问题,主要贡献是通过预注释的多目标重构策略数据库实现高效的证明优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11996 2026-08-05 cs.CL cs.AI 版本更新 74%

Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces

过滤推理得分:在模型最自信的轨迹上评估推理质量

Manas Pathak, Xingyao Chen, Shuozhe Li, Amy Zhang, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出过滤推理得分,用于评估模型推理质量,区分相似准确率的模型,并提高对输入提示和生成配置变化的鲁棒性。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28114 2026-08-05 cs.AI 版本更新 74%

Language model agents show in-group trust bias invisible to standard behavioural audits

指令调优语言模型代理中类似人类的内群体偏见

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04001 2026-08-05 cs.LG cs.AI 新提交 73%

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

推理大语言模型中的测试时缩放:推理机制、评估与可复现性

Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对推理大语言模型的测试时缩放,明确三种推理机制,提出系统评估原则与可复现性要求,应用于多类基准并发布超20亿条推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03882 2026-08-05 cs.CL cs.AI cs.IR 新提交 73%

MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

MultiGlobeQA:面向地理空间推理的多语言且全球多样化基准

Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MultiGlobeQA是覆盖201个国家地区的多语言地理空间推理基准,含46060个问答对,实验发现LLMs在网格索引等任务上表现差,计算是瓶颈且低收入地区表现差距大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03401 2026-08-05 cs.LG cs.AI 新提交 73%

Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces

更短的推理,更早的答案?对推理接口的评估

Francesca Carlon, Vincent Ginis, Andres Algaba

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估大型语言模型的推理接口,测试提示词和训练设置对推理长度、准确率的影响,发现早答指令和低 effort 推理在特定 token 限制下可提升部分数据集准确率,需综合报告多维度评估指标。

Comments 52 pages, 13 figures, 30 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02867 2026-08-05 cs.CL cs.AI 新提交 73%

BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

BODHI:大型语言模型是否会分支拓展并发现异构推理?

Soumadeep Saha, Krish Sharma, Akshay Chaturvedi, Nicholas Asher

机构 * ANITI, Université de Toulouse(图卢兹大学ANITI) LINAGORA Labs(LINAGORA实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过迷宫求解实验和BODHI-Trees分析,发现RLVR训练的LLMs存在策略熵崩溃,其采样效率提升以推理分支多样性下降为代价。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03735 2026-08-05 cs.MA cs.CL 新提交 70%

An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

多语言多智能体规划失败的可操作诊断

Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna, Seraphina Goldfarb-Tarrant, Kelly Marchisio, Hisashi Kojima, Roman Vainshtein

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03413 2026-08-05 cs.AI cs.ET 新提交 70%

Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems

能动人工智能:面向复杂系统的以决策为中心的架构

Zuojun Max Shen, Yuan Qu, Pujun Zhang, Anbang Liu, Yunhao Liang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03340 2026-08-05 cs.CL 新提交 70%

Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks

基准测试基准:测试常识基准的预测有效性

Ine Gevers, Walter Daelemans

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究评估了23种模型在多类常识基准、对照任务及下游推理任务上的表现,发现常识基准仅对少数下游任务有一致预测性,修改基准未提升预测能力,其仅提供任务相关的下游常识能力证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02876 2026-08-05 cs.AI 新提交 70%

BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL

BAP-SQL:面向智能体Text-to-SQL的预算感知观测规划

Chong Peng, Pin Qian, Su Wang, Yihang Chen, Varun Sah

机构 * Microsoft(微软公司) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 BAP-SQL是面向智能体Text-to-SQL的预算感知观测规划方法,通过将观测形成作为预算控制阶段,在紧预算下提升了SQL生成成功率,同时减少了token使用量。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03962 2026-08-05 quant-ph cs.AI cs.CC 新提交 70%

Separating quantum circuits from classical LLMs

将量子电路与经典大语言模型分离

Srinivasan Arunachalam, Arkopal Dutt, Hari Krovi, Rik Sengupta

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究证明了低深度量子计算与经典大语言模型架构在分布和功能上的无条件分离,为大语言模型时代量子优势的研究奠定了基础。

Comments 60 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02011 2026-08-05 cs.AI 版本更新 70%

Before Reasoning Can Fail: Pre-Evidence Procedural Failures in Agentic RAG

在推理失效之前:智能体检索增强生成(RAG)中的证据前程序失效

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对智能体RAG系统在推理前的程序失效,提出将错误答案分为两类失效,评估Read-Gate机制,发现强制阅读可提升准确率,且证据收集应作为独立轨迹控制问题评估。

Comments 22 pages, 7 figures. Code: https://github.com/Noverse0/before-reasoning-fails

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 67%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03232 2026-08-05 cs.CR 新提交 67%

MalTotal: Cost-Effective and Language-Agnostic Malicious Code Poisoning Detection for Millions of Repositories

MalTotal:面向数百万代码仓库的高性价比、语言无关型恶意代码投毒检测方法

Jian Zhao, Shenao Wang, Qingyang Wu, Yanjie Zhao, Xiao Cheng, Haoyu Wang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出MalTotal框架,可跨5种主流语言检测恶意代码,F1值达93.1%,成本大幅降低,在12万个GitHub仓库中发现564个未知恶意仓库,适用于大规模多语言场景。

Comments Accepted by ISSTA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03134 2026-08-05 cs.CR cs.SE 新提交 67%

CLEAR: Causal Context-Based Agentic Reasoning for Vulnerability Detection

CLEAR:基于因果上下文的智能体推理漏洞检测

Sungju Yun, Sijune Hwang, Yeonjoon Lee, Kyungtae Kang, Sungbin Park

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有漏洞检测方法无法捕捉漏洞复杂因果依赖的问题,提出CLEAR多智能体框架,通过构建VCKG并结合四类智能体协同推理,在C/C++和Java基准上性能显著优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03064 2026-08-05 cs.CV 新提交 67%

Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation

基于全局图验证的VLM驱动3D室内场景生成优化

Jialu Huang, Yingxuan You, Fei Wang, Zheng Dang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究针对VLM驱动3D室内布局生成中全局一致性与物理可行性不足的问题,提出结合GSV与GPFS的混合策略,实现了该任务的当前最优性能。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20144 2026-08-05 cs.DB 版本更新 67%

An Agentic Approach to Metadata Reasoning

元数据推理的代理方法

Jiani Zhang, Sercan O. Arik, Cosmin Arad, Fatma Ozcan, Alon Halevy

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出元数据推理代理,通过检索候选表和自主咨询元数据,有效筛选数据源。在KramaBench和合成基准测试中,其在数据选择和避免低质量数据方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07916 2026-08-05 cs.CV 版本更新 67%

Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation

Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割

Weiming Zhang, Dingwen Xiao, Songyue Guo, Guangyu Xiang, Shiqi Wen, Minwei Zhao, Lei Chen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。

Comments We need to make a huge revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 62%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03161 2026-08-05 cs.AI cs.CL 新提交 62%

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

面向多讲座教育推理的证据 grounded 多模态知识图谱构建

Sahil Al Farib, Momota Ahsana Meem, Sheikh Redwanul Islam, Md. Tanvir Raihan

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对讲座视频知识保留不全问题,提出基于证据的多模态知识图谱构建流程,在神经网络讲座实验中取得高覆盖率与检索准确率,贡献可审计的知识图谱构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02662 2026-08-05 cs.LG cs.AI 新提交 62%

Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers

基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现

Farbod Faraji, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。

Comments 33 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22999 2026-08-05 cs.RO cs.AI cs.HC cs.LG 版本更新 62%

WCM: World-Cognition Model for Generalizable Human-Robot Interaction

WCM:用于通用人机交互的世界认知模型

Yuzhen Chen, KC Zhou

专题命中 推理与问题求解 :language agent(abstract);分类 cs.AI、cs.LG

AI总结 针对机器人在物理任务交互困难的问题,提出基于SLAK架构和异步运行时的世界认知模型(WCM),引入人在回路教学模式,经思维链监督改进模型,在九个现实世界人机交互任务中平均成功率达73.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21214 2026-08-05 cs.CL cs.AI 版本更新 62%

Self-Guided Adaptive Safety Alignment: Synthesizing and Internalizing Guidelines in Reasoning Models

自引导防御:通过合成指南实现推理模型的自适应安全对齐

Yuhang Wang, Yanxu Zhu, Jiaming Zhang, Dongyuan Lu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) Beijing Jiaotong University(北京交通大学) School of Information Technology and Management(信息科技与管理学院) University of International Business and Economics(国际经济贸易大学)

专题命中 推理与问题求解 :SFT(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出SGASA框架,通过合成指南实现推理模型的自适应安全对齐,提升对抗性提示防御能力并减少对良性请求的拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03506 2026-08-05 cs.AI stat.ML 新提交 57%

When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

当存在多个有效答案时,投票会失效:针对大语言模型中K选1最佳因果推理的符号验证

Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong Yin, Nhat Ho

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 针对大语言模型因果推理中多有效答案下投票失效的问题,提出无需训练的符号验证器CALVER,在CLEAR数据集等场景下显著提升了推理选择准确率。

Comments 28 pages, 5 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-05 cs.CR cs.AI 新提交 57%

Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Xu Peng, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01755 2026-08-05 cs.AI 版本更新 57%

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27670 2026-08-05 cs.CV cs.AI 版本更新 57%

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

JigShape:通过拼图任务评估视觉语言模型的视觉几何推理能力

Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao

机构 * University of Southern California(南加州大学) National University of Singapore(新加坡国立大学) Adobe Research(奥多比研究院) Texas A&M University(德克萨斯农工大学) Rice University(莱斯大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究提出JigShape拼图基准,发现零样本VLM大多缺乏几何推理能力,所有模型在大尺寸拼图上均出现性能崩塌,将可扩展几何推理确立为VLM的开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06415 2026-08-05 cs.RO cs.AI cs.CV 57%

Semantic Enrichment of CAD-Based Industrial Environments via Scene Graphs for Simulation and Reasoning

通过场景图实现基于CAD的工业环境语义增强以用于模拟与推理

Nathan Pascal Walus, Ranulfo Bezerra, Shotaro Kojima, Tsige Tadesse Alemayoh, Satoshi Tadokoro, Kazunori Ohno

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Tough Cyberphysical AI Research Center, Tohoku University(东北大学 Tough 跨物理AI研究中心) RWTH Aachen University(亚琛工业大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出通过场景图增强CAD环境,利用大型视觉-语言模型生成语义信息,以提升工业环境的模拟与推理能力。

Comments Accepted to IEEE SSRR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏