arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 34 篇

2608.06819 2026-08-10 cs.CL cs.AI 新提交 92%

FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding

FutureBridge:协作解码中超越局部偏好的令牌选择

Quanquan Li, Hongbo Zhang, Yihe Chi, Jingyu Li, Xidong Xi, Liuyang Song, Hongzhen Zhang, Yuxiang Huang, Jing Ke, Siyuan Ma, Junyi Lin, Guitao Cao

专题命中 推理与问题求解 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 FutureBridge通过联合LLM-SLM令牌对SLM后续推理的支持度排序,在5个数学推理基准上使Qwen3-1.7B SLM的数学平均得分较贪心解码提升35.1%,超越了仅依赖LLM局部偏好的现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07148 2026-08-10 cs.AI 新提交 92%

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing

面向智能制造中大型语言模型增强的多智能体强化学习(MARL)中心参考架构

Fouad Bahrpeyma, Dirk Reichelt

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文针对智能制造自适应控制的耦合需求,提出以MARL为中心的三层参考架构,探讨LLM在MARL中的附着点,明确传统MARL与LLM组件的适配场景,为相关研究提供结构化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06402 2026-08-10 cs.AI cs.LG 新提交 92%

Interpretable Unsupervised Community Detection with LLM-Symbolized Structured Processes

基于LLM符号化结构化过程的可解释无监督社区检测

Aoting Zeng, Kai Wang, Jianwei Wang, Yuxiang Sun, Yizhang He, Wenjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出LLM引导的无监督社区检测方法LUCID,通过四阶段流程结合LLM生成规则实现可解释性,在真实数据集上性能优于主流无监督与半监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06760 2026-08-10 cs.NI 新提交 91%

A Parameter-Specific Retrieval and Knowledge-Guided Reasoning Framework for LLM-Based GPSR Optimization in FANETs

面向FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架

Zhipeng Lin, Bin Duo, Tong Liu, Jie Lin, Jianting Yuan, Xiaojun Yuan

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对FANET中现有GPSR协议难以适配动态环境的问题,提出基于LLM的PMKR-GPSR框架,通过参数特定多索引检索和知识引导约束图实现协议一致的路由参数适配,在高移动性场景下提升了数据包投递率并降低了端到端时延。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00028 2026-08-10 cs.CL cs.AI cs.LG cs.SI 版本更新 90%

Harnessing the Synergy between LLM Agents and Knowledge Graphs for Urban Socioeconomic Prediction

利用大语言模型智能体与知识图谱的协同作用进行城市社会经济预测

Zhilun Zhou, Jingyang Fan, Yu Liu, Fengli Xu, Depeng Jin, Yong Li

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出LLM智能体与知识图谱的协同框架,结合二者优势完成城市社会经济预测,经实验验证该协同设计可提升预测效果,为跨任务信息共享提供思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06756 2026-08-10 cs.CL 版本更新 89%

How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality

推理链长度如何影响LLM对答案事实性的判断

Minzhu Tu, Shiyu Ni, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Post and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了推理链对LLM判断答案事实性的影响,发现弱判官易受推理存在影响,而强判官部分利用推理作为证据,但仍易被高质量推理链误导。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06699 2026-08-10 cs.AI cs.CV 新提交 88%

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06811 2026-08-10 cs.SE cs.AI 新提交 87%

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

在软件问题解决的大语言模型智能体中耦合规划与情景记忆

Jiahao Zhang, Yifan Zhang, Yu Huang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06741 2026-08-10 cs.LG cs.GT 新提交 86%

Solver-Guided Reasoning for Mixed-Equilibrium Strategies

求解器引导的混合策略均衡推理

Han Wang, Philippe Beardsell, Boning Li, Aaron Sasmita, Shuai Li, Hongyuan Zha, Baoxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) GTO Wizard Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出混合策略决策树(MDT),用求解器输出引导LLM在博弈中的均衡推理,在无限制德州扑克8种LLM配置下,将与均衡的L1距离降低52.6%,且策略可移植性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 85%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05242 2026-08-10 cs.LG cs.CV 版本更新 84%

Disentangling 3D Modeling from Spatial Reasoning

将3D建模与空间推理解耦

Haoze Sun, Jiequan Cui, Qingshan Xu, Richang Hong

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出解耦空间推理器(DiSR)框架,将3D感知与LLM推理解耦,在空间推理基准上取得竞争力性能,兼具可解释性、模块化性与计算效率,为空间智能提供替代范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-10 cs.CL 新提交 83%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06922 2026-08-10 cs.AI 新提交 81%

Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation

或许与我成交:情绪在多智能体谈判中的作用

Massimiliano Luca, Apoorva Singh, Bruno Lepri

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06694 2026-08-10 cs.AI cs.MA 新提交 81%

A Multi-Agent Framework for Automated Coarse-Grained Molecular Dynamics of Polymers

用于聚合物自动化粗粒度分子动力学的多智能体框架

Joohee Choi, Junhyeong Lee, Seunghwa Ryu

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出CGMas多智能体框架,可自动完成聚合物粗粒度分子动力学的拓扑构建等全流程,完成27项任务,22项密度匹配度在5%内,模拟时间大幅缩短,确立了智能体式LLM用于聚合物粗粒化的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新 81%

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06735 2026-08-10 cs.AI cs.CL 新提交 79%

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

IB-RL:用于策略性对话智能体的孤立双边强化学习

Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20710 2026-08-10 cs.AI cs.CL 版本更新 79%

Counterfactual Simulation Training for Chain-of-Thought Faithfulness

反事实模拟训练用于思维链可信度

Peter Hase, Christopher Potts

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出反事实模拟训练方法,通过奖励使模拟器准确预测模型输出来提升思维链的可信度,并在不同设置中验证其有效性。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06938 2026-08-10 cs.CV cs.AI 新提交 77%

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

机构 * Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06701 2026-08-10 cs.SE cs.AI cs.CL cs.LG 新提交 75%

Online Monitoring and Corrective Steering of Programming Agents

编程智能体的在线监控与纠正引导

Shuyang Liu, Saman Dehghan, Ji Young Kim, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LivePlan,通过解耦判断与建议的设计,在SWE-agent基础上实现编程智能体的在线监控与纠正,在SWE-bench数据集上显著提升问题解决率,且成本增量极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06425 2026-08-10 cs.CL cs.LG 新提交 73%

NTDH: Complex Reasoning for Comprehensive Affective Analysis

NTDH:用于综合情感分析的复杂推理

Tianlei Zhu, Zhiwei Liu, Yuyan Wang, Xiao-Yang Liu, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) The University of Manchester(曼彻斯特大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对综合情感分析的挑战,提出NTDH方法,通过自然化、感知容差门等策略,在少数据量下提升性能,获最优EI-reg结果。

Comments 16 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07454 2026-08-10 cs.MA cs.AI 新提交 70%

Strategy-first synthesis planning for complex natural products

复杂天然产物的优先策略合成规划

Daniel Armstrong, Xuan-Vu Nguyen, Octavian Susanu, Gabriel Gibberd, Théo A. Neukomm, Taddäus Strunden, Dan Forster, Morgane Delattre, Shawn Teh, Clément Rols, John Federice, Hayden Leatherwood, M. Lavelle Barnes, Maarten R. Dobbelaere, Peter Wipf, Jon T. Njardarson, Jieping Zhu, Philippe Schwaller

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07214 2026-08-10 cs.DB cs.AI cs.SY eess.SY 新提交 70%

Toward a Causal Data Management Ecosystem for Decision Making and Agentic AI

面向决策与智能体AI的因果数据管理生态系统

Dazhuo Qiu, Yingli Zhou, Amedeo Pachera, Angela Bonifati, Andrea Mauri

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。

Comments Accepted at ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06865 2026-08-10 cs.CV cs.AI cs.MA 新提交 70%

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection

用于可泛化深度伪造视频检测的多智能体取证推理

Xuechao Zou, Shun Zhang, Kai Li, Yi Zhou, Xinyu Sun, Yuhui Chen, Zhe Wu, Congyan Lang, Junliang Xing

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。

Comments 22 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06474 2026-08-10 cs.AI 新提交 70%

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型

Boshui Chen, Huiping Liu, Shaolei Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。

Comments 17 pages, 3 figures. Supplementary material is included in the main PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06397 2026-08-10 cs.PL cs.AI cs.SE 新提交 70%

Agentic Planning for Symbolic Execution

符号执行的智能体规划

Daniel Koh Ji Yang, Yannic Noller, Corina S. Pasareanu, Youcheng Sun

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出智能体规划系统Agolic,利用早期符号执行运行的证据配置后续有界符号执行,在C/C++程序上平均覆盖3倍以上分支,覆盖更多分支及对比语料库未覆盖的分支,扩展了符号执行的实际覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06243 2026-08-10 cs.AI 版本更新 70%

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

DASH:用于推理模型在线自蒸馏的 divergence-adaptive 监督视界

ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对标准在线自蒸馏(OPSD)未充分利用 rollout 时间结构的局限,提出 DASH 方法,通过自适应传播门调整 token 级监督权重,在三类数学推理基准、三种模型规模上均优于 vanilla OPSD,且无需额外前向传播。

Comments 17 pages, 4 figures, 9 tables. Code at https://github.com/DBtxy/DASH-OPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25220 2026-08-10 cs.AI 版本更新 70%

DATAREEL: Automated Data-Driven Video Story Generation with Animations

DATAREEL:基于动画的自动化数据驱动视频故事生成

Ridwan Mahbub, Syem Aziz, Mizanur Rahman, Mahir Ahmed, Shadikur Rahman, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) RBC, Canada(加拿大RBC) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07050 2026-08-10 math.LO 新提交 67%

Lévy-Montague reflection is $Π^1_1$-conservative over $\mathsf{WKL}_0$

Lévy-Montague反射在Π¹₁上对WKL₀是保守的

Fedor Pakhomov

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究证明Lévy-Montague反射方案Rfn在Π¹₁上对WKL₀、RCA₀保守,在Π⁰₂上对PRA保守,其结果为在对PRA保守的理论内形式化Feferman的范畴论论证开辟了道路。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06771 2026-08-10 physics.soc-ph 新提交 67%

Agentic Artificial Intelligence for Reproducible Human-in-the-Loop Environmental Health Research

用于可复现人在环环境健康研究的智能体式人工智能

Edmund Seto

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出人在环智能体框架,结合领域知识与编码素养,利用智能体式大语言模型生成R代码,通过美国超级基金场地案例验证其可提升环境健康研究结果的严谨性与可复现性。

Comments 41 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 62%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏