arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1613 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1613 篇

2606.24694 2026-06-24 cs.HC 新提交 80%

SupplyNet: Supporting Visual Exploratory Learning in Supply Chain via Contextual Multi-Agent Simulation

SupplyNet: 通过上下文多智能体模拟支持供应链中的视觉探索式学习

Yanjia Li, Kelcy Kexin Han, Tianrui Hu, Yi-Fan Cao, Huamin Qu, Sicheng Song

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出SupplyNet,一种基于上下文图的多智能体LLM框架的视觉模拟系统,通过交互式网络视图、分支时间线和任务分析控制台,支持供应链中的反事实探索、因果追踪和比较推理,提升用户参与度和理解。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24443 2026-06-24 cs.LO cs.PL 新提交 80%

Verifiable Auto-Formalization of Mathematics Using a Relaxed Natural Formal Language

使用宽松自然形式语言的可验证数学自动形式化

Zhicheng Hui, Lihan Xie, Xingzhi Qi, Zhehao Li, Yingjun Lan, Qinxiang Cao

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出一种宽松自然形式语言作为中间目标,通过分阶段精化实现可验证的数学自动形式化,结合规则转换与LLM启发式方法,并利用领域特定策略语言生成验证条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21129 2026-06-23 cs.CR cs.OS 新提交 80%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 80%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16458 2026-06-16 cs.RO 新提交 80%

RHO: Your Coding Agent is Secretly a Roboticist

RHO:你的编码代理其实是个机器人专家

Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) AMD

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RHO范式,通过训练时搜索神经符号化多文件策略库,实现机器人任务的高效零样本泛化,在LIBERO-PRO和Robosuite上分别达到45%和70%的成功率,显著优于现有方法。

Comments 46 pages, 9 figures, 15 tables. Project page: https://rho-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14989 2026-06-16 cs.MA 新提交 80%

Hierarchical Generative Agents for Simulating Sequential Human Behavior

用于模拟序列人类行为的层次化生成式智能体

Maria G. Mendoza, Lucas Waldburger, Jin Lee, Shankar Sastry

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于认知层次和人格驱动的生成式智能体框架,结合大语言模型和人类疏散数据,模拟灾害中序列决策行为。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10322 2026-06-15 cs.CR cs.MA 新提交 80%

Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs

面向鲁棒上下文推理的博弈论多智能体控制方法在LLMs中的应用

Saeid Jamshidi, Amin Nikanjam, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对LLMs在多轮交互中易受提示注入和上下文投毒攻击的问题,提出GT-MCP方法,通过博弈论多智能体控制和自愈机制,将上下文漂移限制在99.6%的轮次内,且控制器级注入攻击零成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13037 2026-06-12 cs.CR cs.SE 新提交 80%

DIG: Oracle-Guided Directed Input Generation for One-Day Vulnerabilities

DIG:面向单日漏洞的Oracle引导定向输入生成

Andrew Bao, Haochen Zeng, Peng Chen, Stephen McCamant, Pen-Chung Yew

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对补丁延迟或未完全部署导致的单日漏洞风险,提出Oracle引导的定向输入生成方法DIG,利用补丁揭示触发条件,通过LLM合成Oracle并引导生成器进化与定向模糊测试,在138个真实CVE上触发80个漏洞,超过现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 80%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11354 2026-06-11 cs.ET 新提交 80%

A Zero-Shot Multi-Agent Framework for Human-Building Interaction via Programmatic Reasoning

通过程序化推理实现人楼交互的零样本多智能体框架

Yuqi Wang, Gulai Shen, Ali Mehmani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种分层多智能体框架,利用语义路由和程序化推理解耦自然语言理解与建筑分析,通过“门卫”机制分解任务并生成可执行Python脚本,在200多栋商业建筑数据上验证了准确性和上下文响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08464 2026-06-09 cs.CV 新提交 80%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08457 2026-06-09 cs.MA 新提交 80%

The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment

一致性错觉:多智能体辩论如何隐藏推理失调

Xiaoyang Wang, Christopher C. Yang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对多智能体LLM系统中答案共识不等于推理对齐的问题,提出CARA指标检测一致性错觉,并设计GDP协议通过事实承诺和立场表态显著提升推理对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08214 2026-06-09 cs.RO 新提交 80%

Agentic Neuro-Symbolic Planning and Commissioning for Human-in-the-Loop Industrial Robotics with Digital Twins

面向人机协同工业机器人的智能神经符号规划与调试:基于数字孪生

Zhihao Liu, Victor Nan Fernandez-Ayala, Tianyu Wang, Qiang Qin, Xi Vincent Wang, Dimos V. Dimarogonas, Lihui Wang

机构 * Royal Institute of Technology (KTH)(皇家理工学院(KTH))

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出一种结合LLM语言理解与确定性验证执行的神经符号框架,采用SDI架构和两级恢复机制,在数字孪生中验证后执行,显著提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07486 2026-06-08 eess.SY cs.SY 新提交 80%

OPENPATH: A Supervisor--Specialist Agent System for Personalized, Accessible, and Multi-stop Urban Trip Planning

OPENPATH: 一种用于个性化、无障碍和多站点城市出行规划的监督-专家智能体系统

Ziyang Xiong, He Zong, Zhiyuan Xue, Manxi Wu

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出监督-专家多智能体系统OPENPATH,结合LLM解析自然语言与经典算法优化路径,支持个性化偏好、多站点规划和无障碍需求,并用于城市尺度无障碍分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13344 2026-08-14 cs.AI 新提交 79%

LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

LongEarth-R1:用于长时序地球观测推理的视觉语言模型基准测试与对齐

Yupan Ding, Jing Xiao, Zhenyuan Zhang, Chaofeng Chen, Liang Liao, Gui-Song Xia, Mi Wang

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 该研究推出长时序地球观测推理基准LongEarth-Bench,开发LongEarth-R1模型,在全部12项长序列遥感推理任务中表现最优,同时在标准遥感基准上保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-14 cs.LG cs.AR cs.DC 新提交 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 17 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10198 2026-08-12 cs.AI 新提交 79%

Post-Hoc Sparse Coding of Latent Communication Between Vision-Language Model Agents

视觉-语言模型智能体间潜在通信的事后稀疏编码

Di Wu, Xiaohui Zhu

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型智能体间的潜在通信,通过事后稀疏自编码器压缩Vision Wormhole的传输数据,在保持性能的同时大幅减少了传输字节,为通信机制优化提供了方向。

Comments 9 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09772 2026-08-11 cs.CL 新提交 79%

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配

Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 79%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 79%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04066 2026-08-06 cs.AI 新提交 79%

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

大模型提出方案,执行体处理:一种自验证智能体工具,可将长程智能体中的承诺漂移与绑定漂移分离

Mohsen Arjmandi

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI

AI总结 本研究提出一种自验证智能体工具,可分离长程智能体的承诺漂移与绑定漂移,通过实验揭示消融承诺机制会提升目标放弃率,且贡献了可量化漂移分解的智能体验证方法论。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01753 2026-08-04 cs.CV cs.AI 新提交 79%

Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

能否用视觉-语言模型评估城市衰败:以底特律为例

Xiaohao Yang, Aohua Tian, Derek Van Berkel, Xu Qiang, Mark Lindquist

机构 * School for Environment and Sustainability(环境与可持续发展学院) School of Information(信息学院) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本研究以底特律为案例,提出基于开源大视觉-语言模型的多视角住宅衰败评估框架,经实验验证该框架可低成本跟踪住房状况,为传统调查提供补充。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01000 2026-08-04 cs.AI 新提交 79%

Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏

Wenhui Chen, Jianlin Chen, Ziyao Lin, Peiji Long, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI

AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。

Comments 53 pages, 14 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00969 2026-08-04 cs.AI 新提交 79%

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体

Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Aounon Kumar, Yashas Malur Saidutta, Wenbo Li, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26952 2026-07-30 cs.CL 新提交 79%

Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?

信用卡、困惑、计算与后果:我们能从语言模型推理中发现什么?

Arnav Hiray, Agam Shah, Caleb Lu, Meghaj Tarte, Harsit Mittal, Sudheer Chava

机构 * College of Computing(计算机学院) Scheller College of Business(舍勒商学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title);prompting(abstract);分类 cs.CL

AI总结 该研究构建了首个基于真实信用卡协议的数值推理金融素养基准CreditCardQA,评估发现程序思维(PoT)提示可提升模型推理性能,错误多源于金融规则误用等,边缘案例易影响财务脆弱群体。

Comments Accepted at CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25408 2026-07-29 cs.AI 新提交 79%

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角

Debjyoti Paul

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。

Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-07-28 cs.CR cs.AI 新提交 79%

Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23273 2026-07-28 cs.IR cs.AI cs.ET 新提交 79%

Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition

计算营养中统计支持的大语言模型成分与食谱数据收集

James Izzard, Hassan Eshkiki, Fabio Caraffini

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22732 2026-07-28 cs.AI 新提交 79%

Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning

大语言模型游戏智能体中的空间推理:因果上下文和多步规划的影响

Mohit Jiwatode, Ronja Fuchs, Robin Schmöcker, Bodo Rosenhahn, Alexander Dockhorn

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究基于大语言模型的游戏智能体在复杂任务中表现不佳的问题,通过实验验证因果提示增强和多步规划可提升胜率并控制延迟,引入新基准评估,发现较大模型定位更准,融入因果上下文和多步规划能优化性能与速度。

Comments To be published at COG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22529 2026-07-27 cs.CL 新提交 79%

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

技能自我博弈:通过协同进化技能拓展大语言模型能力边界

Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏