arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6571 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2608.15832 2026-08-18 cs.AI 新提交 77%

The Authority Resolution Framework: A Five-Domain Ontology for Governing Who and What Decides, at Scale

权威解析框架:用于大规模管理决策主体与决策事项的五域本体

Parviz Shariff

专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ARF五域本体,将权威关系定义为跨域原语,提供机器可解释的权威表示,支持AI智能体在执行行动前确定权威的来源、范围与有效性,属于AI治理交叉领域的知识表示与推理研究。

Comments 27 Pages, 2 Tables, 1 Script, 1 Query

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12877 2026-08-14 cs.AI 新提交 77%

ReflectFact: Self-Reflective Agents for Improving Comprehension and Reasoning in Multi-Hop Fact Verification

ReflectFact:用于提升多跳事实验证中理解与推理能力的自反思智能体

Runze Zhao, Zixin Tang, Xiaoshuai Hao, Leyuan Chang, Xiaopeng Fu, Boyu Qiao, Dongyang Zhang

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对多跳事实验证中智能体推理偏离目标及参数知识与证据冲突的问题,提出自反思智能体框架ReflectFact,经HOVER、EX-FEVER实验,性能优于最强基线。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10494 2026-08-12 cs.AI cs.MA 新提交 77%

GeoForge: Non-Parametric Self-Evolving Agents for Earth-Observation Reasoning

GeoForge:用于对地观测推理的非参数自进化智能体

Xin Xiao, Jiang Zhong, Junnan Zhu, Yingchao Feng, Peijin Wang, Yidan Zhang, Kaiwen Wei

专题命中 规划决策 :tool-use(abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 GeoForge是一种无需训练的自进化框架,通过结构化非参数执行状态及多记忆机制提升EO智能体的规划与推理能力,可改善任务准确率、工具轨迹质量并减少推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05832 2026-08-07 cs.CL 新提交 77%

Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

利用层级推理和话语级目标奖励增强大型语言模型的社交智能

Xiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.CL

AI总结 该研究针对LLMs社交互动不足的问题,提出TSR框架与LHRL-VGR算法,微调Qwen2.5-7B智能体后在SOTOPIA基准上超过GPT-4o基线7.32%,实现多智能体社交谈判的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22591 2026-07-28 cs.AI cs.MA 新提交 77%

Lexical discovery in unknown environments orchestrated by Large Language Models

由大语言模型编排的未知环境中的词汇发现

Rafael Sendra-Arranz, Iñaki Dellibarda Varela, Eduardo Rocon, Álvaro Gutiérrez, Manuel Cebrian

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 针对未知环境中智能体需开发共享词汇的问题,提出神经符号词汇发现框架,让基于大语言模型的智能体群体进行指称博弈自组织词汇表,通过语义锚定扩展人类词汇,模拟达成共识并表征收敛动态,为自主探索预部署规划迈出第一步。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17560 2026-07-21 cs.AI 新提交 77%

Reinforcement Learning: From Algorithms To Foundation Models

强化学习:从算法到基础模型

Zihan Ding

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。

Comments Princeton University PhD Thesis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13988 2026-07-16 cs.LG 新提交 77%

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

TRACE:通过信用估计进行长期奖励分配的回合级奖励分配

Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 规划决策 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.LG

AI总结 研究针对多轮智能体训练后的信用分配难题,提出TRACE方法,通过特定状态转换、对数概率获取及转换等步骤进行奖励分配。该方法无需额外训练,在长期复杂搜索任务中显著提升基础模型工具使用能力,在基准测试中表现良好且学习曲线更佳。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13854 2026-07-16 cs.CL 新提交 77%

SPyCE: Skill-Policy Co-evolution for Multimodal Agents

SPyCE:多模态智能体的技能-策略协同进化

Ru Zhang, Weijie Qiu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划决策 :tool use(abstract);tool-use(abstract);workflow(abstract);分类 cs.CL

AI总结 研究多模态智能体,提出SPyCE框架,将推理轨迹提炼为分层技能库与策略协同进化,执行技能捕获局部操作,工作流技能编码高级先验,实验证明该框架优于基线,为构建多模态智能体提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09740 2026-07-14 cs.AI cs.CV 新提交 77%

A Dynamic Scene Interaction Reasoning Framework for Scene-level Lane-Change Intention and Trajectory Prediction of Multiple Interacting Vehicles

用于多交互车辆场景级变道意图和轨迹预测的动态场景交互推理框架

Joshua Kofi Asamoah, Blessing Agyei Kyem, Eugene Denteh, Armstrong Aboah

机构 * North Dakota State University(北达科他州立大学)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究针对多交互车辆场景级变道意图及轨迹预测问题,提出动态场景图注意力框架,将场景表示为时变交互图,通过时态图注意力消息传递等捕捉车辆关系与线索,实验表明该框架能提升预测准确率,降低碰撞率和误差,验证了组件贡献和公式有效性。

Comments 28 pages, 9 Figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09195 2026-07-13 cs.AI cond-mat.mtrl-sci 新提交 77%

Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

迈向可审计的人工智能科学家:大语言模型智能体的假设演化协议

Izumi Takahara, Teruyasu Mizoguchi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学产业科学研究所)

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在让大语言模型智能体在科学发现中发挥核心作用。提出假设演化协议(HEP),使假设生成等操作可审计。在材料科学任务中,该协议能让智能体运行关键循环,跨问题概括并随模型能力提升更充分利用协议,迈向可审计的人工智能科学家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04974 2026-07-07 cs.SE 新提交 77%

A Comprehensive Study of Implementation Bugs in Multi-modal Agents

多模态智能体中实现错误的综合研究

Suwan Li, Lei Bu, Shangqing Liu, Yile Wang, Guangdong Bai, Fuman Xie, Kai Chen, Chang Yue

专题命中 规划决策 :agent(abstract,abstract_cn);planning(abstract);分类 cs.SE

AI总结 针对多模态智能体实现错误缺乏系统研究的问题,收集34个智能体,从1268个问题报告中识别出158个错误,开发分类法,实现MATester工具,为多模态智能体错误分类、预防和修复提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04718 2026-07-07 cs.AI 新提交 77%

FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents

FORGE:对深度研究智能体的研究轨迹劫持攻击

Yue Pan, Ziheng Zhang, Junxiang Lei, Changhao Jia, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学) Explore Academy, JD(京东探索研究院)

专题命中 规划决策 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 研究针对深度研究智能体,利用其工作流程中的规划层中毒面,提出FORGE两级攻击劫持子任务规划,还引入PRISM指标和Root Query Anchoring防御,展示攻击效果及防御作用。

Comments 20 pages,8 figures,Code available at https://github.com/yvepan/FORGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01639 2026-07-03 cs.AI 新提交 77%

Autonomous discovery of traffic laws with AI traffic scientists

AI交通科学家自主发现交通规律

Xingyuan Dai, Yue Liu, Xiaoyan Gong, Qinghai Miao, Junyou Shang, Yutong Wang, Chao Guo, Yonglin Tian, Yizhang Chai, Chao Xiang, Yisheng Lv, Fei-Yue Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) China Telecom Research Institute(中国电信研究院) Macau Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学澳门系统工程研究所) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室)

专题命中 规划决策 :planning(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 提出TrafficSci智能体系统,通过迭代工作流自主发现交通规律,在四个案例中重现已知规律并发现城市驾驶行为中的内在时间记忆尺度。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27632 2026-06-29 cs.CL 新提交 77%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 规划决策 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26298 2026-06-26 cs.AI cs.CR 新提交 77%

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

治理行动,而非智能体:机构证明作为自主AI系统的治理模型

Jakob Salfeld-Nebgen

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 针对自主AI系统可能执行不可逆高风险行动的问题,提出一种基于机构证明的计算治理模型,将执行权限与规划推理分离,通过独立权威源证明前提条件,并采用防篡改日志记录决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23348 2026-06-23 cs.LG 新提交 77%

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

基于自我对弈强化学习的Generals.io超人类AI

Matej Straka, Viliam Lisý, Martin Schmid

机构 * Department of Applied Mathematics, Charles University(查尔斯大学应用数学系) Department of Computer Science, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院计算机科学系) EquiLibre Technologies, Inc.(EquiLibre Technologies公司)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.LG

AI总结 通过自研JAX模拟器(单GPU每秒千万帧,提速万倍)和自对弈策略梯度训练视觉Transformer,在实时策略游戏Generals.io中达到超人类水平,1v1排行榜第一,对顶级人类玩家胜率199-70。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18363 2026-06-18 cs.RO cs.AI 新提交 77%

Guava: An Effective and Universal Harness for Embodied Manipulation

Guava: 一种有效且通用的具身操作工具框架

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

机构 * University of Maryland College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Pennsylvania(宾夕法尼亚大学) Amazon FAR(亚马逊 FAR)

专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 提出Guava框架,通过迭代感知-推理-行动循环、语义动作抽象和多模态观测三大关键设计,将具身操作能力蒸馏到4B开源模型中,在仿真和真实环境中性能媲美前沿专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-06-16 cs.CL 新提交 77%

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划决策 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12830 2026-06-12 cs.CV cs.AI 新提交 77%

Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

感知、交互、推理:构建工具增强的视觉智能体用于空间推理

Changye Li, Meng Lu, Yi Wu, Ligeng Zhu

机构 * Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) NVIDIA(英伟达)

专题命中 规划决策 :agent(abstract,abstract_cn);tool-use(abstract);分类 cs.AI

AI总结 提出PERIA智能体,通过视觉感知和交互工具增强VLM的空间推理能力,在13个基准上优于同类模型7.0%-14.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11560 2026-06-11 cs.DB cs.AI 新提交 77%

LLMs+Graphs: Toward Graph-Native, Synergistic AI Systems

LLMs+Graphs:迈向图原生的协同人工智能系统

Arijit Khan, Longxu Sun, Xin Huang

机构 * Bowling Green State University(伯灵顿绿色州立大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 规划决策 :AI agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文综述了大语言模型与图计算的三种协同方式,包括增强推理、知识图谱双向集成及图算法增强的AI代理,并探讨了图数据管理与图机器学习的新能力,旨在为构建下一代图原生AI系统提供统一视角。

Comments 10 pages, Accepted at PAKDD 2066 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05085 2026-08-06 cs.LG cs.AI 新提交 76%

Capability-Gated Planning: Cost-to-Goal Discovery and the Limits of Myopic Experiment Selection

能力门控规划:目标成本发现与近视实验选择的局限性

Ahmed Hassoon, Mark Dredze

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 该研究指出近视实验选择方法无法评估构建认知能力的价值,引入能力门控规划器 CG-Plan 解决此问题,证明近视规划器存在无界近似比且无法到达目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22610 2026-07-28 cs.AI cs.CL 新提交 76%

Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations

Tokengeist:智能对话中的多轮归因追踪

Jessica Tang, Shraddha Barke, Sharad Agarwal

机构 * University of Toronto(多伦多大学) Microsoft Research(微软研究院)

专题命中 规划决策 :agentic(title);分类 cs.AI、cs.CL

AI总结 研究多轮对话中语言模型响应的归因问题,提出多轮上下文归因及 Tokengeist 框架,通过有向无环图递归遍历恢复依赖路径,发布基准 MTCABench,实验表明 Tokengeist 能有效解决现有方法多跳依赖恢复不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09600 2026-07-13 cs.AI cs.CL 新提交 76%

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora:通过基于拍卖的任务分配增强大语言模型智能体推理

Kaiji Zhou, Ales Leonardis, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 规划决策 :agent(title);分类 cs.AI、cs.CL

AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。

Comments Preprint. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04574 2026-07-07 cs.LG cs.AI 新提交 76%

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益

Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 规划决策 :agent(title);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。

Comments Accepted by ICML 2026 Workshop: RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03656 2026-07-07 cs.SE cs.AI cs.CR 新提交 76%

AutoCedar: An Agentic Framework for Verifier-Guided Access Control Policy Synthesis

AutoCedar:用于验证器引导的访问控制策略合成的智能体框架

Adarsh Vatsa, Sachi Shome, Yingming Zhou, William Eiers

专题命中 规划决策 :agentic(title);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型将自然语言需求转化为访问控制代码存在的问题,构建验证器引导系统AutoCedar,先转化需求为可检查目标,再合成Cedar策略,通过分解意图原子等实现端到端策略编写,在多任务和案例中表现良好。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交 75%

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14927 2026-08-18 cs.AI cs.CL cs.LG 新提交 75%

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

大语言模型(LLM)可预测失败风险,但难以预测哪种协作协议能产生回报:推理任务中考虑成本的协议路由

Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究探讨LLM多智能体系统中协作成本与收益的平衡,测试四种协作协议,发现LLM可预测失败风险但难以识别有效协议,置信度可支持初始协作升级,特定协议的成本感知路由仍待解决。

Comments 23 pages, 6 figures; includes appendices and ancillary aggregate-result CSV files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13787 2026-08-17 cs.AI cs.CL cs.LG cs.MA 新提交 75%

From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL

从被动代理到策略谈判者:用SocialRL强化小型语言模型的社会推理能力

Wenyue Hua, Zachary Huang, Tyler Payne, Safoora Yousefi, Saleema Amershi, Asli Celikyilmaz

机构 * Microsoft Research(微软研究院)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出SocialRL方法训练4B语言模型的社会推理能力,经多领域实验,其跨领域整合后模型平均效用达0.627,优于多数GPT系列模型,心智理论蒸馏可提升效用与泛化性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04309 2026-08-06 cs.RO cs.SY eess.SY 新提交 75%

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

面向隐藏目标下零样本人机协作的结构化大语言模型推理

Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo, Vaibhav Srivastava

机构 * Michigan State University(密歇根州立大学) UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 该研究针对隐藏目标下的零样本人机协作,提出结构化LLM架构,通过Dec-POMDP分解决策,实验显示其交互步骤更少、人类信任度更高,优于无ToM推理的变体和离线训练的多智能体强化学习策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21906 2026-07-27 physics.soc-ph 新提交 75%

A Knowledge-Grounded Behavioral Reasoning Framework for Training-Free Urban Healthcare OD Prediction

一种用于无训练城市医疗保健 OD 预测的知识驱动行为推理框架

Linzhen Yang, Xueliang Liu, Chengbo Zhang, Meng Meng

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 研究城市医疗保健 OD 预测问题,提出基于知识驱动行为推理的无训练框架,将异构城市信息组织成知识图谱,通过多智能体推理实现预测。实验表明该框架性能优于传统深度学习基线,凸显城市智能在医疗保健出行建模上从数据拟合到知识驱动推理的潜力。

Comments 16 pages, 9 figures. Submitted to the 4th International Conference on Urban Science and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏