arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1893 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2606.12306 2026-06-11 cs.RO 新提交 71%

UGV-Conditioned Multi-UAV Informative Planning on a Shared Exposure Belief

基于共享暴露信念的UGV条件多无人机信息规划

Lars Oerlemans, Moji Shi, Marija Popovic

机构 * MAVLab, Faculty of Aerospace Engineering, TU Delft(马文实验室,航空航天工程学院,代尔夫特理工大学)

专题命中 规划决策 :planning(title)

AI总结 提出一种协调无人机编队降低地面车辆在未知威胁区导航风险的方法,通过共享暴露信念引导感知并减少冗余覆盖,仿真显示累积暴露降低38%,冗余覆盖从38.8%降至3.7%。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09550 2026-06-09 cs.DB 新提交 71%

InquiTree: Evaluating AI Agents in the Scientific Inquiry Loop with Paper-Derived Research Trees

InquiTree: 在论文衍生研究树中评估科学探究循环中的AI智能体

Shaoyang Cui

专题命中 规划决策 :AI agent(title)

AI总结 提出InquiTree诊断环境,将科学探究形式化为交互式研究树,揭示AI智能体在长周期交互中关键判断退化(认知隧道)及对训练数据外论文性能下降的局限性。

Comments 17 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09014 2026-06-09 cs.IT math.IT 新提交 71%

Deterministic versus Stochastic Optimization for Joint Path Planning and Dynamic Time Splitting in Multiple-UAV-Cached IoT Networks

多无人机缓存物联网网络中联合路径规划与动态时间分割的确定性优化与随机优化

Trinh Van Chien, Dinh Thanh Tung, Waqas Khalid, Ngo Cong Dung, Banh Thi Quynh Mai, Symeon Chatzinotas

专题命中 规划决策 :planning(title)

AI总结 针对多无人机缓存物联网网络,提出基于块坐标下降和遗传算法的联合优化方法,实现动态时间分割、轨迹和传输功率的协同优化,吞吐量提升至少31%。

Comments 15 pages, 6 figures, and 7 tables. Accepted by the IEEE IoT Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16033 2026-08-18 cs.CL 新提交 70%

$R^3$-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets

$R^3$-Bench:大语言模型在共享预算下的资源理性推理能力存在不足

Peisong Wang, Zhiwei Ma, Bowen Liu, Feixue Liu, Aochuan Chen, Chenyi Zi, Hongchuan Zeng, Yuhan Li, Jia Li

机构 * The University of Hong Kong(香港大学) Hunyuan Team, Tencent(腾讯混元团队)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 $R^3$-Bench测试发现,大语言模型在共享预算下的资源理性推理存在不足,其表现出的单问题能力与共享预算下的实际表现存在差距。

Comments Code is available at this https URL (https://github.com/NineAbyss/R-3-Bench). The dataset is available at this https URL (https://huggingface.co/datasets/R-3-Bench/R-3-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15703 2026-08-18 cs.AI 新提交 70%

HyMem: Hierarchical Context Management for Long-Horizon Agents via Information Isolation

HyMem:基于信息隔离的长程智能体分层上下文管理

XinQi Wang, Jinwei Xiao, Sijia Cui, Hongming Zhang, Yanna Wang, Qingyang Zhang, Bo Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing Artificial Intelligence Research of IA(IA南京人工智能研究院)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 针对LLM智能体长程任务上下文杂乱导致推理性能下降的问题,提出分层上下文管理框架HyMem,通过功能分层隔离推理与规划,在GAIA、Browsecomp-plus数据集上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14522 2026-08-17 cs.AI 新提交 70%

Participatory Moral AI Is Not Neutral: The Invisible Hand of Developers

参与式道德人工智能并非中立:开发者的隐形之手

Taenyun Kim, Edyta Bogucka, Daniele Quercia

专题命中 规划决策 :AI agent(abstract,abstract_cn);分类 cs.AI

AI总结 该研究发现,道德AI偏好征集流程中的特征范围、投票者构成、问题措辞三项关键选择会显著影响AI决策,仅靠投票汇总无法实现公平透明的AI,需对流程各阶段审计披露。

Comments 35 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09574 2026-08-11 cs.AI 新提交 70%

The Politician, the Liar, and the Obedient Worker: Emerging Behavior of LLM Agents in Hierarchical Games

政客、骗子与顺从的工人:层级博弈中大语言模型智能体的涌现行为

Fatemeh Seyedin, Adrian Weller, Jinhyuk Yun, Mahmoudreza Babaei

机构 * Soongsil University(崇实大学) GISMA University(GISMA大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究通过层级博弈实验测试6种大语言模型智能体,发现其在不同制度下会涌现出撒谎、私下交易等类似人类的治理失效行为,且模型家族会影响领导层更迭。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09443 2026-08-11 cs.AI 新提交 70%

Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

面向多病老年患者个性化用药安全的耦合图-策略蒸馏方法

Zihan Wang, Anglin Liu, Rongyi Wang, Dantong Li, Yi Lu, Siqing Yuan, Hongxia Xu, Zhongtian Long, Jintai Chen

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ATLAS框架与GeriMedBench基准,通过耦合图-策略蒸馏实现多病老年患者的个性化用药安全,在多基准测试中表现优于对比系统,获临床医生更高评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交 70%

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09119 2026-08-11 cs.AI 新提交 70%

Motif 3: Technical Report

Motif 3:技术报告

Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho, Minsu Ha, Sangho Kang, Beomgyu Kim, Dongseok Kim, Jangwoong Kim, Taehyun Kim, Taewhan Kim, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Dongpin Oh, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Hanbin Jung, Changjin Kang, Minjae Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Yeongjae Park, Bokki Ryu

机构 * Motif Technologies(Motif科技公司)

专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究推出仅解码器的MoE语言模型Motif 3,采用GDLA等技术,经万亿token预训练及多阶段后训练,在长上下文、推理等任务上性能与领先开源模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08804 2026-08-11 eess.SY cs.LG cs.SY 新提交 70%

ML-Based Hierarchical Prediction for Practical Energy Scheduling in Dynamic NTN-WPT Systems

面向动态非地面网络-无线功率传输(NTN-WPT)系统的实用能量调度的机器学习分层预测方法

Zhanyu Ju, Wenchi Cheng

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 针对动态NTN-WPT系统的调度挑战,本文提出含三层预测框架的ML方法,采用MORL与MAPPO模型优化能量调度,仿真显示其权衡性能更优且鲁棒性良好。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08677 2026-08-11 cs.AI 新提交 70%

Branch2Skill: Efficient Skill Evolution Through Reasoning Trees

Branch2Skill:基于推理树的高效技能演化方法

Yanwei Ren, Haotian Zhang, Likang Xiao, Jiaxing Huang, Jiayan Qiu, Baosheng Yu, Quan Chen, Liu Liu

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 Branch2Skill是将推理树转化为密集监督信号的框架,通过蒙特卡洛树搜索提取推理证据并提炼更新,在六个基准测试中提升了任务性能与技能演化效率,以GPT 5.5为目标模型时token用量比SkillOpt少73.2%

Comments 9 pages, 6 figures, 3 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08303 2026-08-11 cs.AI cs.MA 新提交 70%

Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning

通过轨迹投毒对自进化技能实施仅查询式后门攻击

Yuyang Luo, Haoran Wang, Kai Shu

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究针对自进化技能系统提出仅查询式轨迹后门攻击TBA,通过构造查询诱导生成带后门技能,实验证实其可可靠植入条件后门且效果优于直接注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交 70%

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07955 2026-08-11 cs.AI 新提交 70%

Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

面向工具增强空间推理的自演化神经符号技能

Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu, Zhi Zhou, Xinwei Yang, Kun-Yang Yu, Ming Yang, Yang Chen, Yu-Feng Li

专题命中 规划决策 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。

Comments 25 pages, 9 figures, 10 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07885 2026-08-11 cs.AI 新提交 70%

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

广泛推理,而非深度推理:将推理溢价分摊到提炼技能中

Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究提出将推理模式的重复分摊为跨任务提炼的技能,在四个智能体基准上大幅降低代币量的同时恢复多数推理性能,部分场景下优于推理模式。

Comments COLM 2026 Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07796 2026-08-11 cs.AI 新提交 70%

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计

Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue

机构 * Scale AI Emory University(埃默里大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Vanderbilt University Medical Center(范德堡大学医学中心) Stanford School of Medicine(斯坦福医学院) Stanford Health Care(斯坦福医疗保健系统) Clinical Excellence Research Center(临床卓越研究中心)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究推出首个面向部署的临床智能体基准CliniCARE-Bench,评估智能体对真实纵向电子健康记录的医疗推理,发现原始准确率夸大调查质量,无缺陷准确率更低且会重新排序排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06227 2026-08-07 cs.NI cs.AI cs.IT cs.SY eess.SY math.IT 新提交 70%

From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks

从被动镜像到主动智能体:面向网络物理AI的 holonic 数字孪生

Christo Kurisummoottil Thomas, Omar Hashash, Walid Saad

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文针对当前AI嵌入物理系统失效、无线网络架构无法支持实时物理AI协调的问题,提出HDT-Nets框架,通过holonic数字孪生实现实时物理AI推理,为网络物理AI提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交 70%

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04378 2026-08-06 cs.SD cs.LG eess.AS 新提交 70%

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型

Scott H. Hawley

机构 * Belmont University(贝尔蒙特大学)

专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.LG

AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。

Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01937 2026-08-04 cs.AI cs.CY 新提交 70%

A Contractualist Argumentation Framework for Moral Decision-Making

用于道德决策的契约论论证框架

Luis Marcos-Vidal, Giulio Antonio Abbo, Tony Belpaeme

机构 * Hospital del Mar Research Institute(德尔马医院研究所) Ghent University(根特大学) imec(imec研究院)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 该研究针对自主智能体在共享环境中需处理冲突利益的道德决策问题,提出基于Scanlon契约论的、扩展了价值过滤的ASPIC+契约论论证框架,经实例验证其有效性并探讨了与现有方法的关联。

Comments 9 pages; to appear in the proceedings of the Fourth International Workshop on Value Engineering in AI (VALE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01456 2026-08-04 cs.CV cs.CL 新提交 70%

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

基于多模态记忆压缩的长视野具身决策

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00215 2026-08-04 cs.AI 新提交 70%

Personalizing Large Language Model Agents with Small Policy Models

用小型策略模型个性化大型语言模型智能体

Dian Jin, Zhi Zhang, Huichao Li, Yihe Pan, Rundong Huang, Doudou Zhou

专题命中 规划决策 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究提出轻量级策略层FABLE,通过在线学习用户执行策略实现LLM智能体个性化,在多类评估中改进偏好敏感行为且保持端到端任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29078 2026-08-03 cs.LG 新提交 70%

DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation

DASH-OPD:面向在线策略蒸馏的带滞后性的差异感知切换算法

Yuchen Xia, Qianguo Sun, Chao Song, Junlong Wu, Yiyan Qi, Yunjian Xu

机构 * The Chinese University of Hong Kong(香港中文大学) IDEA Research(IDEA研究院) Emdoor Research Institute(亿道研究院)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文针对在线策略蒸馏中执行器切换的问题,提出带滞后性的差异感知切换算法 DASH-OPD,经 ALFWorld 验证,其性能优于所有基线,训练与部署效率更优,相关代码等后续将发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29031 2026-08-03 cs.RO cs.AI 新提交 70%

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28630 2026-08-03 cs.CY cs.AI 新提交 70%

Scaffolding Critical Engagement with GenAI: Transforming Ethnic Minority Preparatory Students' Collaborative Discourse in Prompt Engineering Tasks

为生成式AI(GenAI)搭建批判性参与支架:在提示工程任务中转变少数民族预科生的协作话语

Deliang Wang, Cunling Bian

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究针对中国78名少数民族预科生,通过整合人在回路工作流等的GenAI课程,帮助学生转变对GenAI的依赖,提升提示自我效能,培养其人机协作的批判性认知能动性。

Comments Accepted as a full paper by the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28367 2026-07-31 cs.AI 新提交 70%

How Benchmarks Mis-Score Computer-Use Agents

基准测试如何错误评估计算机使用智能体

Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

机构 * Georgia Institute of Technology(佐治亚理工学院) North Carolina State University(北卡罗来纳州立大学) Lenovo AI Technology Center(联想人工智能技术中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Marquette University(马凯特大学) Fudan University(复旦大学)

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究指出计算机使用智能体的基准测试分数存在可靠性问题,审计150条轨迹发现15.3%的“失败”判定错误,进而推导了CUA评估各阶段的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27599 2026-07-31 cs.AI cs.RO 新提交 70%

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

世界动作规划器:基于动作条件世界模型的通用决策方法

Xiangcheng Zhang, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。

Comments Project page at worldactionplanner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 70%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 70%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏