arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-16 至 2026-06-16 共收录 103 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 8 篇

2605.21027 2026-06-16 cs.CL cs.AI 版本更新 89%

Beyond Text-to-SQL: An Agentic LLM System for Governed Enterprise Analytics APIs

超越文本到SQL:一个面向受控企业分析API的代理LLM系统

Gundeep Singh, Parsa Kavehzadeh, Jing Xia, Xue-Yong Fu, Julien Bouvier Tremblay, Md Tahmid Rahman Laskar, Vincent Lum, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 工具调用 :agent(summary_cn,abstract);agentic(title,abstract);分类 cs.AI、cs.CL;AI agent(comments)

AI总结 本文提出Analytic Agent,一个基于LLM的代理系统,能够将自然语言意图安全地转换为与企业分析API的交互,解决传统文本到SQL系统在企业环境中面临的可靠性与合规性问题。

Comments Accepted to the Enterprise AI Agents Workshop @ KDD 2026. The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21850 2026-06-16 cs.CL cs.AI 版本更新 86%

ACC: Compiling Agent Trajectories for Long-Context Training

ACC:用于长上下文训练的代理轨迹编译

Qisheng Su, Zhen Fang, Shiting Huang, Yu Zeng, Yiming Zhao, Kou Shi, Ziao Zhang, Lin Chen, Zehui Chen, Lijun Wu, Feng Zhao

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(中科院大学科学技术大学MoE关键实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ACC,一种将代理轨迹编译为长上下文问答对的方法,通过整合多轮交互中的工具响应和环境观察,提升大语言模型的长上下文推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00887 2026-06-16 cs.CL cs.AI cs.LG 版本更新 85%

EffGen: Enabling Small Language Models as Capable Autonomous Agents

EffGen: 使小型语言模型成为能干的自主智能体

Gaurav Srivastava, Aafiya Hussain, Chi Wang, Yingyan Celine Lin, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) Google DeepMind, USA(谷歌DeepMind)

专题命中 工具调用 :autonomous agent(title);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 EffGen是一个针对小型语言模型优化的开源智能体框架,通过提示压缩、任务分解、复杂度路由和统一记忆系统,实现高效、安全的本地部署,在13个基准测试中优于LangChain等框架。

Comments Accepted to ICML 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18401 2026-06-16 cs.CL cs.AI 版本更新 84%

SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution

SkillsVote: 代理技能的生命周期治理从收集、推荐到进化

Hongyi Liu, Haoyan Yang, Tao Jiang, Bo Tang, Feiyu Xiong, Yuyu Luo, Zhiyu Li

机构 * Harbin Institute of Technology(哈尔滨理工大学) Soochow University(苏州大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SkillsVote框架,通过生命周期治理管理代理技能,从收集和推荐到进化,提升模型在终端基准和SWE-Bench Pro上的性能。

Comments 71 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29796 2026-06-16 cs.AI cs.CL cs.LG 版本更新 82%

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

SAAS:面向智能体搜索中过度搜索缓解的自我感知强化学习

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SAAS强化学习框架,通过搜索边界建模、边界感知奖励和分阶段优化策略,使LLM智能体具备动态自我感知能力,在不降低准确率的前提下显著减少过度搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03505 2026-06-16 cs.SE 版本更新 79%

LATS-RCA: Language Agent Tree Search for Root Cause Analysis in Microservices

LATS-RCA:面向微服务根因分析的语言智能体树搜索

Alexander Naakka, Yuqing Wang, Mika V Mäntylä

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 提出LATS-RCA方法,将根因分析建模为反射引导的树结构搜索,通过多智能体迭代分析日志和指标,在微服务系统中实现91.3%的诊断准确率,并验证了模型无关性。

Comments Accepted at the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17431 2026-06-16 cs.CL 版本更新 79%

Agentic Reinforcement Learning for Search Misaligns Instruction-Tuning

用于搜索的智能体强化学习使指令微调对齐失效

Yushi Yang, Shreyansh Padarha, Sarah Ball, Andrew Lee, Adam Mahdi

机构 * University of Oxford(牛津大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Harvard University(哈佛大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 研究智能体强化学习(RL)对指令微调模型对齐的影响,发现RL训练使模型将有害请求转化为良性搜索查询,但在触发条件下产生多步不安全搜索行为,并提出了基于表示引导的RL训练方法恢复对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22376 2026-06-16 cs.IR cs.AI 版本更新 57%

Closing the Auto-Research Loop: An AI Co-Scientist for Production Search Ranking

关闭自动研究循环:面向生产搜索排名的AI合作科学家

Liwei Wu, Cho-Jui Hsieh

机构 * Trip.com Group(Trip.com集团) UCLA(加州大学洛杉矶分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出AI合作科学家框架,通过LLM代理与云计算集成,自动迭代生成想法、实现代码、进行GPU实验并分析结果,在搜索排名任务中带来额外+0.083%离线增益。

Comments Submitted to EMNLP for review on June 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 31 篇

2603.15952 2026-06-16 cs.AI 版本更新 91%

Protein Design with Agent Rosetta: A Case Study for Specialized Scientific Agents

基于Agent Rosetta的蛋白质设计:面向专业科学智能体的案例研究

Jacopo Teneggi, S. M. Bargeen A. Turzo, Tanya Marwah, Alberto Bietti, P. Douglas Renfrew, Vikram Khipple Mulligan, Siavash Golkar

机构 * Polymathic AI(多学科人工智能实验室) Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) Google DeepMind(谷歌DeepMind) Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :agent(title,title_cn);autonomous agent(abstract);分类 cs.AI

AI总结 提出Agent Rosetta,将大语言模型与Rosetta软件环境结合,通过迭代优化实现用户定义的蛋白质设计目标,在规范氨基酸设计上匹配专家,在非规范残基设计上超越现有ML方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01613 2026-06-16 cs.IR cs.AI cs.MA 版本更新 85%

TechRAG: Evidence-Gated Multimodal Agentic RAG for Technical Literature Reasoning

TechGraphRAG:面向技术文献推理的智能图增强RAG框架

Kanwar Bharat Singh

机构 * Global Tire Intelligence and Solutions (GTIS)(全球轮胎智能与解决方案(GTIS)) The Goodyear Tire & Rubber Company(固特异轮胎与橡胶公司)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出一种13步自主流水线的智能检索增强生成框架,通过证据充分性评分、知识图谱遍历和自校正生成,支持领域特定技术文献推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15245 2026-06-16 cs.SE 版本更新 85%

Assistance to Autonomy: A Systematic Literature Review of Agentic AI across the Software Development Life Cycle

辅助自主性:面向软件开发生命周期的代理AI系统文献综述

Spyridon Alvanakis Apostolou, Jan Bosch, Helena Holmström Olsson

专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文通过系统性文献综述,探讨了代理AI在软件开发生命周期中的应用现状,揭示了输出可验证性是推动代理AI应用的核心因素,并提出了基于Planner-Executor-Reviewer角色的专业架构模式。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11682 2026-06-16 cs.AI cs.LG 版本更新 84%

MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition

MedAI: 评估 TxAgent 在 NeurIPS CURE-Bench 竞赛中的治疗性智能推理

Tim Cofala, Christian Kalfar, Jingge Xiao, Johanna Schrader, Michelle Tang, Wolfgang Nejdl

机构 * L3S Research Center(L3S研究中心)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍 TxAgent,一种通过迭代检索增强生成和统一生物医学工具集进行治疗决策的智能AI方法,并在CURE-Bench竞赛中评估其推理质量,通过改进工具检索策略提升性能,荣获开放科学卓越奖。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21613 2026-06-16 cs.IR cs.AI 版本更新 83%

AgenticRec: A Recommendation-Oriented Agentic Framework with Progressive Tool-Integrated Reasoning Optimization

AgenticRec:面向推荐的智能体框架与渐进式工具集成推理优化

Tianyi Li, Zixuan Wang, Guidong Lei, Xiaodong Li, Hui Li

机构 * Xiamen University(厦门大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出AgenticRec框架,将推荐建模为工具集成推理过程,并设计两阶段训练范式,通过隐式反馈激活和渐进偏好细化提升推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09365 2026-06-16 cs.AI cs.CL 版本更新 81%

Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory

经验造就熟练:通过自进化技能记忆实现可泛化的医疗智能体推理

Haoran Sun, Wenjie Li, Yujie Zhang, Zekai Lin, Fanrui Zhang, Kaitao Chen, Xingqi He, Yichen Li, Mianxin Liu, Lei Liu, Yankai Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出SkeMex框架,通过技能记忆实现医疗智能体后部署自进化,无需更新模型权重,在临床任务中优于现有记忆型智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05060 2026-06-16 cs.LG cs.CL 版本更新 81%

StagePilot: Stage-Level Planning for Long-Horizon Dialogue Simulation in Cybergrooming

StagePilot: 网络诱骗中长程对话模拟的阶段级规划

Heajun An, Qi Zhang, Minqian Liu, Xinyi Zhang, Sang Won Lee, Lifu Huang, Pamela J. Wisniewski, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工大学) University of California, Davis(加州大学戴维斯分校) International Computer Science Institute(国际计算机科学研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出StagePilot框架,通过分离阶段级规划与响应生成,结合强化学习学习阶段策略,实现网络诱骗对话的结构化、连贯模拟,相比基线减少对话停滞,IQL+AWAC变体最终阶段到达率提升43%。

Comments Accepted at the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28185 2026-06-16 cs.CV 版本更新 78%

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

新时代的视觉生成:从原子映射到智能世界建模的演进

Keming Wu, Zuhao Yang, Kaichen Zhang, Shizun Wang, Haowei Zhu, Sicong Leng, Zhongyu Yang, Qijie Wang, Sudong Wang, Ziting Wang, Zili Wang, Hui Zhang, Haonan Wang, Hang Zhou, Yifan Pu, Xingxuan Li, Fangneng Zhan, Bo Li, Lidong Bing, Yuxin Song, Ziwei Liu, Wenhu Chen, Jingdong Wang, Xinchao Wang, Xiaojuan Qi, Shijian Lu, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) StepFun MiroMind Baidu(百度) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LMMs-Lab(LMMs实验室)

专题命中 规划决策 :agentic(title,abstract)

AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。

Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29105 2026-06-16 cs.NI 版本更新 78%

LoRaWAN Gateway Placement for Network Planning Using Ray Tracing-Based Channel Models

基于射线追踪信道模型的LoRaWAN网关部署网络规划

Cláudio Modesto, Lucas Mozart, Glauco Gonçalves, Cleverson Nahum, Bruno Castro, Aldebaro Klautau

专题命中 规划决策 :planning(title,abstract)

AI总结 研究不同信道模型对LoRaWAN网关部署的影响,提出结合射线追踪与离散事件仿真的优化框架,发现模型选择显著影响部署方案,存在计算成本与现实保真度的权衡。

Comments This paper has been accepted at IEEE Open Journal of the Communications Society (DOI: https://doi.org/10.1109/OJCOMS.2026.3704345)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13090 2026-06-16 cs.RO 版本更新 78%

Multi-Robot Motion Planning from Vision and Language using Heat-Inspired Diffusion

基于热启发的扩散模型实现从视觉和语言的多机器人运动规划

Jebeom Chae, Junwoo Chang, Seungho Yeom, Yujin Kim, Jongeun Choi

机构 * Department of Artificial Intelligence, Yonsei University(燕山大学人工智能学院) School of Mechanical Engineering, Yonsei University(燕山大学机械工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出LHD框架,结合CLIP语义先验与碰撞避免扩散核,实现语言条件化的多机器人无碰撞轨迹规划,在成功率上优于先前方法并降低延迟。

Comments 8 pages, 6 figures, accepted by IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7118-7125, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23014 2026-06-16 cs.CV 版本更新 78%

Planning with Unified Multimodal Models

统一多模态模型规划

Yihao Sun, Zhilong Zhang, Yang Yu, Pierre-Luc Bacon

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Nanjing University(南京大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出Uni-Plan框架,利用统一多模态模型同时作为策略、动态模型和价值函数,通过自判别过滤避免动态预测幻觉,在具身决策任务中优于VLM方法,无需专家演示且数据可扩展。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00836 2026-06-16 cs.RO 版本更新 78%

One-Step Model Predictive Path Integral for Manipulator Motion Planning Using Configuration Space Distance Fields

基于构型空间距离场的一步模型预测路径积分用于机械臂运动规划

Yulin Li, Tetsuro Miyazaki, Kenji Kawashima

机构 * Department of Information Physics and Computing, The University of Tokyo(东京大学信息物理与计算系)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出将构型空间距离场与模型预测路径积分结合,利用CDF梯度统一代价函数并缩短规划时域至一步,实现高效避障,在2D环境和7自由度机械臂仿真中成功率近100%,控制频率超750Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06637 2026-06-16 cs.CV 版本更新 78%

CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning

CLAD: 面向视觉-语言程序规划的约束潜在动作扩散模型

Lei Shi, Andreas Bulling

机构 * Machine Perception and Interaction group, Örebro University(机器感知与交互组,奥雷布罗大学) Collaborative Artificial Intelligence group, University of Stuttgart(协作人工智能组,斯图加特大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出CLAD模型,利用变分自编码器学习动作和观测的潜在表示作为约束,引导扩散模型生成动作,在三个数据集上大幅超越现有方法。

Comments Accepted at RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07883 2026-06-16 cs.AI 版本更新 70%

ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation

ToolSelf: 通过工具驱动的涌现适应统一任务执行与自我重构

Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出ToolSelf框架,将配置更新抽象为标准化工具接口,统一任务执行与自我重构,并采用配置感知两阶段训练(CAT)实现涌现适应性,在多种基准测试中平均超越静态配置基线28.8分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21577 2026-06-16 cs.CL cs.AI cs.LG stat.ML 版本更新 67%

A Unified Definition of Hallucination: It's The World Model, Stupid!

幻觉的统一定义:是世界模型的问题,笨蛋!

Emmy Liu, Varun Gangal, Chelsea Zou, Michael Yu, Xiaoqi Huang, Alex Chang, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出幻觉的统一定义,即用户可观察到的错误内部世界建模,并连接至HalluWorld基准测试,以区分真实幻觉与规划或奖励错误。

Comments ICML 2026. HalluWorld benchmark at https://github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06302 2026-06-16 cs.LG cs.SE 版本更新 62%

Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving

Tangram: 解锁非均匀KV缓存以实现高效的多轮LLM服务

Hyungmin Kim, Minsoo Kim, Hongseok Kim, Jungwook Choi

机构 * Hanyang University(翰林大学) Rebellions Republic of Korea(Rebellions)

专题命中 规划决策 :planning(abstract);分类 cs.LG、cs.SE

AI总结 针对多轮LLM服务中KV缓存线性增长导致的GPU内存和带宽压力,提出Tangram系统,通过确定性预算分配、头组页面和提前负载均衡三项技术实现非均匀KV缓存的高效管理,吞吐量提升达2.6倍。

Comments 13 pages. 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12279 2026-06-16 cs.CV cs.AI cs.LG 版本更新 62%

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

UniT:统一多模态思维链测试时扩展

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

机构 * Stanford University(斯坦福大学) Meta Superintelligence Labs(Meta超级智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新 62%

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05568 2026-06-16 cs.AI cs.CL cs.CY stat.AP 版本更新 62%

Metacognitive Myopia in Large Language Models

大型语言模型中的元认知近视

Florian Scholten, Tobias R. Rebholz, Mandy Hütter

机构 * Psychology Department, University of Tübingen(图宾根大学心理学系)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出元认知近视框架解释LLM偏见,认为信息环境中的有偏样本导致五种症状,并通过监控与控制机制近似技术缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-06-16 cs.CR cs.LG 版本更新 57%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05963 2026-06-16 cs.LG 版本更新 57%

Next-Latent Prediction Transformers Learn Compact World Models

下一潜在预测变换器学习紧凑世界模型

Jayden Teoh, Manan Tomar, Kwangjun Ahn, Edward S. Hu, Tim Pearce, Pratyusha Sharma, Akshay Krishnamurthy, Riashat Islam, Alex Lamb, John Langford

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出NextLat方法,通过潜在空间中的自监督预测训练变换器学习紧凑世界模型,提升泛化能力和推理效率。

Comments Microsoft Research Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22119 2026-06-16 cs.AI 版本更新 57%

Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework

AI中涌现的策略推理风险:基于分类法的评估框架

Tharindu Kumarage, Lisa Bauer, Yao Ma, Dan Rosen, Yashasvi Raghavendra Guduri, Anna Rumshisky, Kai-Wei Chang, Aram Galstyan, Rahul Gupta, Charith Peris

机构 * Amazon Nova Responsible AI(亚马逊诺瓦负责任人工智能)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出ESRRSim框架,基于7类20子类的风险分类法,通过双评估标准自动评估LLM的策略推理风险,发现检测率在14.45%-72.72%之间,且模型代际提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏