arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-29 至 2026-05-29 共收录 218 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 65 篇

2602.08013 2026-05-29 cs.AI 79%

Small Agent Group is the Future of Digital Health

小型智能体群是数字健康的未来

Yuqiao Meng, Luoxi Tang, Dazheng Zhang, Rafael Brens, Elvys J. Romero, Nancy Guo, Safa Elkefi, Zhaohan Xi

机构 * State University of New York at Binghamton(纽约州立大学布inghamton分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出小型智能体群(SAG)通过协作推理替代单一大型模型,在数字健康中实现更优的有效性、可靠性和部署效率。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25376 2026-05-29 cs.CR cs.AI cs.CY cs.MA cs.SE 79%

KYA: A Framework-Agnostic Trust Layer for Autonomous Systems with Verifiable Provenance and Hierarchical Policy Composition

KYA: 面向自主系统的框架无关信任层,具有可验证溯源和分层策略组合

Kolawole Quadri

机构 * Veldt Labs(Veldt实验室)

专题命中 规划决策 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 提出KYA,一个框架无关的信任与治理层,通过五元组原语实现自主系统的授权、策略合规和事后可验证性,在跨后端矩阵上全部通过测试,检测89%的对抗性探测。

Comments 26 pages including appendix. Code available under Apache 2.0 at https://github.com/veldtlabs/veldt-kya (pip install veldt-kya). Two-domain worked examples (loan decisioning under NYDFS/ECOA/CFPB; clinical triage under HIPAA/21 CFR Part 11/FDA SaMD).Reproducibility artifacts in-tree

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30140 2026-05-29 cs.CV 78%

AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection

AnomalyAgent: 用于零样本/少样本异常检测的无训练智能体模型

Yi Zhang, Jiawen Zhu, Lele Fu, Guansong Pang

机构 * Singapore Management University(新加坡国立管理学院) Sun Yat-sen University(中山大学)

专题命中 规划决策 :agentic(title,abstract)

AI总结 提出一种基于多模态大语言模型的无训练智能体框架AnomalyAgent,通过定制工具集和记忆模块实现零样本/少样本异常检测,在逻辑/上下文异常等复杂场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29894 2026-05-29 cs.CV 78%

Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

训练智能体而非专家:学习利用异构专家进行多轮视觉推理

Yaowu Fan, Tao Han, Dazhao Du, Andy J. Ma, Jia Wan

机构 * Sun Yat-sen University(中山大学) HKUST(香港科技大学) Harbin Institute of Technology(哈尔滨理工大学)

专题命中 规划决策 :agent(title,abstract)

AI总结 提出VisHarness,一种可训练的视觉智能体,通过解耦高层感知推理与低层任务执行,学习利用异构视觉专家模型,以轻量训练实现多轮交互下的通用视觉任务求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30105 2026-05-29 cs.SE 77%

EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution

EvoRepair: 通过基于经验的自我进化增强漏洞修复智能体

Haichuan Hu, Guoqing Xie, Quanjun Zhang, Jiawei Liu, Shengcheng Yu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 规划决策 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 提出EvoRepair框架,通过循环学习-修复过程积累和复用漏洞修复经验,在多个基准上显著提升LLM的自动漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14113 2026-05-29 cs.CV cs.AI cs.LG cs.MA 76%

ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows

ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性

Alvaro Lopez Pellicer, Plamen Angelov, Marwan Bukhari, Yi Li, Eduardo Soares, Jemma Kerns

机构 * School of Computing and Communications(计算与通信学校) Lancaster University(兰卡斯特大学) Lancaster Medical School(兰卡斯特医学院) PUC-Rio(里约热内卢联邦大学) Puc-Behring Institute for AI(人工智能皮克林研究所)

专题命中 规划决策 :agentic(title);分类 cs.AI、cs.LG

AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。

Comments CVR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25297 2026-05-29 cs.CL cs.AI cs.LG 75%

Eureka: Intelligent Feature Engineering for Enterprise AI Cloud Resource Demand Prediction

Eureka:面向企业AI云资源需求预测的智能特征工程

Hangxuan Li, Renjun Jia, Xuezhang Wu, Yunjie Qian, Zeqi Zheng, Xianling Zhang

机构 * Alibaba Cloud Computing Co. Ltd, Hangzhou, China(阿里云计算有限公司,杭州,中国) School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国) School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) Independent Researcher, United States(独立研究员,美国)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Eureka框架,将特征工程视为智能体代码生成问题,通过专家代理、LLM特征工厂和自演化对齐引擎三阶段,自动生成可执行特征代码,在医疗、金融、社交等7个公开基准及阿里云GPU资源需求预测中显著提升性能。

Comments accepted at NeurIPS 2025 Workshop, DASFAA 2026 (International Conference on Database Systems for Advanced Applications)

Journal ref Database Systems for Advanced Applications (DASFAA 2026), Lecture Notes in Computer Science, vol. 16540, pp. 528-540, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29251 2026-05-29 cs.AI cs.CR 74%

Provably Secure Agent Guardrail

可证明安全的智能体护栏

Benlong Wu, Weiming Zhang, Kejiang Chen, Han Fang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 针对现有语义护栏无法提供确定性安全下界的问题,提出基于逻辑推理基本限制的新安全范式,并引入可执行证明约束动作框架,通过神经符号隔离架构实现零攻击成功率和零误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-05-29 cs.RO cs.AI cs.LG 73%

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11389 2026-05-29 cs.AI 70%

Causal-JEPA: Learning World Models through Object-Level Latent Masking

Causal-JEPA:通过对象级潜在掩码学习世界模型

Heejeong Nam, Quentin Le Lidec, Lucas Maes, Yann LeCun, Randall Balestriero

机构 * Brown University, GalilAI(布朗大学,GalilAI) New York University(纽约大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出C-JEPA,一种通过对象级潜在掩码扩展联合嵌入预测的对象中心世界模型,在视觉问答和智能体控制任务中分别提升反事实推理20%和仅用1%潜在特征实现高效规划。

Comments Project Page: https://hazel-heejeong-nam.github.io/cjepa/ ICML 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30011 2026-05-29 cs.CV cs.AI 70%

VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

VisualThink-VLA:用于高效低延迟视觉-语言-动作策略的视觉中间推理

Mingjian Gao, Wenqiao Zhang, Yuqian Yuan, Yang Dai, Binhe Yu, Zheqi Lv, Haoyu Zheng, Jiaqi Zhu, Zhiqi Ge, Zixuan Wan, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) National University of Singapore(新加坡国立大学) Xi'an University of Electronic Science and Technology(西安电子科技大学)

专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出VisualThink-VLA框架,通过视觉中间推理和选择性路由机制,在保持高精度的同时将推理延迟从数秒降至亚秒级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29307 2026-05-29 cs.CL cs.AI cs.IR cs.LG 67%

GrepSeek: Training Search Agents for Direct Corpus Interaction

GrepSeek:训练用于直接语料库交互的搜索代理

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出GrepSeek,一种通过两阶段训练(冷启动数据集+GRPO优化)和语义保持的分片并行执行引擎,训练紧凑型搜索代理直接与文本语料库交互(通过shell命令),在开放域问答中取得最优F1和精确匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29788 2026-05-29 cs.AI cs.LG 62%

Certified Policy Optimisation for Nested Causal Bandits via PAC-Bayes Risk

嵌套因果赌博机的认证策略优化:基于PAC-Bayes风险

Tim Woydt, Paul-David Zuercher

机构 * ProdAxon

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌套因果汤普森采样(NCTS)算法,通过PAC-Bayes超额风险界对历史数据进行离线、任意时刻的部署策略认证,解决分层因果赌博机中的跨时间尺度因果耦合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02103 2026-05-29 cs.LG cs.CL 62%

How Far Ahead Do LLMs Plan? Uncovering the Latent Horizon in Chain-of-Thought Reasoning

LLMs 能提前多远规划?揭示思维链推理中的潜在视界

Liyan Xu, Mo Yu, Fandong Meng, Jie Zhou

机构 * WeChat AI, Tencent Inc(腾讯AI实验室)

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 通过探测方法 Tele-Lens 研究 LLMs 在思维链推理中的潜在规划能力,发现其具有短视视界,并基于此提出利用稀疏枢轴位置增强不确定性估计及自动识别 CoT 绕过的假设。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22437 2026-05-29 cs.AI cs.CL 62%

Modeling Hierarchical Thinking in Large Reasoning Models

大型推理模型中的层次化思维建模

G M Shahariar, Erfan Shayegani, Ali Nazari, Nael Abu-Ghazaleh

机构 * University of California, Riverside(加州大学河滨分校) Independent Researcher(独立研究者)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出将大型推理模型(LRM)的层次化推理动态近似为有限状态机(FSM)中的轨迹,并通过Q值引导的推理时控制方法实现高效推理优化。

Comments Accepted in ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29440 2026-05-29 cs.CL cs.AI cs.IR 62%

SkillBrew: Multi-Objective Curation of Skill Banks for LLM Agents

SkillBrew: LLM智能体技能库的多目标策展

Wentao Hu, Zhendong Chu, Yiming Zhang, Junda Wu, Ming Jin, Xiangyu Zhao, Yilei Shao, Yanfeng Wang, Qingsong Wen

机构 * City University of Hong Kong(香港城市大学) Squirrel Ai Learning University of Science and Technology of China(中国科学技术大学) University of California, San Diego(加州大学圣地亚哥分校) Griffith University(格里菲斯大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SkillBrew框架,将技能库策展建模为带效用约束的帕累托优化问题,通过双层提议-验证循环实现技能库的精简与多样性。

Comments 16 pages. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29398 2026-05-29 cs.LG cs.AI 62%

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

GDSD:强化学习作为扩散语言模型的引导去噪器自蒸馏

Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong Yoon, Ilija Bogunovic

机构 * UCL Dept. of Statistical Science(伦敦大学学院统计科学系) UCL Centre for AI(伦敦大学学院人工智能中心) Alibaba Group(阿里巴巴集团) Dept. of EEE(电子工程系) Imperial College London(伦敦帝国理工学院) UNIST(全南大学) University of Basel(巴塞尔大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出引导去噪器自蒸馏(GDSD)方法,通过从逆KL正则化强化学习的闭式最优解中导出的优势引导自教师直接蒸馏扩散语言模型的去噪器,避免了ELBO似然代理带来的训练-推理不匹配偏差,在规划、数学和代码基准上显著优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27377 2026-05-29 cs.CL cs.AI cs.IR 62%

Enhancing LLM Medical Coding with Structured External Knowledge

利用结构化外部知识增强LLM医学编码

Yidong Gan, David D. Nguyen, Yang Lin, Peter Zhong, Thanh Vu, Long Duong, Yuan-Fang Li

机构 * Oracle Health and AI(Oracle健康与AI)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出RAG-Coding方法,通过将ICD表格列表编码为知识图谱并提炼指南摘要,无需训练即可增强LLM的医学编码能力,在MDACE和MDACE-2025数据集上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23993 2026-05-29 cs.CV cs.AI cs.LG 62%

Nano World Models: A Minimalist Implementation of Future Video Prediction

纳米世界模型:未来视频预测的极简实现

Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Kaiwen Geng, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

机构 * DeepMind

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Nano World Models,一个基于扩散强迫的极简代码库,用于未来视频预测,支持可控研究世界模型的设计选择,并通过实验分析预测参数化、架构规模等因素对视频预测质量的影响。

Comments Project page: https://simchowitzlabpublic.github.io/nano-world-model/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16548 2026-05-29 cs.LG cs.AI cs.CV 62%

A Composable Multimodal Framework for cine CMR-Text-Driven Prediction of Heart Failure Outcomes

用于电影心脏磁共振-文本驱动的心力衰竭结局预测的可组合多模态框架

Jianzhou Chen, Jinyang Sun, Xiumei Wang, Xi Chen, Heyu Chu, Guo Song, Yuji Luo, Xingping Zhou, Rong Gu

机构 * Department of Cardiology, Nanjing Drum Tower Hospital, State Key Laboratory of Pharmaceutical Biotechnology, Nanjing University(南京鼓楼医院心内科,南京大学国家药物生物技术重点实验室) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) College of Electronic and Optical Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学电子与光学工程学院) College of Integrated Circuit Science and Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学集成电路科学与工程学院) Department of Cardiology, Nanjing Drum Tower Hospital Clinical College of Nanjing Medical University(南京医科大学南京鼓楼医院临床学院心内科) Institute of Quantum Information and Technology, Nanjing University of Posts and Telecommunications(南京邮电大学量子信息与技术研究院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可组合多模态框架,通过整合cine CMR影像、结构化临床指标和非结构化文本记录,实现比单模态AI算法更准确的心力衰竭预后预测,并支持个性化治疗优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30245 2026-05-29 cs.CL 57%

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

知道在如何解决之前该解决什么:预规划赋能的大语言模型数学推理

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 提出PPC框架,通过引入显式的问题理解阶段(预规划)来弥补现有规划推理方法中“如何解决”与“该解决什么”之间的范式差距,在多个数学推理基准上取得最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30159 2026-05-29 cs.AI 57%

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents

元认知记忆策略优化用于长视野LLM智能体

Ziyan Liu, Zhezheng Hao, Yeqiu Chen, Hong Wang, Jingren Hou, Ruiyi Ding, Yongkang Yang, Wence Ji, Wei Xia, Feng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对长视野任务中记忆策略训练缺乏中间监督的问题,提出基于信念熵的元认知记忆策略优化(MMPO),通过自监督代理惩罚高认知不确定性摘要,提升长期推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30150 2026-05-29 cs.AI 57%

Anchorless Diversification for Parallel LLM Ideation

无锚点多样化并行LLM创意生成

Fares Nabil Ibrahim, Nafis Saami Azad, Raiyan Abdul Baten

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing, University of South Florida(贝尔尼人工智能、网络安全与计算学院,佛罗里达州立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究无锚点方法(如语义方向分层)在并行LLM创意生成中实现候选池多样化,无需依赖种子想法,在多样性、质量和计算效率上优于有锚点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30058 2026-05-29 cs.CL 57%

HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?

HEART-Bench: 大语言模型智能体是否表现出类似人类的心理学?

Weihan Peng, Chenxu Zhang, Qianao Wang, Yuling Shi, Heng Lian, Qihong Mao, Jiahao Pang, Chunliang Feng, Bowen Li, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) Quwan Group(启元集团) University of Washington(华盛顿大学) South China Normal University(华南师范大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 提出HEART-Bench基准,通过构建基于大五人格和自传体记忆的虚拟角色,在DIAMONDS情境框架下评估LLM智能体能否展现一致的人类心理特征。

Comments GitHub: https://github.com/peng-weihan/HEART-BENCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13517 2026-05-29 q-bio.NC cs.LG 57%

A Deep Learning Model of Mental Rotation Informed by Interactive VR Experiments

基于交互式VR实验的心理旋转深度学习模型

Raymond Khazoum, Daniela Fernandes, Aleksandr Krylov, Qin Li, Stephane Deny

机构 * Department of Computer Science, Aalto University, Espoo, Finland(奥卢大学计算机科学系,芬兰埃斯波) Department of Neuroscience and Biomedical Engineering, Aalto University, Espoo, Finland(奥卢大学神经科学与生物医学工程系,芬兰埃斯波)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出一个由等变编码器、神经符号对象编码器和神经决策代理组成的深度学习模型,通过VR实验验证,准确模拟人类心理旋转的性能、响应时间和行为。

Comments Version accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04733 2026-05-29 cs.CV cs.AI 57%

E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving

E3AD:面向以人为中心的端到端自动驾驶的情感感知视觉-语言-动作模型

Yihong Tang, Haicheng Liao, Tong Nie, Junlin He, Ao Qu, Kehua Chen, Wei Ma, Zhenning Li, Lijun Sun, Chengzhong Xu

机构 * McGill University(麦吉尔大学) University of Macau(澳门大学) The Hong Kong Polytechnic University(香港理工大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出E3AD框架,通过连续VAD情感模型和双路径空间推理模块,将情感理解融入视觉-语言-动作模型,实现开放域端到端自动驾驶中的情感感知轨迹规划,在真实数据集上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29578 2026-05-29 cs.AI 57%

GPS-Enhanced Tourist Mobility Modeling with Seasonal Spatial Priors and LLM-Based Activity Chain Generation

基于季节性空间先验和LLM活动链生成的GPS增强游客移动性建模

Yifan Liu, Yanling Sang, Xishun Liao, Morgan Sun, Bo Yang, Zhiyuan Zhang, Chris Stanford, Haoxuan Ma, Jiaqi Ma

机构 * UCLA Mobility Lab, Department of Civil and Environmental Engineering, University of California, Los Angeles(加州大学洛杉矶分校移动实验室,土木与环境工程系,加州大学洛杉矶分校) Novateur Research Solutions(Novateur研究解决方案) University of Central Florida(中央佛罗里达大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种四阶段仿真框架,结合GPS和调查数据推导的月份条件空间先验、游客人口统计信息、距离可行区域序列分配以及基于LLM的活动链生成,以解决游客移动性建模中非例行、吸引驱动且对旅行目的、季节和成员组成高度敏感的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29568 2026-05-29 cs.AI 57%

DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning

DeepTool: 通过过程监督强化学习扩展工具集成推理中的交错思考

Yang He, Xiao Ding, Bibo Cai, Yufei Zhang, Kai Xiong, Zhouhao Sun, Bing Qin, Ting Liu

机构 * Research Center for Social Computing(社会计算研究中心) Interactive Robotics, Harbin Institute of Technology, China(交互机器人,哈尔滨工业大学,中国)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对工具集成推理中缺乏逐步监督和自纠正能力的问题,提出DeepTool框架,通过合成交错轨迹和基于动作中心过程奖励的GRPO强化学习,显著提升模型在多个基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29559 2026-05-29 cs.CL 57%

LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

LiteCoder-Terminal: 扩展用于学习语言代理的长时程终端环境

Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 提出零依赖合成框架LiteCoder-Terminal-Gen,自动生成可执行且可验证的终端训练环境,构建大规模SFT和RL数据集,通过监督微调和直接多轮偏好优化显著提升语言代理在终端任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29491 2026-05-29 cs.AI 57%

The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF

帮助的诅咒:通过 DistractionIF 在干扰指令鲁棒性中的逆缩放定律

Zeli Su, Zhankai Xu, Tianlei Chen, Longfei Zheng, Xiaolu Zhang, Jun Zhou, Wentao Zhang

机构 * Minzu University of China, Beijing, China(民族大学,北京,中国) Renmin University of China, Beijing, China(中国人民大学,北京,中国) Peking University, Beijing, China(北京大学,北京,中国)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出 DistractionIF 基准,发现大语言模型在参考文本中干扰指令的鲁棒性存在逆缩放现象,并通过 GRPO 强化学习提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏