arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1893 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2606.31038 2026-07-01 cs.GR cs.AI 新提交 57%

LLM-Driven Personalities for Decision Making in Emergency Simulations

用于紧急模拟决策的LLM驱动个性

Stefano Calzolari, Rubens Montanha, Gabriel Schneider, Gustavo Wide, Paulo Knob, Francesco Strada, Andrea Bottino, Soraia Raupp Musse

机构 * Politecnico di Torino(都灵理工大学) PUCRS(南里奥格兰德天主教大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本研究利用大语言模型(LLM)结合OCEAN人格特质驱动虚拟人在疏散模拟中的决策,发现不同人格特质显著影响个体行为和群体模拟结果,增强了模拟环境的真实性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25354 2026-07-01 cs.CL 新提交 57%

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

通过局部分支路由实现高效且可训练的语言模型测试时扩展

Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

机构 * Northwestern University(西北大学) Rutgers University(罗格斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织) Tilde Research(Tilde研究) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) University of California, San Diego(加州大学圣迭戈分校)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10044 2026-06-30 cs.AI 新提交 57%

Business World Model

商业世界模型

Cecil Pang, Hiroki Sayama

机构 * AI Engineering, USA TODAY Co., Inc.(AI工程,USA TODAY公司) School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学宾夕法尼亚州立大学) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学复杂系统中心) Waseda Innovation Lab, Waseda University, Tokyo, Japan(早稻田大学创新实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出商业世界模型(BWM)架构,将世界模型思想应用于商业环境,通过编码状态、动态、约束和目标,支持自主决策与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27872 2026-06-29 cs.RO cs.AI 新提交 57%

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation

S$^2$-VLA:面向长时程操作的基于状态空间的视觉-语言-动作模型

Zhipeng Xie, Zongyi Han, Xiangyi Wei, Shiliang Sun, Yang Li, Jing Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院海底科学国家重点实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对长时程操作任务中累积误差导致性能下降的问题,提出S$^2$-VLA框架,通过状态空间引导的自适应注意力机制动态融合视觉、语言和动作信息,在LIBERO等基准上超越7B模型。

Comments Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27736 2026-06-29 cs.AI cs.CR 新提交 57%

ToE: A Hierarchical and Explainable Claim Verification Framework with Dynamic Multi-source Evidence Retrieval and Aggregation

ToE:一种具有动态多源证据检索与聚合的分层可解释声明验证框架

Zhaoqi Wang, Zijian Zhang, Kun Zheng, Zhen Li, Xin Li, Chunlei Li, Jiamou Liu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学信息科学与技术学院) TravelSky Technology Limited(TravelSky技术有限公司) School of Computer Science, University of Auckland(奥克兰大学计算机科学学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出Tree of Evidence (ToE)框架,通过强化学习驱动的多源检索、证据评估和参数树聚合,实现可解释的自动事实核查,在多个数据集上提升4-24个百分点,尤其对抗性毒化输入效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27624 2026-06-29 cs.RO cs.LG 新提交 57%

Physics-Guided Robotic Radiation Source Localization along Arbitrary Measurement Paths in Unstructured Environments

物理引导的机器人辐射源定位:非结构化环境中沿任意测量路径

Hojoon Son, Kai Tan, Fan Zhang

机构 * George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology(乔治·W·伍德拉夫机械工程学院,佐治亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出基于物理信息机器学习(PIML)的框架,使机器人沿任意路径在未知环境中精确估计辐射源位置,避免接近源,并通过并行计算提高鲁棒性。

Comments 18 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27136 2026-06-26 cs.AI 新提交 57%

Joint Learning of Experiential Rules and Policies for Large Language Model Agents

大型语言模型智能体的经验规则与策略联合学习

Shicheng Ye, Chao Yu

机构 * Sun Yat-sen University(中山大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出JERP框架,通过联合更新经验规则库和策略,使规则与演化策略对齐,在AlfWorld和WebShop上提升复杂交互任务的决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交 57%

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26981 2026-06-26 cs.RO cs.AI 新提交 57%

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26874 2026-06-26 cs.AI 新提交 57%

TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation

TAVR-VLM:面向抗幻觉报告生成的风险条件因果基础

Zhixiang Lu, Xiwei Liu, Sifan Song, Changkai Ji, Anh Nguyen, Jionglong Su, Imran Razzak, Jinfeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学) University of Liverpool(利物浦大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出TAVR-VLM框架,通过风险条件因果注意力(R-CGA)建立“风险→区域→词”的结构化基础路径,在TAVR规划中减少诊断幻觉,实现新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26700 2026-06-26 cs.RO cs.AI 新提交 57%

Learning Motion Feasibility from Point Clouds in Cluttered Environments

从杂乱环境中的点云学习运动可行性

Sajid Ansari, Arthi, Girish Varma, Antony Thomas

机构 * International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出直接从RGB-D观测学习7自由度机械臂运动可行性预测的方法,构建包含270万抓取可行性标签的大规模基准,并评估三种分类器架构,最佳模型GRASPFC-PTX在新型物体上AUROC达0.996且预测速度远超基于采样的运动规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26661 2026-06-26 cs.RO cs.AI 新提交 57%

LAMP: Lane-Aligned Motion Primitives for Feasible Trajectory Prediction

LAMP: 面向可行轨迹预测的车道对齐运动基元

Sangjin Han, Hoseong Jung, Jeongtae Her, Changhyun Choi, H. Jin Kim

机构 * Seoul National University(首尔大学) Hyundai Motor Company(现代汽车公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出LAMP框架,利用VQ-VAE学习形状感知运动基元作为离散意图查询,并结合车道拓扑先验的可行性意图选择器,在保持行为多样性的同时提升预测轨迹的拓扑一致性和可行性。

Comments IEEE ITSC 2026, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26590 2026-06-26 cs.LG cs.CR 新提交 57%

Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

实证软件工程 TerraProbe: 用于检测LLM辅助Terraform中欺骗性修复的分层Oracle框架

Manar Alsaid, Chimdumebi Nebolisa, Faris Abbas

机构 * East Texas A&M University(东德克萨斯农工大学) Texas Woman’s University(德克萨斯女子大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出TerraProbe五层Oracle框架,评估LLM辅助Terraform安全修复,发现71.4%的真实修复为欺骗性修复,并建立四维欺骗性修复分类法。

Comments 34 pages, 12 figures, 14 tables. Journal-first manuscript submitted to Empirical Software Engineering. Primary classification: cs.SE; cross-list: cs.CR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26400 2026-06-26 cs.AI cs.SY eess.SY 新提交 57%

When Agents Meet Electric Bus Fleet Operations: Pricing Behavior, Trade-offs, and Policy Implications in an Aggregator Framework

当智能体遇上电动公交车队运营:聚合框架中的定价行为、权衡与政策启示

Jônatas Augusto Manzolli, Ali Eslami, Luis Miranda-Moreno, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(麦吉尔大学土木工程系) INESC Coimbra, University of Coimbra(科英布拉大学INESC Coimbra研究所)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出一种智能体聚合框架,将优化调度模型与监督智能体结合,协调电动公交车队的充电、V2G及运营决策,揭示利润导向定价可能损害公交运营商利益,需透明协调与价值共享规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26333 2026-06-26 cs.LG 新提交 57%

Mesh-RL: Coupled subgrid reinforcement learning

Mesh-RL:耦合子网格强化学习

Behnam Gheshlaghi, Bahador Rashidi, Shahin Atakishiyev

机构 * University of Alberta(阿尔伯塔大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出Mesh-RL框架,通过有限元启发的空间域分解和边界一致时序差分更新,加速稀疏奖励环境中的长程信用分配,提升收敛速度与学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26217 2026-06-26 cs.LG cs.CV cs.RO 新提交 57%

Fast LeWorldModel

快速LeWorldModel

Yuntian Gao, Xiangyu Xu

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25098 2026-06-25 cs.DC cs.AI cs.PF cs.SY eess.SY 新提交 57%

Power-Flexible AI Data Centers: A New Paradigm for Grid-Responsive Compute

灵活功率的AI数据中心:一种电网响应式计算的新范式

Chris Williams, Philip Colangelo, Ayse Coskun, Ethan Levine, Andy Neale, Ciaran Roberts, Shayan Sengupta, Nikhil Shirolkar, Varun Sivaram, Sarah Soares, Ethan Tiao, Scott Underwood, Daniel Wilson, Frank Sharp, Luke Wainwright, Harry Petty, Scott Wallace, Brandon Records

机构 * Emerald AI Electric Power Research Institute (EPRI)(电力研究研究院) National Grid(国家电网) NVIDIA Oracle

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出将GPU集群作为电网交互式资产,通过软件编排实现负载快速削减、持续降载和碳感知运行,同时保持优先级任务服务水平,并实现跨地理集群的性能感知负载迁移。

Comments 14 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24893 2026-06-25 cs.CL 新提交 57%

AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents

AgentOdyssey:面向测试时持续学习智能体的开放式长程文本游戏生成

Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出AgentOdyssey框架,通过程序化生成开放式文本游戏,评估智能体在测试时持续学习的关键能力,包括探索、知识获取、记忆和长程规划。

Comments Project page: https://agentodyssey.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24991 2026-06-25 eess.SY cs.LG cs.SY math.OC 新提交 57%

Solving Markov Decision Processes with Future Information via MPC

通过MPC求解具有未来信息的马尔可夫决策过程

Shambhuraj Sawant, Akhil S Anand, Dirk Reinhardt, Sebastien Gros

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种参数化模型预测控制(MPC)方法,可精确表示具有未来信息的MDP的最优价值函数和策略,并通过强化学习学习参数,在点质量赛车任务中验证有效性。

Comments 6 pages, accepted to IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25362 2026-06-25 math.OC cs.LG 新提交 57%

Learning Optimization Proxies for Sequential Contextual Stochastic Programs: An Order Fulfillment Application

学习序列上下文随机程序的优化代理:订单履行应用

Tinghan Ye, Shuaicheng Tong, Changkun Guan, Beste Basciftci, Pascal Van Hentenryck

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院工业与系统工程系) Tippie College of Business, University of Iowa(爱荷华大学蒂普皮商学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对需要亚秒级响应的序列上下文随机程序,提出一种场景嵌入神经网络代理,通过离线训练和在线解码器保证可行性,在订单履行中实现2800倍加速和3.3%成本改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24039 2026-06-25 cs.RO cs.LG cs.SY eess.SY math.OC 新提交 57%

TurboMPC: Fast, Scalable, and Differentiable Model Predictive Control on the GPU

TurboMPC:GPU上快速、可扩展且可微分的模型预测控制

Gabriel Bravo-Palacios, Jianghan Zhang, Zachary Pestrikov, Brian Plancher, Thomas Lew

机构 * Dartmouth College(达特茅斯学院) Toyota Research Institute(丰田研究所)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出TurboMPC,一种完全运行在GPU上的可微分MPC求解器,通过SQP、ADMM内求解器、隐式微分和JAX-CUDA协同设计,在约束规划、人形模仿学习和强化学习中实现高达15倍和58倍的加速,并在实车最小时间竞赛中通过贝叶斯优化调参显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24483 2026-06-24 eess.SP cs.AI 新提交 57%

Adaptive Machine Learning Framework for UAV Trajectory Optimization in O-RAN

面向O-RAN的无人机轨迹优化自适应机器学习框架

Chenrui Sun, Swarna Bindu Chetty, Gianluca Fontanesi, Mahnaz Arvaneh, Walid Saad, Hamed Ahmadi

机构 * school of Physics, Engineering and Technology, University of York(物理、工程与技术学院,约克大学) Radio Systems Research, Nokia Bell Labs(诺基亚贝尔实验室无线电系统研究部) School of Electrical and Electronic Engineering, University of Sheffield(电子与电气工程学院,谢菲尔德大学) Bradley Department of Electrical and Computer Engineering, Virginia Tech(布拉德利电气与计算机工程系,弗吉尼亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种集成增强持续迁移学习的无人机轨迹优化框架,通过模型选择机制从预训练库中迁移知识,减少适应时间,仿真表明收敛时间减少44%-56%。

Comments 16 pages, 12 figures, IEEE Transactions on Vehicular Technology

Journal ref 2026 IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24616 2026-06-24 cs.AI cs.PF econ.GN q-fin.EC 新提交 57%

AI Tokenomics: The Economics of Tokens, Computation, and Pricing in Foundation Models

AI Tokenomics:基础模型中的代币、计算与定价经济学

Quanyan Zhu

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 本文提出AI代币经济学框架,研究代币在AI系统中的生成、消耗、定价、分配与优化,揭示代币支出与经济价值的区别,并指出开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24311 2026-06-24 cs.AI 新提交 57%

LemonHarness Technical Report

LemonHarness 技术报告

Kailong Ren, Fubo Sun, Jiachen Liu, Liu Yang, Zimo Yin, Jiaying Li, Congli Yin, Ming He, Yu Huo, Jiawei Liu, Zeping Chen, Yubin Huangfu, Ronghua Li, Yixuan Wu, Xing Su, Yanzhi Xu, Likang Wu, Hongke Zhao, Lei Zhang, Xiaohui Geng, Jianping Fan

机构 * Tianjin University(天津大学) Anhui University(安徽大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对长周期智能体因工作空间状态变化难以追踪的问题,提出LemonHarness框架,通过显式执行边界、可复用规则知识库和时感知执行机制,在Terminal-Bench 2.0上实现86.52%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24160 2026-06-24 cs.AI 新提交 57%

An Introduction to Causal Reinforcement Learning

因果强化学习导论

Elias Bareinboim, Junzhe Zhang, Sanghack Lee

机构 * Columbia University(哥伦比亚大学) Graduate School of Data Science(数据科学研究生院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出将因果推断与强化学习统一在结构因果模型框架下,引入广义策略学习、模仿学习和反事实学习等新任务,形成因果强化学习(CRL)领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24124 2026-06-24 cs.AI 新提交 57%

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23444 2026-06-24 cs.RO cs.LG 新提交 57%

SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors

SkyJEPA:用于四旋翼飞行器零样本仿真到现实控制的长时域世界模型学习

Pratyaksh Rao, Wancong Zhang, Randall Balestriero, Yann LeCun, Giuseppe Loianno

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出基于JEPA的潜空间动力学模型,结合物理启发探测器实现长时域预测,并集成采样最优控制实现实时控制,通过自动化数据生成实现零样本仿真到现实迁移。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23500 2026-06-23 cs.DC cs.LG 新提交 57%

Development and Design of FLKit: A Structured Onboarding Toolkit for Federated Learning in Health and Life Sciences

FLKit的设计与开发:面向健康与生命科学中联邦学习的结构化入门工具包

Ashkan Pirmani, Ilse Vermeulen, Goran Vinterhalter, Lotte Geys, Axel Faes, Muhammad Quamber Ali, Nishkala Sattanathan, Geert Vandeweyer, Yves Moreau, Liesbet M. Peeters

机构 * STADIUS, Department of Electrical Engineering (ESAT), KU Leuven(STADIUS部门,电气工程系(ESAT),鲁汶大学) Biomedical Research Institute (BIOMED), Hasselt University(生物医学研究所(BIOMED),哈塞尔特大学) Data Science Institute (DSI), Hasselt University(数据科学研究所(DSI),哈塞尔特大学) Department of Medical Genetics, University of Antwerp(医学遗传学系,安特卫普大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出FLKit,一个面向多学科团队的联邦学习入门工具包,通过角色感知入口、生命周期阶段和FAIR对齐模板,降低健康与生命科学领域联邦学习的实践门槛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23301 2026-06-23 cs.AI 新提交 57%

EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning

EHR-Complex:面向复杂临床推理的医疗智能体基准测试

Yitong Qiao, Lei Liu, Yue Shen, Jian Wang, Jinjie Gu, Zhixuan Chu, Kui Ren

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出EHR-Complex基准,基于MIMIC-IV构建约5.2万项交互式临床数据库推理任务,评估智能体在复杂SQL和代码执行中的表现,揭示主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22936 2026-06-23 cs.AI 新提交 57%

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

当智能体过早承诺:诊断LLM智能体中的过早承诺问题

Aman Mehta

机构 * Snowflake AI Research

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。

Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏