arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-10 至 2026-07-10 共收录 37 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 37 篇

2605.21917 2026-07-10 cs.CV cs.AI 版本更新 85%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 规划决策 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08497 2026-07-10 cs.CV cs.AI cs.CL cs.LG 新提交 85%

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

用于多模态理解、生成和编辑的认知结构多模态智能体

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

机构 * Peking University(北京大学) Tencent Inc(腾讯公司)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对统一多模态模型在长时多模态对话中的局限,提出认知结构多模态智能体,通过外化视觉信息等方式改进。开发统一场景引擎,构建评估基准。实验显示该智能体检索准确率高、推理时间减半,还介绍了工具包,为长时多模态智能体提供新范式。

Comments 16 pages, 7 figures, 8 tables. Project page: https://caseclose.github.io/cma-harness/ Code: https://github.com/caseclose/cma-harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05622 2026-07-10 cs.CL 版本更新 83%

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench: 在世界约束和用户约束下评估大语言模型智能体的自适应规划能力

Jiayu Liu, Cheng Qian, Zhenhailong Wang, Bingxuan Li, Jiateng Liu, Qing Zong, Heng Wang, Jeonghwan Kim, Yumeng Wang, Bingxiang He, Xiusi Chen, Yi R. Fung, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL

AI总结 针对现有基准未充分探索渐进揭示的双重约束下的自适应规划问题,提出动态交互基准AdaPlanBench,通过307个家务任务和可扩展的约束构建流程,评估LLM智能体在交互中根据反馈迭代调整计划的能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08400 2026-07-10 cs.CR cs.AI cs.LG 新提交 81%

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

TRACE:一种通过互补嵌入实现的用于大语言模型智能体轨迹的双通道鲁棒归属水印

Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织(CSIRO)的数据61)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体轨迹归属水印易被经销商攻击的问题,提出TRACE方法,通过互补嵌入构建双通道水印,包括基于局部内容的选择通道和基于日志框架的计数通道,实验表明该方法能保证水印鲁棒性,保持智能体成功率且检测分数高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08024 2026-07-10 cs.CV cs.AI cs.LG cs.RO 新提交 81%

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

APIVOT:具有交错视觉语言思维的自适应规划

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。

Comments Project Page: https://emilyzjin.github.io/projects/apivot.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07844 2026-07-10 cs.RO cs.AI cs.LG 新提交 81%

Shift & Drift: A Zero-Shot Benchmark for Generalizable and Robust Autonomous Driving Motion Planning

Shift & Drift:用于可泛化且稳健的自动驾驶运动规划的零样本基准测试

Alessandro Canevaro, Hang Yu, Julian Schmidt, Peizheng Li, Silvan Lindner, Wilhelm Stork, Georg Martius, Julian Jordan

机构 * Mercedes-Benz AG, Research & Development(梅赛德斯-奔驰股份公司,研发部) University of Tübingen(图宾根大学) Karlsruhe Institute of Technology, ITIV(卡尔斯鲁厄理工学院,ITIV)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究自动驾驶运动规划器在新城市拓扑泛化及执行扰动恢复方面的不足,提出Shift & Drift双轨基准测试,通过语义转移和状态分布漂移测试不同规划范式,发现模仿学习与强化学习在性能上的差异,为评估可靠部署提供基准。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08233 2026-07-10 cs.AI cs.CV 新提交 79%

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

玩禅道世界:在主动视觉概念归纳中挑战人工智能代理

Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting

机构 * AIML Lab, TU Darmstadt(人工智能机器学习实验室,达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森州人工智能中心) Psychology of Information Processing, TU Darmstadt(信息处理心理学,达姆施塔特工业大学) Centre for Cognitive Science, TU Darmstadt(认知科学中心,达姆施塔特工业大学) Cornell University(康奈尔大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所,SIC组) German Center for AI (DFKI)(德国人工智能研究中心)

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 研究构建智能系统时代理感知、假设形成及实验设计问题,提出禅道世界环境,评估多种代理方法,发现预测标签精度与恢复潜在规则无关,感知和归纳是不同瓶颈,基于视觉语言模型的代理实验无信息,还收集人类数据揭示差距及改进途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00969 2026-07-10 cs.RO cs.AI 版本更新 79%

V-VLAPS: Value-Guided Planning for Vision-Language-Action Models

V-VLAPS:面向视觉-语言-动作模型的价值引导规划

Ke Ren, Ali Salamatian, Kieran Pattison, Cyrus Neary

机构 * The University of British Columbia(不列颠哥伦比亚大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出V-VLAPS方法,通过在VLA模型上增加轻量级价值头预测蒙特卡洛回报,引导蒙特卡洛树搜索选择高价值分支,从而提升长时域任务下的规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05544 2026-07-10 cs.RO 新提交 78%

Dynamic Evaluation of Classical and Control-Aware Optimal Trajectory Planning in Robot Manipulators

机器人操作器中经典和控制感知最优轨迹规划的动态评估

Bhanuka Dayawansa, Rohan Munasinghe

专题命中 规划决策 :planning(title,abstract)

AI总结 研究机器人操作器轨迹规划,提出控制感知最优轨迹规划框架,纳入动力学和执行器努力,用中点线性化策略,通过统一评估框架对比经典方法,能降低跟踪误差等,证明仅运动学平滑不能确保高效执行。

Comments Accepted at MERCon 2026. To be presented at MERCon 2026. 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28746 2026-07-10 cs.RO 版本更新 78%

He3-Seeker: Robotic Information Planning for Lunar Helium-3 Distribution Mapping

He3-Seeker:用于月球氦-3分布测绘的机器人信息规划

Dong Li, Yujie Zheng, Chengdeng Cao, Siyu Teng, Yuchen Li, Yang Gao, Long Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Macau University of Science and Technology(澳门科学技术大学) China University of Petroleum-Beijing(中国石油大学(北京)) Wuhan University(武汉大学) Shenzhen University(深圳大学) Technical University of Munich(慕尼黑技术大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出He3-Seeker框架,利用机器人信息规划引导自主导航与主动感知,实现基于多点钻探采样和原位分析的月球氦-3分布快速高保真测绘。

Comments Submitted to the International Conference on Space Robotics (iSpaRo) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08093 2026-07-10 cs.AI cs.CL cs.LG 新提交 75%

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

因果DS:数据科学智能体中的因果推理基准测试

Andrej Leban, Yuekai Sun

机构 * Department of Statistics University of Michigan(统计学系密歇根大学)

专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 介绍用于评估数据科学智能体因果推理的CausalDS基准,由含观测数据的结构因果模型和合成自然语言故事构成场景,导出跨越Pearl三个层级的任务,联合评估符号因果推理、数据科学等多方面能力。

Comments 55 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08647 2026-07-10 cs.LG cs.AI 新提交 73%

Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning

用于稳健奖励学习的多模态、多环境机器教学

Ali Larian, Qian Lin, Chang Zong Wu, Daniel S. Brown

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 研究自主智能体在多环境下奖励学习问题,提出分层机器教学算法,先选信息丰富环境,再查询低成本反馈,实验表明该方法比统一教学基线有更低遗憾值和更强泛化能力,凸显多环境多模态教学对稳健奖励学习的重要性。

Comments Accepted to RLC 2026. Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08066 2026-07-10 cs.AI cs.LG 新提交 73%

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

说服攻击会降低思维链监测的有效性

Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna

机构 * LASR Labs(LASR实验室) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08331 2026-07-10 cs.LG cs.AI 新提交 62%

ArtMine: Discovering and Formalizing Artistic Processes

ArtMine:发现并形式化艺术创作过程

Kaustubh Kumar, Ashutosh Ranjan, Vivek Srivastava, Blessin Varkey, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究如何从异构历史证据发现并形式化艺术创作过程,核心方法是将证据合成存储库,由溯因智能体推断生产步骤并优化,主要贡献是迈向以过程为中心的人机协同创作系统,支持多方面研究。

Comments 47 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 62%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01176 2026-07-10 cs.LG cs.AI cs.NE 62%

From Cities to Series: Complex Networks and Deep Learning for Improved Spatial and Temporal Analytics*

从城市到序列:复杂网络与深度学习用于改进的空间和时间分析

Gabriel Spadon, Jose F. Rodrigues-Jr

机构 * Institute for Big Data Analytics (IBDA) Dalhousie University (DAL), Halifax -- NS, Canada(大数据分析研究所(IBDA)达尔豪斯大学(DAL),哈利法克斯 - NS,加拿大)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究结合复杂网络与深度学习,改进对流行病、迁移和城市网络中人类现象的理解,并提出新的神经网络架构和人类迁移分析方法。

Comments This piece refers to an extended abstract of the Ph.D. thesis under the same name defended in the Graduate Program in Computer Science and Computational Mathematics (PPG-CCMC) of the Institute of Mathematics and Statistics (ICMC) from the University of Sao Paulo (USP) - Brazil on July 12, 2021. The authors here listed refer to the Ph.D. candidate and his advisor, respectively

Journal ref Universidade de São Paulo, Tese de Doutorado, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08703 2026-07-10 cs.LG 新提交 57%

MPFlow: Learning Budgeted Max-Flow Optimization on the Lightning Network with Deep Graph Reinforcement Learning

MPFlow:基于深度图强化学习的比特币闪电网络预算最大流优化学习

Harrison Rush, Vincent Davis, Simone Antonelli, Vikash Singh, Jesse Shrader, Emanuele Rossi

机构 * Amboss Technologies(Amboss技术公司) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Stillmark(Stillmark公司) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究比特币闪电网络中给定预算下节点如何打开通道最大化路由容量的问题,采用图强化学习方法,结合消息传递策略网络、PPO和动作掩码,在真实网络快照实验中表现优于启发式基线,还用于生产中的对等推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08602 2026-07-10 cs.AI 新提交 57%

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

迈向肝细胞癌的精准治疗:用于风险分层和治疗指导的临床推理大语言模型

Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 研究针对肝细胞癌治疗问题,提出HCC-STAR临床推理大语言模型。通过处理电子病历叙述输出风险分层、治疗方案等。经多中心队列验证,性能领先,能助医生决策,是可靠的肝细胞癌风险分层和精准治疗决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08554 2026-07-10 cs.AI 新提交 57%

CommuniWave:A Machine Learning Model for Quantifying the Degree of Temporary Informal Behavior in Urban Communities

CommuniWave:一种用于量化城市社区临时非正式行为程度的机器学习模型

Hongye Yang, Shien Liu, Zhihao Xie

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究针对城市社区规划缺乏量化居民非正式行为指标的问题,引入CommuniWave模型,它整合BCN、YLX和BEM,通过生成DIB波动图实现动态监测,助力城市管理者提升社区整体韧性。

Comments 17 pages, 4 figures. Presented at ASCAAD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08449 2026-07-10 cs.CV cs.LG 新提交 57%

Predicting Viticulture Potential through an Ensemble of U-Net and a Geospatial Foundation Model

通过U-Net和地理空间基础模型的集成预测葡萄种植潜力

Jorge Ignacio Perez, Hwaai Kang Kee, Lucas Rassbach

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对ImageCLEF AI4Agri 2026法国南部葡萄种植潜力预测子任务,DS@GT ARC团队采用U-Net和地理空间基础模型集成方法,其最佳模型准确率达68.32,在7个团队中排第二,且实现已公开。

Comments To be published in CLEF 2026 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08443 2026-07-10 cs.NI cs.AI 新提交 57%

ADORN: Adaptive Drift handling for Open RAN using Reinforcement Learning

ADORN:使用强化学习的开放式RAN自适应漂移处理

Ashit Kumar Subudhi, Bhargav Chirumamilla, Shubham Vaishnav, Mduduzi C. Hlophe, Praveen Kumar Donta, Andrea Fumagalli, Venkateswarlu Gudepu, Koteswararao Kondepu

机构 * Indian Institute of Technology Dharwad, Karnataka, India(印度理工学院达拉德分校) University of Pretoria, Pretoria, South Africa(南非彼得里亚大学) Johns Hopkins University, USA(约翰霍普金斯大学) Stockholm University, Sweden(斯德哥尔摩大学) Open Networking Advanced Research (OpNeAR) Lab, The University of Texas at Dallas, TX, USA(开放网络高级研究实验室,德克萨斯大学达拉斯分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对开放式无线接入网络中因动态流量变化导致的模型性能下降问题,提出基于Q学习的自适应重新训练方法,通过将决策制定为马尔可夫决策过程,结合多专家长短期记忆集成,有效降低重新训练开销并维持系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08436 2026-07-10 cs.RO cs.AI 新提交 57%

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM:利用野外自我中心人类数据超越像素的世界行动模型

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究利用野外自我中心人类数据训练机器人操纵模型,引入EgoWAM框架,固定部分设置仅改变世界预测目标,比较不同方法。结果表明WAM协同训练更有效,DINO和3D流提升显著,为机器人操纵提供新训练思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08357 2026-07-10 cs.AI 新提交 57%

MobiDiff: Semantic-Aware Multi-Channel Discrete Diffusion for Human Mobility Data Generation

MobiDiff:用于人类移动性数据生成的语义感知多通道离散扩散

Rongchao Xu, Lin Jiang, Dahai Yu, Ximiao Li, Taichi Liu, Desheng Zhang, Yuan Tian, Guang Wang

机构 * Florida State University(佛罗里达州立大学) Rutgers University(罗格斯大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究旨在解决人类移动性数据生成难题,提出MobiDiff框架,通过直接对多通道语义骨架去噪生成数据,避免复杂管道。该框架能分解事件通道并采用掩码捕获移动模式与依赖性,实验证明其在保真度、隐私保护和效率上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 57%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07761 2026-07-10 cs.AI 新提交 57%

Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

对齐临床需求与人工智能能力:医学推理大语言模型综述

Qi Peng, Jiatong Li, Sirui Huang, Yiyang Jiang, Kaisong Gong, Ronger Ding, Shijie Ye, Changmeng Zheng, Yi Cai, Xiaobo Yang, Jin Huang, Xiao-Yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University(香港大学) South China University of Technology(华南理工大学) University of Toronto(多伦多大学) Peking Union Medical College Hospital(北京地坛医院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 综述医学大语言模型在医疗领域的进展,提出双视角方法,连接临床实践与计算方法,建立五级能力方案并关联推理模式与医学任务,引入基准数据集并报告模型结果,讨论进展与挑战及未来方向。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16453 2026-07-10 cs.AI 版本更新 57%

RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments

RetailBench: 评估LLM代理在真实零售环境中的长周期自主决策与策略稳定性

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出RetailBench基准,用于评估LLM代理在千天级超市运营模拟中的长周期决策能力,发现当前最强模型仍远落后于最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09571 2026-07-10 cs.LG 57%

ImPORTance: Machine Learning-Driven Analysis of Global Port Significance and Network Dynamics for Improved Operational Efficiency

ImPORTance: 基于机器学习的全球港口重要性及网络动态分析以提升运营效率

Emanuele Carlini, Domenico Di Gangi, Vinicius Monteiro de Lira, Hanna Kavalionak, Amilcar Soares, Gabriel Spadon

机构 * Inst. of Info. Sci. and Technologies(信息科学与技术研究所) Federal University of Ceará(联邦卡里亚大学) Linnaeus University(林纳尤大学) Dalhousie University(达尔豪斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文基于机器学习分析全球港口连接网络,揭示地理特征和港口深度对港口重要性的贡献,以提升港口运营效率。

Journal ref 19th International Symposium on Spatial and Temporal Data (SSTD), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08759 2026-07-10 econ.GN q-fin.EC 新提交 50%

Measuring Consumption with Credit Card Data: Benchmarking and Beyond

用信用卡数据衡量消费:基准测试及其他

Aditya Aladangady, Ricardo Duque Gabriel, Carlo Wix

专题命中 规划决策 :agent(abstract)

AI总结 该研究利用美联储Y - 14M报告中的信用卡数据构建县级月度消费数据集,证明其与传统消费指标近似。通过县 - 月面板估计货币政策冲击的异质消费反应,发现低收入县支出下降幅度大,还为相关研究者提供了实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08503 2026-07-10 cs.CV 新提交 50%

CT-CLIP Representations for Multimodal Lung Cancer Survival Prediction

用于多模态肺癌生存预测的CT-CLIP表示

Sofie Allgöwer, Mikael Johansson, Andreas Hallqvist, Jonas Andersson, Åse Johnsson, Ida Häggström, Jennifer Alvén

机构 * Chalmers University of Technology(查尔姆斯理工大学) Umeå University(于默奥大学) Sahlgrenska University Hospital(萨尔格伦斯卡大学医院) Sahlgrenska Academy at Gothenburg University(哥德堡大学萨尔格伦斯卡学院)

专题命中 规划决策 :planning(abstract)

AI总结 研究评估特定领域基础模型CT-CLIP用于肺癌多模态生存预测,通过多种策略提取特征,结果显示冻结的CT-CLIP模型结合可训练生存头表现出色,能有效区分高低风险组。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08127 2026-07-10 cs.CV cs.RO 新提交 50%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 规划决策 :planning(abstract)

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏