arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-07 至 2026-07-07 共收录 442 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 91 篇

2607.02975 2026-07-07 cs.AI cs.CL 新提交 62%

Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

使用Incognita评估基于社会分布式任务环境中行动的生成智能体

Dan C. Hsu, Luke Lu

机构 * RedMind Research(RedMind研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02731 2026-07-07 cs.SE cs.AI 新提交 62%

SMOCS: A Streaming Framework for Simplified Deployment, Monitoring, and Optimization of ML Systems in Production

SMOCS:用于在生产中简化机器学习系统部署、监控和优化的流框架

Armen Kasparian, Kishansingh Rajput, Malachi Schram, John Vennekate

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对机器学习模型在运行环境部署维护的挑战,提出基于Kafka的SMOCS框架,通过分层抽象、三线程代理架构和配置驱动部署模型应对,可简化流程,且平台无关、容错、可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 62%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03193 2026-07-07 quant-ph cs.AI cs.LG 新提交 62%

Self-Specializing Vision-Language Transmon Chip Calibration in a Physics-Grounded Environment

在物理基础环境中自专业化的视觉语言跨导芯片校准

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言智能体能否在无权重更新下校准超导跨导芯片。通过设计物理模拟环境、视觉语言智能体及无梯度在线自适应方法,在预算压力下提升芯片保真度,诊断硬件故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16933 2026-07-07 cs.LG cs.AI 新提交 62%

A Unified Causal-Origin Taxonomy of Distributional Shifts in Reinforcement Learning

强化学习中分布偏移的统一因果起源分类法

Ardianto Wibowo, Paulo E Santos, Amer Baghdadi, Matthew Stephenson, Karl Sammut, Jean-Philippe Diguet

机构 * IMT Atlantique(IMT大西洋) Flinders University(弗林德斯大学) IRL Crossing Priori Analytica CNRS(法国国家科学研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种统一因果起源分类法,将强化学习中的分布偏移按因果来源(内部/外部)和时间边界(显式/隐式/混合)分类,统一了分布内/外泛化与非平稳性分析。

Comments The paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11259 2026-07-07 cs.LG cs.AI 版本更新 62%

ICR-RL: Deep Reinforcement Learning via In-Context Regression

ICR-RL:通过上下文回归实现深度强化学习

David Schiff, Ofir Lindenbaum, Yonathan Efroni

机构 * Bar-Ilan University(巴伊兰大学) Tel Aviv University(特拉维夫大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探索基于从强化学习到回归的经典简化的新方法,用预训练的回归基础模型作为上下文回归模型直接用于强化学习问题,引入无梯度方法ICR-RL,实验表明其能与常用方法竞争。

Comments Accepted to ICML 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15903 2026-07-07 cs.LG cs.AI 版本更新 62%

Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor

迈向减轻基于大语言模型的智能体幻觉:渐进泛化边界探索与看门狗监测

Siyuan Liu, Wenjing Liu, Zhiwei Xu, Xin Wang, Bo Chen, Tao Li

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Haihe Lab of ITAI College of intelligent Science and Technology, Inner Mongolia University of Technology(内蒙古工业大学智能科学与技术学院海河实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Computer Science, Michigan Technological University(密歇根技术大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型赋能智能体的幻觉问题,提出HalMit黑箱框架,用概率分形采样技术并行生成查询触发异常响应,以识别泛化边界来检测幻觉,提升智能体可靠性。

Journal ref Proceedings of the 28th European Conference on Artificial Intelligence (ECAI 2025), IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05197 2026-07-07 cs.SE 新提交 57%

Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops

三是神奇数字吗?基于大语言模型的修复循环的实证评估

Tobias Kiecker, Eik Reichmann, Hosung Kang, Gabin An, Lars Grunske

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。

Comments 4 Pages (+1 for references), NIER Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05185 2026-07-07 cs.AI cs.SC 新提交 57%

ClassicLogic: A Knowledge-Driven Benchmark of Classic Puzzle Games for Evaluating Compositional Generalization

ClassicLogic:用于评估组合泛化能力的经典益智游戏知识驱动基准集

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有组合泛化基准缺乏复杂显式结构的问题,构建含4类经典逻辑谜题的新基准,可细粒度评估智能体从基础规则学习到多步组合推理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04623 2026-07-07 cs.SE cs.DC 新提交 57%

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估

Jiaxing Qi, Zhongzhi Luan, Hongyu Zhang, Shaohan Huang, Carol Fung, Yongxin Tong, Hailong Yang, Depei Qian

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04576 2026-07-07 cs.CL cs.CY cs.IR 新提交 57%

Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation

大语言模型维护的维基知识库的渐进式披露:一项预注册的对比研究

Theodore O. Cochran

机构 * AI for Altruism (A4A)(人工智能促进利他主义组织)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对大语言模型维护的维基知识库,通过预注册对比研究,改造知识库实现渐进式披露。虽原节省索引加载成本未实现,但答案质量达标且成本降低,源于更有针对性的访问。

Comments 14 pages, 2 figures, 6 tables. Preregistered on OSF (https://osf.io/feka7, DOI 10.17605/OSF.IO/FEKA7). Materials-availability and deviations described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04528 2026-07-07 cs.AI 新提交 57%

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 57%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03501 2026-07-07 cs.DB cs.AI cs.MA 新提交 57%

STRATOS: Bridging the Symbolic-to-Numeric Gap in Spatio-Temporal Text-to-SQL for Meteorological Data

STRATOS:弥合气象数据时空文本到SQL中符号到数字的差距

Yi Zhang, Farhad Nooralahzadeh, Jonathan Fürst, Fabio Scherrer, Antonis Bezes, Vassiliki Kotroni, Kurt Stockinger

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对气象数据文本到SQL的问题,提出端到端框架STRATOS,通过解析自然语言解决模糊概念,重写复杂空间谓词,减少执行时间,并引入评估工作负载来测试系统。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02879 2026-07-07 cs.AI 新提交 57%

MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents

MedCalc-Pro:使用大语言模型智能体解决复杂医学计算问题

Siran Zhao, Ruihui Hou, Ziyue Huai, Chennuo Zhang, Tong Ruan

机构 * East China University of Science and Technology(华东理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对医学计算评估大语言模型的基准过于简化的问题,提出新基准MedCalc-Pro及更通用智能体框架,含多场景任务设置和真实病例,新框架性能最佳,为评估应用LLMs提供新基准和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02814 2026-07-07 cs.MA cs.AI cs.CY 新提交 57%

SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure

主权谈判基准:在隐私、同意、证据和制度压力下评估委托谈判中用户拥有的个人代理

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究个人代理替用户谈判的情况,介绍主权谈判基准,其能在多方面约束下评估谈判,通过多种场景验证,指出仅协议成功对用户拥有的谈判代理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02605 2026-07-07 cs.SE 新提交 57%

A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战

Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 57%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21585 2026-07-07 cs.LG cs.IT math.DG math.IT math.ST stat.TH 新提交 57%

A Transport-Based Geometry of Belief-Cost

信念的成本几何:有限资源下含噪观测的推理

Laurent Caraffa

机构 * Université Gustave Eiffel, LASTIG, IGN-ENSG(古斯塔夫·埃菲尔大学,LASTIG,IGN-ENSG)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文引入信念空间的成本几何(Wasserstein最优传输经Fisher信息共形加权),证明确定性被观测和物理双重否定,并揭示三个不变结果:推理墙、诚实成本与刚性双曲几何,其中高斯分布为最极端位置-尺度信念。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20408 2026-07-07 cs.CR cs.AI 新提交 57%

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

Hanwool Lee, Dasol Choi, Bokyeong Kim, Haon Park, Seung Geun Kim

机构 * AIM Intelligence(AIM智能公司) KAERI(韩国原子能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12502 2026-07-07 physics.soc-ph cs.AI 新提交 57%

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

价值的数学理论:资源约束下目标导向行为的综合

Cheng Qian

机构 * Cheng Qian(陈倩)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出价值是目标导向主体在资源约束下转化资源为目标进度的速率,通过尺度不变性公理导出对数度量,并推导出价值编码定理,实现价值与信息论的统一。

Comments Also available at https://doi.org/10.5281/zenodo.20487041 (v6). v2: the pre-registered continuation-gate experiment has been run -- prediction (i) confirmed on real frontier agents; prediction (ii) retired to mathematical scope. Code, pre-registrations, and raw run records: https://github.com/macrokit/value

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09426 2026-07-07 cs.AI 版本更新 57%

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准

Wanli Li, Bowen Zhou, Yunyao Yu, Zhou Xu, Yifan Yang, Dongsheng Li, Caihua Shan

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09118 2026-07-07 cs.AI 新提交 57%

ComplexConstraints and Beyond: Expert Rubrics for RLVR

复杂约束与超越:RLVR的专家评分标准

Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出专家设计的评分标准作为评估和训练信号,通过复杂指令遵循和企业智能体任务验证,在RL训练中显著提升模型性能。

Comments Accepted to the GEM workshop at ACL 2026: https://gem-workshop.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新 57%

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 57%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17673 2026-07-07 cs.CR cs.AI 版本更新 57%

Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation

在Linux提权中使用可验证奖励进行训练后的本地LLM代理

Philipp Normann, Andreas Happe, Jürgen Cito, Daniel Arp

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种两阶段训练流程,通过监督微调和强化学习提升Linux提权任务的性能,实现高成功率和低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20203 2026-07-07 cs.AI 版本更新 57%

Shutdownable Agents through POST-Agency

通过后代理实现可关闭的智能体

Elliott Thornley

机构 * OpenAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出后代理建议,训练智能体满足仅在等长轨迹间的偏好,证明此与其他条件蕴含中立性+,使智能体可关闭且有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19186 2026-07-07 cs.CL 版本更新 57%

When Users Are Happy but Agents Are Wrong: Multi-Dimensional Evaluation of Tool-Augmented Dialogue

当用户满意但智能体出错:工具增强对话的多维度评估

Tanya Shourya, Yingfan Wang, Zhaoyi Joey Hou, Shamik Roy, Vinayshekhar Bannihatti Kumar, Rashmi Gangadharaiah

机构 * AWS AI Labs(AWS人工智能实验室) University of Pittsburgh(匹兹堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对工具增强对话系统中用户满意但智能体错误的问题,提出TRACE基准,通过系统合成多样错误案例,评估现有框架发现性能远未理想。

Comments The Fifth Generation, Evaluation & Metrics Workshop (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新 57%

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04414 2026-07-07 eess.SP 新提交 50%

Non-invasive Blood Glucose Estimation from Wearable Physiological Signals

从可穿戴生理信号中进行无创血糖估计

Zexing Zhang, Jichao Li, Yilong Wang, Kewei Yang, Tianyang Lei

专题命中 Agent评测 :agent(abstract)

AI总结 研究从可穿戴生理信号无创估计血糖难题,提出深度学习动态增量学习框架,含动态聚类模块与代理梯度桥接代理,还建纵向基准数据集,该方法在验证中效果良好,为后续研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏