arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1921 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1921 篇

2606.21422 2026-06-23 cs.LG 新提交 57%

Federated Temporal Attention Intelligence for Cyber-Resilient IoMT: Lightweight Digital Twins and PPO-Driven Honeypot Deception

面向网络韧性医疗物联网的联邦时序注意力智能:轻量级数字孪生与PPO驱动的蜜罐欺骗

Syed Zeeshan Haider, Anwar Shah, Muneeb Arif, Hamza Iftikhar, Waqas Ali

机构 * FAST National University of Computer and Emerging Sciences(FAST国立计算机与新兴科学大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出LDT-FRL框架,结合时序注意力编码器、轻量级LSTM数字孪生、联邦PPO智能体和蜜罐层,在资源受限的IoMT设备上实现隐私保护的网络攻击检测与响应,在CICDDoS 2019和TON-IoT数据集上分别达到99.66%和99.95%的测试准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21321 2026-06-23 cs.LG 新提交 57%

Objective-Behavior Alignment: Diagnostics for MORL Policy Selection

目标-行为对齐:多目标强化学习策略选择的诊断方法

Antonio Mone, Zuzanna Osika, Florian Felten, Pradeep K. Murukannaiah, Mark Fuge, Frans A. Oliehoek, Luciano Cavalcante Siebert

机构 * Delft University of Technology(代尔夫特理工大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 提出一种诊断工作流,自动揭示帕累托前沿上仅靠目标值无法体现的行为差异,通过定量和可视化工具辅助策略选择,在简单网格和连续控制基准上验证有效性。

Comments 22 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21306 2026-06-23 cs.AI 新提交 57%

Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment

迈向 Dys-XAI:基于影响的构音障碍严重程度评估解释

Xiaoliang Wu, Qiyang Sun, Yupei Li, Erfan Loweimi, Jennifer Williams, Zhengjun Yue

机构 * University of Southampton(南安普顿大学) Imperial College London(帝国理工学院) University of Edinburgh(爱丁堡大学) King's College London(伦敦国王学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出基于影响的实例级可解释性框架,通过支持性和竞争性训练样本解释构音障碍严重程度评估的深度学习模型决策,并通过删除实验验证解释有效性。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20978 2026-06-23 cs.AI cs.HC 新提交 57%

How Should Agents Read Demonstrations? Hierarchical Structure Beats Flat Action Logs

智能体应如何阅读演示?层级结构优于扁平动作日志

Honjar Xing, Jefferson Lin, Henry Lieberman

机构 * MIT Computer Science and Artificial Intelligence Laboratory (CSAIL)(麻省理工学院计算机科学与人工智能实验室(CSAIL))

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出将演示中的动作序列组织为带标签的层级子目标,在85个Web自动化任务中,层级结构将模糊描述任务的通过率从76.7%提升至90.7%,而扁平结构改进不显著,消融实验表明子目标分组是唯一驱动因素。

Comments Accepted at the 5th Deep Learning for Code (DL4C) Workshop, ICML 2026. 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20900 2026-06-23 cs.CL 新提交 57%

Storyline Trees: Hierarchical Representations for Long-Form Narratives

故事线树:长篇叙事的层次化表示

Litu Ou, Mirella Lapata

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 提出故事线树,通过自顶向下和自底向上过程构建叙事层次结构,实现自适应检索,在长上下文叙事问答中优于强基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20672 2026-06-23 cs.NE cs.AI 新提交 57%

Genetic Algorithm Based Coordination and Optimization Model for Generation Grid Load Storage in Active Distribution Networks

基于遗传算法的主动配电网源网荷储协调优化模型

Jinlu Zhang, Fujian Chi, Tianhan Ling, Yulong He, Kejia Zhang, Hongxing Lv, Sheng Wang

机构 * State Grid Tianjin Binhai Electric Power Supply Company(国网天津滨海供电公司) State Grid Tianjin Electric Power Company(国网天津电力公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种结合模糊逻辑与遗传算法的优化框架,用于主动配电网中发电、并网、负荷及储能设施的协调与风险评估,通过模糊集处理不确定性,利用遗传算法优化调度,降低技术约束,保持投资水平。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17642 2026-06-23 cs.AI 新提交 57%

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen: 通过自演化经验记忆实现的金融多模态推理

Pianran Guo, Pengcheng Zhou, Yucheng Jian, Shuhua Chen, Zhonfliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16878 2026-06-23 cs.LG 新提交 57%

Integrated Marketing Attribution: A Bayesian Framework for Privacy-Safe Granular Measurement Anchored in MMM

集成营销归因:基于贝叶斯框架的隐私安全粒度测量,锚定于MMM

Meghana R. Bhat, Ankit Umare, Utsav Aggarwal, Richard Vecsler, Arunkumar Mani, Karthik Nair, Chandhu Nair

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出集成营销归因(IMA)框架,结合营销组合模型(MMM)与贝叶斯归因模型,从聚合数据中推导出活动级效果,实现隐私安全且粒度精细的归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15862 2026-06-23 cs.AI 新提交 57%

RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments

RetailBench: 在真实零售环境中评估LLM代理的长期推理与连贯决策能力

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出RetailBench基准,模拟单店超市运营,评估LLM代理在长期决策中的表现,发现多数模型无法持续生存,与最优策略差距显著。

Comments The submission of this paper was a mistake. This is the second version of arXiv:2603.16453, so it should have replaced the original 2603 version through a replacement submission, rather than being published as a new paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14935 2026-06-23 cs.AI 新提交 57%

PrologMCP: A Standardized Prolog Tool Interface for LLM Agents

PrologMCP:面向LLM代理的标准化Prolog工具接口

Agnieszka Mensfelt, Adarsh Prabhakaran, Adrian Haret, Vince Trencsenyi, Kostas Stathis

机构 * Royal Holloway, University of London(伦敦大学皇家霍洛威学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出PrologMCP,一个通过模型上下文协议将Prolog暴露为状态化工具的任务无关开源服务器,使LLM代理能够通过翻译-运行-检查-修复循环稳健地委托演绎推理,在PARARULE-Plus上达到或超越推理型LLM。

Comments Accepted at Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs, 18 July 2026, Lisbon v2: Added references to other Prolog MCP servers; fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20291 2026-06-19 cs.LG cs.CV 新提交 57%

Integrating national forest inventory, airborne lidar, and satellite imagery for wall-to-wall mapping of forest structure with computer vision

整合国家森林清查、机载激光雷达和卫星影像,利用计算机视觉实现森林结构的全覆盖制图

Luke J. Zachmann, David D. Diaz, Vincent A. Landau, Chelsey Walden-Schreiner, Tony Chang, Nathan E. Rutenbeck, Katharyn A. Duffy, Kiarie Ndegwa, Andreas Gros, Scott Conway, Guy Bayes

机构 * Vibrant Planet Public Benefit Corporation(Vibrant Planet 公益公司)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出VibrantForests框架,结合卫星影像、激光雷达样本和计算机视觉,以10米分辨率生成美国本土的冠层覆盖、高度、生物量等森林属性图,减少饱和与回归均值问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19656 2026-06-19 cs.RO cs.LG 新提交 57%

DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

DF-ExpEnse: 扩散滤波探索用于高效样本微调

Calvin Luo, Chen Sun, Shuran Song

机构 * Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出DF-ExpEnse探索技术,利用生成控制策略的多模态建模能力和评论家集成,在微调中高效收集在线经验,提升样本效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19300 2026-06-18 cs.CV cs.LG 新提交 57%

Confidence is Not Reliability: Rethinking MC Dropout in Brain Tumour Segmentation

置信度不等于可靠性:重新思考脑肿瘤分割中的MC Dropout

Xin Ci Wong, Duygu Sarikaya, Kieran Zucker, Marc De Kamps, Nishant Ravikumar

机构 * Centre for Doctoral Training in AI for Medical Diagnosis and Care(人工智能辅助医疗诊断与护理博士培训中心) School of Computing, University of Leeds(利兹大学计算机学院) School of Computer Science, University of Leeds(利兹大学计算机科学学院) Leeds Cancer Centre, St James’s University Hospital, Leeds, UK(利兹癌症中心,圣詹姆斯大学医院,利兹,英国)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 通过MC Dropout不确定性估计,发现全局不确定性-误差对齐(AUROC≈0.97)可能掩盖关键子区域(如增强肿瘤)的严重误校准(ECE=0.915),表明子区域校准评估对临床安全至关重要。

Comments Accepted for MIUA2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19140 2026-06-18 cs.LG 新提交 57%

ChronoSurv: A Clinical Pathway-Guided Graph Framework for Multimodal Survival Analysis

ChronoSurv:一种临床路径引导的多模态生存分析图框架

Hugo Miccinilli, Theo Di Piazza

机构 * Université Paris-Saclay, CentraleSupélec, MICS, France(巴黎萨克雷大学,中央超算学院,MICS,法国) University of Lyon, INSA Lyon, CREATIS, France(里昂大学,里昂国家理工学院,CREATIS,法国)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出ChronoSurv,一种基于有向图的多模态生存分析框架,通过层次化拓扑和异质消息传递建模临床轨迹,在头颈癌数据集上取得最优判别性能与可靠校准。

Comments Accepted at MICCAI 2026. Submitted version due to embargo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18967 2026-06-18 cs.LG 新提交 57%

EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

EfficientRollout: 面向强化学习推演的感知系统的自推测解码

Minseo Kim, Minjae Lee, Seunghyuk Oh, Kevin Galim, Donghoon Kim, Coleman Hooper, Harman Singh, Amir Gholami, Hyung Il Koo, Wonjun Kang

机构 * FuriosaAI University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 针对强化学习推演中自回归解码延迟瓶颈,提出感知系统的自推测解码框架,通过量化自推测解码器与感知系统的推测开关策略,在保持模型质量前提下降低推演和端到端延迟。

Comments Project Page: https://github.com/furiosa-ai/EfficientRollout

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18963 2026-06-18 cs.LG 新提交 57%

Online Reward-Punishment Learning from Fixed-Channel Perceptual Event Streams without Environment Rewards

无环境奖励的固定通道感知事件流在线奖惩学习

Zirong Li

机构 * Zirong Li(李 Cirong)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出OHIRL框架,在无标量奖励下通过固定通道感知流进行在线奖惩学习,利用内部轨迹评估器推断感知维度的效价,在XOR任务和CartPole等控制任务中达到高准确率。

Comments 9 pages, 5 figures, 6 tables; 13-page technical supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18954 2026-06-18 cs.CL 新提交 57%

GraphPO: Graph-based Policy Optimization for Reasoning Models

GraphPO:基于图的推理模型策略优化

Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Ant Group(蚂蚁集团)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 提出GraphPO框架,将推理轨迹建模为有向无环图,通过合并语义等价路径减少冗余探索,并利用边级优势函数提高推理效率,在多个基准上优于链式和树式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18847 2026-06-18 cs.AI 新提交 57%

WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents

WorldLines: 对长时域有状态具身智能体进行基准测试与建模

Yehang Zhang, Jianchong Su, Haojian Huang, Yifan Chang, Tianhao Zhou, Xinli Xu, Yingjie Xu, Yinchuan Li, Zexi Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Knowin

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出WorldLines基准,通过构建带时间跨度的家庭轨迹(含对话、动作、状态变化等)评估具身智能体的长时记忆与任务规划能力,并设计ObsMem记忆框架提升状态感知决策。

Comments 27 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18828 2026-06-18 cs.RO cs.AI 新提交 57%

Space Is Intelligence: Neural Semigroup Superposition for Riemannian Metric Generation

空间即智能:用于黎曼度量生成的神经半群叠加

Chenghao Xu

机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学机器人视觉感知与控制技术国家工程研究中心)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出将智能置于空间本身,通过神经半群叠加机制生成黎曼度量,使动作简化为测地线跟随,在单障碍场景训练后零样本泛化到未见配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18788 2026-06-18 cs.CV cs.CL 新提交 57%

HandwritingAgent: Language-Driven Handwriting Synthesis in Scalable Vector Space

HandwritingAgent: 语言驱动的可缩放矢量空间手写合成

Jaward Sesay, Yue Yu, Börje F. Karlsson

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出HandwritingAgent,利用大推理模型在SVG格式中自动回归生成手写笔画序列,无需风格特定训练,通过自然语言和参考图像控制风格,在模仿、识别、多语言及复杂数学表达式合成等任务上达到或超越现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18485 2026-06-18 cs.SD cs.AI eess.AS 新提交 57%

MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data

MagpieTTS-LF:无需长语音数据训练的推理时长生成长语音生成

Subhankar Ghosh, Jason Li, Paarth Neekhara, Shehzeen Hussain, Ryan Langman, Xuesong Yang, Roy Fejgin

机构 * NVIDIA Corporation(英伟达公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出MagpieTTS-LF推理时方法,通过软注意力先验、有状态推理和历史感知文本编码,在不重新训练模型的情况下实现连贯的长语音生成。

Journal ref Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12837 2026-06-18 cs.CL 新提交 57%

LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling

LoHoSearch: 超越人类难度上限的长时域搜索代理基准测试

Jiarui Zhao, Rongzhi Zhang, Lingchuan Liu, Hao Yang, Xunliang Cai, Xi Su

机构 * Meituan(美团)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出LoHoSearch基准,基于700万维基实体知识图谱自动构建544个复杂问题,评估显示最强模型仅34.74%准确率,远超人类难度上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18132 2026-06-17 cs.AI 新提交 57%

Knowledge Reutilization in Meta-Reinforcement Learning

元强化学习中的知识复用

Yuan Meng, Bo Wang, Juan de los Rios Ruiz, Xiangtong Yao, Zhenshan Bing, Fuchun Sun, Alois Knoll

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出一种元知识复用框架,通过动力学简化智能体学习任务知识并迁移至异构智能体,利用贝叶斯非参数先验和高层策略生成任务级指导,显著降低跟踪误差并提高样本效率。

Comments 18 pages initial submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17897 2026-06-17 cs.AI cs.RO 新提交 57%

Learn to Quantify Social Interaction with Constraints for Pedestrian Walking

学习量化行人行走中的社交互动约束

Xiaodan Shi

机构 * Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出Learn to Cluster方法,通过概率潜变量生成模型从轨迹观测中无监督学习社交互动模式,并有效集成到行人轨迹预测中,提升预测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17727 2026-06-17 cs.AI 新提交 57%

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

LongWebBench: 评估长程设置下的结构和功能性网页生成

Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

机构 * Tsinghua University(清华大学) Yanshan University(燕山大学) University of Waterloo(滑铁卢大学) Beihang University(北京航空航天大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出LongWebBench基准,通过结构保真度和功能可执行性评估长网页生成,发现视觉相似性高但多步交互失败。

Comments 49 pages, 38 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17317 2026-06-17 cs.RO cs.AI math.OC 新提交 57%

Transformer-Based Warm-Starting for Feasible and Optimal Terminal Approach to Tumbling Objects with Space Manipulators

基于Transformer的可行且最优末端接近翻滚目标的空间机械臂热启动方法

Yuji Takubo, Maximilian Adang, Mac Schwager, Simone D'Amico

机构 * Stanford University(斯坦福大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对空间机械臂末端接近翻滚目标的实时轨迹生成问题,提出基于因果Transformer的热启动方法,通过分解规划并热启动姿态-力矩分配阶段,在300个测试场景中减少28%迭代次数和23%运行时间,同时保持控制成本分布。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16721 2026-06-16 cs.AI 新提交 57%

Medical world models: representing medical states, modelling clinical dynamics and guiding intervention policies

医疗世界模型:表示医疗状态、建模临床动态与指导干预策略

Ke Liu, Mengxuan Li, Yanyi Bao, Tianyun Zhang, Chong Chu, Jiajun Bu, Haishuai Wang

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学与技术学院) School of Medicine, Zhejiang University(浙江大学医学院) Department of Biomedical Informatics, Harvard University(哈佛大学生物医学信息学系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出医疗世界模型框架,通过构建患者状态、建模临床动态和支持干预决策,推动医疗AI从静态诊断向动态模拟演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16580 2026-06-16 cs.LG cs.CV 新提交 57%

Multi-Modal Spatio-Temporal Graph Neural Network with Mixture of Experts for Soil Organic Carbon Prediction

基于专家混合的多模态时空图神经网络用于土壤有机碳预测

Daniele Mos, Felipe Drummond, Anton Bossenbroek, Soufiane el Khinifri

机构 * Spatialise B.V.

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出SpTGNN,一种多模态时空图神经网络,通过异构图注意力、微调基础模型特征提取和稀疏专家混合融合,结合异方差回归与深度集成的不确定性量化,在三个区域数据集上优于XGBoost基线。

Comments Paper is 27 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16236 2026-06-16 cs.LG cs.NE 新提交 57%

Evolutionary Bilevel Reward Shaping for Generalization in Reinforcement Learning

进化双层奖励塑形以增强强化学习的泛化能力

Ekasit Usaratniwart, Xilin Gao, Marc Ong, Youhei Akimoto

机构 * University of Tsukuba(筑波大学) RIKEN Center for Advanced Intelligence Project(理化学研究所革新智能综合研究中心)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出GERS方法,通过双层优化利用标量验证反馈调整奖励函数,在限制轨迹访问下提升强化学习在未见环境中的泛化性能。

Comments Accepted at PPSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16202 2026-06-16 cs.CV cs.AI cs.RO 新提交 57%

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

EgoPhys: 从第一人称视频学习可变形物体的通用物理模型

Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出EgoPhys框架,从第一人称RGB视频中通过可泛化先验构建可变形物体的物理数字孪生,无需测试时优化即可预测弹簧刚度场,在重建、未来预测和零样本泛化上优于基线。

Comments Project Page: https://hjhyunjinkim.github.io/EgoPhys

详情

展开后加载摘要…

URL PDF HTML 收藏