arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-05-12 至 2026-05-12 共收录 50
2605.10921 2026-05-12 cs.RO

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10887 2026-05-12 cs.CV

Count Anything at Any Granularity

按任意粒度计数

Chang Liu, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(人工智能学院,上海交通大学,中国) CMIC, Shanghai Jiao Tong University, China(计算机医学研究所,上海交通大学,中国)

AI总结 本文提出多粒度计数框架,通过显式定义计数粒度解决开放世界计数问题,构建了最大的标注数据集KubriCount,并训练了HieraCount模型提升计数精度与泛化能力。

Comments Project page: https://verg-avesta.github.io/KubriCount/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10859 2026-05-12 cs.CV cs.LG

Masked Generative Transformer Is What You Need for Image Editing

你需要Masked Generative Transformer来进行图像编辑

Wei Chow, Linfeng Li, Xian Sun, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu

机构 * ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出EditMGT框架,利用Masked Generative Transformers实现局部化编辑,通过多层注意力整合和区域保持采样提升编辑精度,使用CrispEdit-2M数据集在多个基准上取得最佳性能。

Comments CVPR 2026 HiGen Workshop; Project Page at https://weichow23.github.io/EditMGT/ GitHub at https://github.com/weichow23/EditMGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10845 2026-05-12 cs.CV cs.CL

BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation

BabelDOC: 通过中间表示实现更好的布局保持PDF翻译

Qi Yang, Xiangyao Ma, Xiao Wang, Hao Wang, Rui Wang

机构 * School of Computer Engineering and Science, Shanghai University, Shanghai, China(1 上海大学计算机工程与科学学院,上海,中国) Funstory.ai Limited, Hong Kong SAR, China(2 Funstory.ai有限公司,香港特别行政区,中国) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(3 上海交通大学计算机科学与工程系,上海,中国)

AI总结 BabelDOC通过中间表示框架实现布局保持的PDF翻译,解决语言处理与布局保持的矛盾,提升翻译精度和文档一致性。

Comments ACL 2026 System Demonstration paper. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10756 2026-05-12 cs.CV

TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection

TINS: 测试时ID-原型分离的负语义学习用于OD检测

Yifeng Yang, Jubo Feng, Jing Xu, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科学与技术大学)

AI总结 TINS通过测试时ID-原型分离负语义学习方法,提升OOD检测性能,实验显示在Four-OOD基准上FPR95显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10676 2026-05-12 cs.CV cs.LG

Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

非盲目而是被沉默:通过对抗性反常识平衡视觉与语言

Qingxin Xiao, Peilin Zhao, Yangyang Zhao, Lingwei Dang, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Institute for Super Robotics (Huangpu)(机器人研究所(黄埔)) Shanghai Jiao Tong University(上海交通大学) Changsha University of Science and Technology(长沙理工大学)

AI总结 本文提出ACE框架,通过对抗性反常识补丁扰动视觉上下文,动态平衡语言先验与视觉信息,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10634 2026-05-12 cs.AI

Teacher-Aware Evolution of Heuristic Programs from Learned Optimization Policies

具有教师意识的从学习优化策略中演化启发式程序

Minyu Chen, Song Qin, Ling-I Wu, Jianxin Xue, Guoqiang Li

机构 * Shenzhen Technology University(深圳科技大学) Shanghai Polytechnic University(上海理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种教师意识的进化框架,利用独立训练的优化策略作为行为教师,通过查询教师对候选启发式程序状态的动作偏好来指导进化,提升调度、路由和图优化任务的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10523 2026-05-12 cs.CV

Improving Human Image Animation via Semantic Representation Alignment

通过语义表示对齐提升人类图像动画

Chang Liu, Mengting Chen, Yixuan Huang, Haoning Wu, Chen Ju, Shuai Xiao, Jinsong Lan, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) Alibaba Group, China(阿里巴巴集团,中国)

AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。

Comments Accepted by CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10429 2026-05-12 physics.chem-ph cs.AI

Physical probes expose and alleviate chemical-environment collapse in molecular representations

物理探针揭示并缓解分子表示中的化学-环境崩溃

Jiebin Fang, Zidi Yan, Churu Mao, Yongjun Jiang, Xinyi Tang, Lei Miao, Dan Lu, Yun Huang, Wanjing Ding, Zhongjun Ma

机构 * Hainan Institute, Zhejiang University(浙江大学海南研究院) Institute of Marine Biology and Pharmacology, Ocean College, Zhejiang University(浙江大学海洋学院海洋生物学与药理研究所) School of Food and Pharmacy, Zhejiang Ocean University(浙江海洋大学食品学院) Hangzhou Bio-Sincerity Pharmaceutical Technology Company Limited(杭州生物 sincerity 药业技术有限公司) School of Pharmaceutical Sciences, Shanghai Jiao Tong University(上海交通大学药学院)

AI总结 本文提出CLAIM框架,通过对比学习恢复化学分辨率,提升分子光谱检索,并在多种分子属性任务中实现有效应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10343 2026-05-12 cs.CV cs.AI

EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

EvoStreaming: 你的离线视频模型本质上是一个原生流式助手

Zichen Wen, Boxue Yang, Junlong Ke, Jiajie Huang, Chenfei Liao, Junxi Wang, Xuyang Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学)

AI总结 本文提出EvoStreaming框架,通过自演化方法使离线视频模型适应流式助手任务,仅需1000个自生成样本即可提升RealStreamEval评分,并保持离线性能。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10341 2026-05-12 cs.AI cs.SE

PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

PaperFit:科学文档中的视觉闭环排版优化

Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li, Conghui He, Jingxuan Wei, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 PaperFit通过视觉闭环优化将可编译的LaTeX文档转化为高质量PDF,解决排版问题并提升文档自动化流程的完整性。

Comments 47 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10172 2026-05-12 cs.CV cs.CL

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21901 2026-05-12 cs.CV

CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal

CLEAR: 基于上下文的端到端无掩码推理的自适应视频字幕移除

Qingdong He, Chaoyi Wang, Peng Tang, Yifan Yang, Xiaobin Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Chinese Academy of Sciences(中国科学院大学) Technical University of Munich(慕尼黑技术大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

AI总结 CLEAR通过上下文感知的自适应学习实现端到端无掩码推理,有效区分字幕与背景内容,提升多语言字幕移除性能。

Comments Accepted by ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21926 2026-05-12 cs.RO

Information Filtering via Variational Regularization for Robot Manipulation

通过变分正则化进行机器人操作的信息过滤

Jinhao Zhang, Wenlong Xia, Yaojia Wang, Zhexuan Zhou, Huizhe Li, Yichen Lai, Haoming Song, Youmin Gong, Jie Mei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出变分正则化方法,通过在U-Net和DiT中随机掩码骨干特征或跳过中间层,减少中间特征中的无关噪声,提升机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10050 2026-05-12 cs.CV

EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs

EchoPrune: 将冗余视为时间回声以实现高效的视频大语言模型

Jiameng Li, Minye Wu, Jiezhang Cao, Aleksei Tiulpin, Matthew B. Blaschko

机构 * KU Leuven(鲁文大学) Shanghai Jiaotong University(上海交通大学) Weill Cornell Medicine(韦尔医学院)

AI总结 本文提出EchoPrune方法,通过将冗余视频token视为时间回声,提升视频大语言模型在固定token预算下的时间分辨率,实验表明其在六个视频理解基准上使模型处理20倍帧数,性能提升8.6%且推理速度提升5.6倍。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10045 2026-05-12 cs.CV

ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models

ExtraVAR: 用于视觉自回归模型中分辨率外推的阶段感知RoPE重映射

Feihong Yan, Shaoyu Liu, Haixuan Wang, Shuai Lu, Linfeng Zhang, Huiqi Li, Xiangyang Ji

机构 * Beijing Institute of Technology(北京理工大学) Xidian University(西安电子科技大学) Northeastern University at Qinhuangdao(秦皇岛东北大学) Shanghai Jiao Tong University(上海交通大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出ExtraVAR,通过阶段感知RoPE重映射解决视觉自回归模型中分辨率外推的全局重复、局部重复和细节退化问题,引入熵驱动自适应注意力校准提升结构和细节质量。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09915 2026-05-12 cs.CL cs.AI cs.CY

Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents

位置:学术会议可能面临由完全自动化科学代理引发的分母游戏威胁

Rong Shan, Te Gao, Hang Zheng, Yunjia Xi, Jiachen Zhu, Zeyu Zheng, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文探讨了由完全自动化科学代理引发的分母游戏威胁,分析了其对学术会议评审系统的影响,并提出系统性政策改革作为缓解措施。

Comments Accepted by ICML'26 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09614 2026-05-12 cs.CV

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

反射锚点用于长链多模态推理中的传播感知视觉保留

Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai, Weishu Zhao, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Lanzhou University(兰州大学)

AI总结 本文提出RAPO方法,通过信息论分析优化视觉传播潜力和局部分支空间,提升长链多模态推理的视觉信息保留效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09579 2026-05-12 cs.LG cs.AI

Biosignal Fingerprinting: A Cross-Modal PPG-ECG Foundation Model

生物信号指纹:一种跨模态PPG-ECG基础模型

Zhangdaihong Liu, Chang Liu, Fenglin Liu, Yixuan Chen, Yang Yang, David A. Clifton, Xiao Gu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津苏浙先进研究中心) School of Public Health, Shanghai Jiao Tong University(上海交通大学公共卫生学院)

AI总结 本文提出生物信号指纹,通过跨模态基础模型M2AE生成紧凑且可迁移的心血管状态表示,实现无需重新训练的多任务应用,在多个任务中表现出色。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09442 2026-05-12 cs.CV cs.AI

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

SWIFT: 用于高效交互长视频生成的提示自适应内存

Shanwen Tan, Hao Li, Jingtao Zhang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。

Comments Code is available at https://github.com/ShanwenTan/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09441 2026-05-12 cs.RO

Beyond Isolation: A Unified Benchmark for General-Purpose Navigation

超越孤立:一个通用导航的统一基准

Samson Sun, Tianyi Yang, Tengyue Wang, Yikai Xue, Zhengjie Xu, Lingming Zhang, Qichen Zhang, Chao Liang, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(自动化实验室、上海交通大学) Research Lab, Anyverse Dynamics(Anyverse Dynamics 研究实验室)

AI总结 本文提出OmniNavBench基准,通过复合复杂性、形态通用性和演示质量三大变革,解决通用导航中跨技能协调与跨形态泛化的问题,揭示现有方法在复杂导航任务中的不足。

Comments Accepted at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09378 2026-05-12 cs.CV cs.AI cs.CL

EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation

EduStory: 一个统一框架,用于教学一致的多镜头STEM教学视频生成

Xinyi Wu, Jayant Teotia, Shuai Zhao, Erik Cambria

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出EduStory框架,通过整合教学状态建模、脚本引导的结构控制和学习导向评估指标,解决多镜头STEM教学视频中知识一致性与教学叙事连贯性的问题,并引入EduVideoBench基准测试以评估生成视频的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09352 2026-05-12 cs.AI

The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?

维特根斯坦表示假说:语言是否是多模态收敛的吸引子?

Zhaoyang Zhang, Run Shao, Dongyue Wu, Jiajie Teng, Chao Tao, Jingdong Chen, Haifeng Li

机构 * Central South University(中南大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 研究探讨了为何不同模态的神经网络收敛于共享表示,发现语言模态对其他模态有显著方向性吸引,提出维特根斯坦表示假说。

Comments 22 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06483 2026-05-12 cs.AI cs.RO cs.SY eess.SY

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

ReasonSTL:通过工具增强的过程奖励学习桥接自然语言与信号时间逻辑

Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出ReasonSTL框架,通过工具增强和过程奖励学习,解决自然语言到信号时间逻辑(STL)的转换难题,提供透明、低成本且隐私保护的正式规范起草方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05736 2026-05-12 cs.AI

SDFlow: Similarity-Driven Flow Matching for Time Series Generation

SDFlow:基于相似度的流匹配用于时间序列生成

Wei Li, Shibo Feng, Pengcheng Wu, Xingyu Gao, Min Wu, Peilin Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院) Institute for Infocomm Research, A*STAR(信息通信研究院,A*STAR)

AI总结 SDFlow通过非自回归框架在冻结的VQ潜在空间中实现并行序列生成,解决曝光偏差问题,降低高维性,引入离散监督,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00623 2026-05-12 cs.RO

Recovering Hidden Reward in Diffusion-Based Policies

从扩散策略中恢复隐藏奖励

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出EnergyFlow框架,通过参数化标量能量函数的梯度作为去噪场,统一生成动作建模与逆强化学习,证明在最大熵最优性下,去噪分数匹配学习的分数函数能恢复专家的软Q函数梯度,无需对抗训练即可提取奖励。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14125 2026-05-12 cs.CV cs.AI cs.RO

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System

HiVLA:一种以视觉为基础的分层具身操作系统

Tianshuo Yang, Guanyu Chen, Yutian Chen, Zhixuan Liang, Yitian Liu, Zanxin Chen, Chunpu Xu, Haotian Liang, Jiangmiao Pang, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 HiVLA提出一种分层框架,将高层语义规划与底层动作控制解耦,通过视觉 grounding 和 Diffusion Transformer 专家提升机器人操作能力,实验证明其在长时序技能组合和精细操作中表现优异。

Comments Project Page: https://tianshuoy.github.io/HiVLA-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11808 2026-05-12 cs.CV

Pair2Scene: Learning Local Object Relations for Procedural Scene Generation

Pair2Scene:学习局部物体关系以生成程序化场景

Xingjian Ran, Shujie Zhang, Weipeng Zhong, Li Luo, Bo Dai

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出Pair2Scene框架,通过学习局部规则与场景层次和物理算法,生成高保真的3D室内场景,优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏