arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 246
2604.05498 2026-08-14 cs.RO 版本更新

JailWAM: Jailbreaking World Action Models in Robot Control

JailWAM: 在机器人控制中对World Action Models进行劫持

Hanqing Liu, Songping Wang, Jiahuan Long, Jiacheng Hou, Jialiang Sun, Chao Li, Yang Yang, Wei Peng, Xu Liu, Tingsong Jiang, Yao Mu, Wen Yao

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部重点实验室) PR Lab, Nanjing University(南京大学PR实验室) Defense Innovation Institute, Chinese Academy of Military Science(军事科学院国防创新研究院)

AI总结 本文提出JailWAM框架,通过三级安全分类体系和三个核心组件,系统评估WAM的安全性,实验表明其能有效暴露物理漏洞,攻击成功率高达84.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19799 2026-08-14 cs.AI hep-lat 版本更新

PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research

PhysMaster:构建一个自主的AI物理学家用于理论和计算物理学研究

Tingjia Miao, Wenkai Jin, Jinxin Tan, Muhua Zhang, Xianghe Pang, Zexi Liu, Yuwen Du, Tian Jin, Tu Guo, Zhengliang Zhang, Jingkun Liu, Yuelin Hu, Jiejun Zhang, Yunjie Huang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Physics and Astronomy(物理天文学院) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Tsung-Dao Lee Institute(李政道研究所) Zhiyuan College(智源学院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) DP Technology(DP技术)

AI总结 PhysMaster通过结合抽象推理与数值计算,利用LANDAU数据宇宙提升决策可靠性,实现理论与计算物理学研究的自动化与自主发现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03880 2026-08-14 cs.CV 版本更新

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25758 2026-08-13 cs.CV 版本更新

Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs

基于双分布估计的零样本噪声测试时自适应方法

Wenjie Zhu, Yabin Zhang, Liang Xu, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对噪声测试时自适应中分布外异常值问题,提出双分布估计框架,通过无训练的高斯分布建模实现零样本鲁棒自适应。

Comments Accepted by ECCV2026. Project Page:https://zhuwenjie98.github.io/DDE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01143 2026-08-13 cs.CV cs.AI 版本更新

MicroAUNet: Boundary-Enhanced Multi-scale Fusion with Knowledge Distillation for Colonoscopy Polyp Image Segmentation

MicroAUNet:结合知识蒸馏的边界增强多尺度融合用于结肠镜息肉图像分割

Ziyi Wang, Yuanmei Zhang, Baoying Ye, Yimei Jiang, Leilei Gu, Suncheng Xiang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学)

AI总结 本文针对结肠镜息肉分割模型边界模糊或复杂度高的问题,提出轻量型MicroAUNet,结合深度可分离空洞卷积与通道-空间注意力块,辅以渐进式两阶段知识蒸馏,在低复杂度下实现先进分割准确率,适用于实时临床应用。

Comments Accepted to MedVidU @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16188 2026-08-12 cs.CV 版本更新

TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution

teasr: 面向真实世界图像超分辨率的训练高效任意步扩散Transformer

Xiang Gao, Chenxin Zhu, Yushun Fang, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出TEASR框架,通过自对抗蒸馏和时步感知矫正策略,在单一扩散模型中实现任意步采样,无需辅助教师模型,显著提升训练效率并超越现有方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28803 2026-08-12 cs.CV cs.LG 版本更新

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Mila – Quebec AI Institute(魁北克AI研究所)

AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05144 2026-08-11 cs.AI 版本更新

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Argus:面向长程推理的通用智能体运行时

Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Donghua University(东华大学)

AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27380 2026-08-11 cs.CV cs.AI 版本更新

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

机构 * CUHK(香港中文大学) USTC(中国科学技术大学) SCUT(华南理工大学) HKU(香港大学) NTU(南洋理工大学) PKU(北京大学) SJTU(上海交通大学) CMU(卡内基梅隆大学) THU(清华大学) HUST(华中科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。

Comments 15 pages, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24744 2026-08-11 cs.RO cs.CV 版本更新

Data Pyramid for Embodied Manipulation: A Survey

用于具身操纵的数据金字塔

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

机构 * PKU(北京大学) NTU(南洋理工大学) HKUST(香港科技大学) NUS(新加坡国立大学) CUHK(香港中文大学) HKU(香港大学) Duke(杜克大学) UCB(加州大学伯克利分校) GBU(未提及具体中文名的机构) NJU(南京大学) SJTU(上海交通大学)

AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。

Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22877 2026-08-11 cs.AI cs.HC cs.RO 版本更新

Physical AI Governance: From Theory to Practice Across Life Cycle

物理人工智能治理:跨越生命周期从理论到实践

Wang Yang, Shaobo Wang, Hongxuan Liu, Xiaoran Cai, Yunyu He, Jingzong Zhou, Mengzhong Ma, Yi Yu, Rohit Sharma, Jingjing Fu, Peng Qi

机构 * Case Western Reserve University(凯斯西储大学) Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学) University of California, Riverside(加州大学河滨分校) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Salesforce(Salesforce公司) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 本文对物理人工智能治理进行全面综述,综合现有原则形成统一框架,提出五阶段生命周期,通过具体实践展示各阶段治理操作,为构建安全可信且符合社会价值的物理人工智能系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01636 2026-08-11 cs.CV 版本更新

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

Pave-GRPO:通过原则性平均速度分解超越瞬时引导

Pengyang Ling, Jiazi Bu, Yujie Zhou, Yibin Wang, Zhenyu Hu, Zihan Zhang, Yi Jin, Huaian Chen, Yuhang Zang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出Pave-GRPO方法,通过原则性平均速度分解将粗粒度过渡分解为细粒度子轨迹,在不增加生成成本的情况下将奖励反馈传播到更多中间步骤,实现更全面的偏好对齐。

Comments 18 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00637 2026-08-11 cs.RO 版本更新

Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion

全局-局部注意力分解用于人形感知运动中的地形编码

Shengcheng Fu, Yang Zhang, Zhanxiang Cao, Liyun Yan, Yizhi Chen, Yunpeng Yin, Yue Gao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司)

AI总结 提出全局-局部注意力分解(GLAD)方法,通过粗到细编码器分离全局地形感知和局部立足点选择,实现人形机器人在稀疏立足点和受限环境中的鲁棒运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13023 2026-08-11 cs.SD cs.MM 版本更新

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

SpotSound: 通过细粒度时间定位增强大音频-语言模型

Luoyi Sun, Xiao Zhou, Zeqian Li, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)

AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21629 2026-08-11 cs.PL cs.AI cs.CL cs.LG 版本更新

Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis

Quokka:通过不变式合成加速程序验证

Anjiang Wei, Tianran Sun, Tarun Suresh, Haoze Wu, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amherst College(阿默斯特学院) Nanjing University(南京大学)

AI总结 Quokka通过利用大语言模型生成有用的循环不变式,提升程序验证效率,其评价导向框架在多个模型家族中表现出色,优于现有基于LLM的验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16758 2026-08-11 cs.CV 版本更新

Motion-Aware Animatable Gaussian Avatars Deblurring

具有运动感知的可动画高斯人像去模糊

Muyao Niu, Yifan Zhan, Qingtian Zhu, Zhuoxiao Li, Wei Wang, Zhihang Zhong, Xiao Sun, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种从模糊视频中直接重建清晰3D人体高斯人像的方法,结合了基于物理的模糊模型和运动模型,以解决运动引起的模糊问题。

Comments Accepted at CVPR 2026, Codes: https://github.com/MyNiuuu/MAD-Avatar

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17504 2026-08-11 cs.CV q-bio.QM 版本更新

BMDS-Net:Deployment-aware multi-modal brain tumor segmentation with adaptive fusion,decoder regularization,and Bayesian calibration

BMDS-Net:一种用于鲁棒脑肿瘤分割的贝叶斯多模态深度监督网络

Yan Zhou, Suncheng Xiang, Zhen Huang, Yue Ouyang, Yingqiu Li, Zehua Wang

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Chest Hospital, Shanghai Jiao Tong University School of Medicine(上海胸科医院,上海交通大学医学院)

AI总结 BMDS-Net通过贝叶斯方法提升多模态脑肿瘤分割的鲁棒性和可信度,实现更稳定的临床应用。

Comments 21 pages, 6 figures. Manuscript prepared for submission to ACM HEALTH

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19366 2026-08-11 cs.CL cs.LG 版本更新

MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs

MoE-Prism:通过模型-系统协同设计解耦整体式专家以实现弹性MoE服务

Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 MoE-Prism通过模型-系统协同设计将MoE的整体专家分解为细粒度子专家,实现请求级计算弹性,扩展路由工作点数量,提升吞吐量并降低首包时间,验证了实用弹性MoE服务的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18469 2026-08-11 cs.CV 版本更新

HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model

HonestFace:基于单步扩散模型的诚实人脸复原方法

Jingkai Wang, Wu Miao, Jue Gong, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。

Comments Published at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19932 2026-08-10 cs.CL cs.SD 版本更新

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

通过渐进压缩实现口语语言模型的高效模态链推理

Pengchao Feng, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Token Foundry, Alibaba Group(阿里巴巴集团淘系技术)

AI总结 针对口语语言模型推理能力落后问题,提出高效模态链推理(ECoM推理),通过压缩文本组件提高推理准确性,并用渐进压缩策略训练,实验显示其在口语数学问答基准测试中,增强推理且保持效率,准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27540 2026-08-10 cs.AI 版本更新

In-Context Examples Suppress Scientific Knowledge Recall in LLMs

上下文示例抑制大语言模型中的科学知识回忆

Chaemin Jang, Woojin Park, Hyeok Yun, Dongman Lee, Jihee Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究发现上下文示例会削弱大语言模型对科学知识的回忆能力,使模型更依赖经验模式匹配而非预训练知识。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18112 2026-08-10 cs.RO 版本更新

EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation

EchoVLA:用于VLA驱动移动操作的协同声明记忆

Min Lin, Xiwen Liang, Bingqian Lin, Jingzhi Liu, Zijian Jiao, Kehan Li, Ziang Yan, Yu Sun, Weijia Liufu, Yuhan Ma, Jiarui Hu, Yuecheng Liu, Shen Zhao, Yuzheng Zhuang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University, Shenzhen, China(中山大学深圳校区) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Huawei Noah's Ark Lab, China(华为诺亚方舟实验室)

AI总结 EchoVLA通过协同声明记忆提升移动操作性能,结合场景与事件记忆,利用注意力融合指导基臂策略,实现高效导航与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09717 2026-08-10 cs.LG cs.AI 版本更新

Provable Training Data Identification for Large Language Models

大语言模型训练数据的可证明识别

Zhenlong Liu, Hao Zeng, Weiran Huang, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)

AI总结 本文提出PTDI方法,通过集级推断实现大语言模型训练数据识别的可证明误差控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17584 2026-08-10 cs.AR cs.LG 版本更新

CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM

CHIME:基于DIMM-PIM的高效长上下文注意力-全连接分离式推理方案

Qingyuan Liu, Liyan Chen, Haocheng Wang, Yanning Yang, Dong Du, Zhigang Mao, Naifeng Jing, Yubin Xia, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 CHIME是首个集成DIMM-PIM的AFD系统,通过无气泡流水线等技术解决同步问题,实现最高5.15倍于HBM-PIM方案的LLM推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04657 2026-08-07 cs.CV 版本更新

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26657 2026-08-07 cs.RO cs.CV 版本更新

Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control

Enfold:将世界生成器计算融入预测表示以实现高效具身控制

Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Xiaokang Yang, Yichao Yan

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

AI总结 Enfold将世界生成器计算融入预测表示,在LIBERO等多任务中实现高效具身控制,大幅降低动作延迟,且能适应场景变化,为具身控制提供了新范式。

Comments project page, https://zwl666666.github.io/enfold/

详情

展开后加载摘要…

URL PDF HTML 收藏