arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3135
2607.26760 2026-08-05 cs.CL cs.LG 版本更新

Metis: Memory Foundation Model

Metis:记忆基础模型

Zeyu Zhang, Ziliang Guo, Yihang Sun, Xichong Zhang, Xixuan Hao, Zehao Lin, Yang Zhang, Xiaoyan Zhao, Tong Shen, Bo Tang, Zhi-Qin John Xu, Junchi Yan, Haofen Wang, Xu Chen, Feiyu Xiong, Zhiyu Li, Tat-Seng Chua

机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨芯(上海)科技有限公司) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

AI总结 该研究提出首个记忆基础模型原型Metis,赋予基础模型原生记忆能力,通过新架构与优化目标实现,经实验验证其具备原生记忆能力并发布相关资源。

Comments 46 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29718 2026-08-05 cs.IR cs.AI cs.CL 版本更新

Diagnosing and Mitigating Context Rot in Long-horizon Search

诊断和缓解长视野搜索中的上下文腐烂

Shijie Xia, Yikun Wang, Zhen Huang, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) SII GAIR

AI总结 本文研究大语言模型在长视野任务中因上下文过长导致的性能退化(上下文腐烂),通过实验揭示其普遍性,并提出上下文管理和拒绝采样两种缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13040 2026-08-05 cs.RO 版本更新

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) China University of Mining Technology(中国矿业大学)

AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02428 2026-08-04 cs.CV 新提交

DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation

DF³:自主导航中基于无解码器特征预测的世界建模

Jiaming Chen, Guoan Xu, Aoshen Huang, Haozhuo Zhang, Yang Li, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) University of Technology Sydney(悉尼科技大学) Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究提出DF³框架,通过冻结视觉基础模型、MACF机制及专用任务查询,在潜在空间直接预测特征并生成任务输出,在性能与效率上实现平衡,适用于自主导航的世界建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02276 2026-08-04 cs.AI 新提交

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1:从智能体失败轨迹中学习编辑可执行运行时管控程序

Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

AI总结 Harness-R1是首个基于智能体失败轨迹学习编辑可执行运行时管控程序的方法,经WebShop等基准测试,可提升Qwen3.5-9B智能体成功率,为管控程序与智能体协同进化提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02252 2026-08-04 cs.CV cs.AI 新提交

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

HarMoE:基于数据集解耦专家的多源胸部X射线预训练

Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01944 2026-08-04 cs.CV 新提交

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

UniMoCa:将运动与相机控制统一为忠实人类视频生成的视觉代理

Liming Tan, Ye Chen, Hao Zhang, Lirong Qian, Feifei Li, Bingbing Ni

机构 * SJTU(上海交通大学)

AI总结 UniMoCa是统一运动与相机控制的视觉代理框架,提出MCVP表征并构建MCVP-Video数据集,在Wan2.2 I2V上实现视频生成多方面性能提升且复杂度低

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01794 2026-08-04 cs.CV cs.AI cs.CL 新提交

Illuminating Visual Identity in Universal Multimodal Embeddings

揭示通用多模态嵌入中的视觉身份

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01017 2026-08-04 cs.CL cs.AI 新提交

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01007 2026-08-04 cs.LG 新提交

Fused Bayesian Flow Networks for Dual-Target Molecular Design

用于双靶点分子设计的融合贝叶斯流网络

Jingyuan Zhou, Shikui Tu, Lei Xu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

AI总结 针对现有双靶点分子生成方法难以充分整合双靶标特征的问题,提出融合贝叶斯流网络FusedBFN,通过分布融合与乘积专家公式实现双靶点分子设计,实验证实其生成的分子兼具强结合亲和力与良好性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00635 2026-08-04 cs.RO 新提交

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation

FlowPilot:面向敏捷无人机导航的实时世界-动作建模

Runqing Wang, Ding Yu, Pengyuan Min, Xinhong Zhang, Wei Xiao, Yu Hu, Jie Chen, Fu Zhang, Gang Wang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

AI总结 FlowPilot是一种基于流匹配的紧凑世界-动作模型,采用双流混合Transformer,在三级深度金字塔数据上训练,可实现敏捷无人机实时导航,性能优于基线,能在杂乱环境中以5.5m/s速度运行。

Comments 8 pages, 9 figures, 2 tables, submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00625 2026-08-04 cs.RO cs.AI 新提交

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

动态环境下基于学习的运动规划:从基础算法到新兴范式

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen

机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) University of Connecticut(康涅狄格大学) Guangzhou Maritime University(广州海事大学) University of Chinese Academy of Sciences(中国科学院大学) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Wuyi University(五邑大学) South China University of Technology(华南理工大学)

AI总结 本综述回顾2015至2025年动态环境下基于学习的运动规划代表性研究,提出学习作用分类法,分析相关影响因素,探讨安全可验证规划等开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31986 2026-08-04 cs.CV 版本更新

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT: 教会多模态模型通过潜在思维链进行思考

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) NKIARI AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) Tianjin University(天津大学)

AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。

Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21994 2026-08-04 cs.LG 版本更新

Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts

前缀引导的在线策略蒸馏:从轨迹中挖掘黄金轨迹

Qingfei Zhao, Huan Song, Shuyu Tian, Jiawei Shao, Xuelong Li

机构 * TeleAI Shanghai Jiao Tong University(上海交通大学)

AI总结 针对在线策略蒸馏在长程数学推理中效率低、噪声大的问题,提出前缀引导的在线策略蒸馏,通过前缀长度估计轨迹价值,仅对高重叠候选继续生成长轨迹,在多个基准上提升准确率并减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10441 2026-08-04 cs.LG cs.AI 版本更新

LakeMLB: Data Lake Machine Learning Benchmark

LakeMLB: 数据湖机器学习基准

Feiyu Pan, Tianbin Zhang, Aoqian Zhang, Yu Sun, Zheng Wang, Lixing Chen, Li Pan, Jianhua Li

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) Nankai University(南开大学)

AI总结 LakeMLB提出一个数据湖机器学习基准,针对多源多表场景,提供真实数据集和三种整合策略,评估机器学习方法在复杂数据湖环境中的性能。

Comments 9 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10739 2026-08-04 cs.CL cs.AI 版本更新

Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving

长周期推理代理用于竞赛级数学问题求解

Yuzhe Gu, Songyang Gao, Zijian Wu, Lingkai Kong, Wenwei Zhang, Zhongrui Cai, Fan Zheng, Tianyou Ma, Junhao Shen, Haiteng Zhao, Duanyang Zhang, Huilun Zhang, Kuikun Liu, Chengqi Lyu, Yanhui Duan, Chiyu Chen, Ningsheng Ma, Jianfei Gao, Han Lyu, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab The Chinese University of Hong Kong(香港中文大学) ICMAT Spanish National Research Council(西班牙国家科研 council) The High School Affiliated to Renmin University of China(中国人民大学附属高中) Ren Hui Academy of Beijing(北京润辉学院)

AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20635 2026-08-04 cs.CV 版本更新

iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

iMontage:统一、多功能、高度动态的多对多图像生成

Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun Shanghai Jiao Tong University(上海交通大学)

AI总结 iMontage通过整合视频模型的先验知识与图像数据的多样性,实现了统一、多功能且动态的多对多图像生成。

Comments Our homepage: https://kr1sjfu.github.io/iMontage-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24560 2026-08-04 cs.CL cs.AI 版本更新

AdaThink-Med: Optimizing Inference-Time Compute for Medical Reasoning via Uncertainty Quantification

AdaThink-Med:通过不确定性量化优化医学推理的推理时计算

Shaohao Rui, Kaitao Chen, Weijie Ma, Xiaosong Wang

机构 * SJTU(上海交通大学) SII(上海信息所) Shanghai AI Lab(上海人工智能实验室) FDU(复旦大学)

AI总结 本文提出AdaThink-Med框架,通过不确定性引导长度校准优化医学推理的推理时计算,在六大医学基准上降低4.7-6.4倍推理token消耗且性能损失极小,无需外部分类器即可实现资源高效分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04923 2026-08-04 quant-ph cs.AI cs.LG

Artificial intelligence for representing and characterizing quantum systems

Yuxuan Du, Yan Zhu, Yuan-Hang Zhang, Min-Hsiu Hsieh, Patrick Rebentrost, Weibo Gao, Ya-Dong Wu, Jens Eisert, Giulio Chiribella, Dacheng Tao, Barry C. Sanders

机构 * College of Computing Data Science, Nanyang Technological University, Singapore 639798, Singapore Computation Initiative, Department of Computer Science, The University of Hong Kong, Pokfulam Road, Hong Kong Department of Physics, University of California, San Diego, La Jolla, CA 92093, USA Hon Hai (Foxconn) Research Institute, Taipei, Taiwan Centre for Quantum Technologies, National University of Singapore Department of Computer Science, National University of Singapore School of Electrical \& Electronic Engineering, Nanyang Technological University, Singapore 639798, Singapore John Hopcroft Center for Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China Dahlem Center for Complex Quantum Systems, Freie Universitat Berlin, 14195 Berlin, Germany Department of Computer Science, Parks Road, Oxford, OX1 3QD, United Kingdom Perimeter Institute for Theoretical Physics, Waterloo, Ontario N2L 2Y5, Canada Institute for Quantum Science Technology, University of Calgary, Alberta T2N 1N4, Canada

Comments 32 pages. Comments are welcome

Journal ref Nature Reviews Physics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18819 2026-08-04 cs.CV 版本更新

Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

用于3D理解的参数高效CLIP适配:通过统一分词实现

Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Trento(特伦托大学) University of Pisa(比萨大学) Beijing Forestry University(北京林业大学) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (GZ)(香港科技大学) Shandong University(山东大学) University of California, Merced(加州大学默塞德分校)

AI总结 本文提出参数高效框架UTok3D,通过学习尺度归一化3D分词器,实现冻结CLIP视觉主干在无标注情况下对不同尺度点云的复用,完成3D分割任务。

Comments 14 pages, tokenizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29684 2026-08-03 cs.CV 新提交

Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

面向黑暗环境中鲁棒且具备三维感知能力的RGB-NIR成像

Muyao Niu, Mingze Ma, Yifan Zhan, Qingtian Zhu, Zhihang Zhong, Wei Guo, Chang Wen Chen, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Adelaide University(阿德莱德大学) School of Artificial Intelligence (SAI) Shanghai Jiao Tong University(上海交通大学人工智能学院) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对黑暗环境下低光照RGB-NIR成像鲁棒性不足的问题,提出一种无需干净RGB监督、具备三维感知能力的神经模型,可融合含噪RGB与NIR线索恢复干净RGB图像,经合成与真实数据验证效果优越。

Comments ACM Multimedia 2026, Codes and Models: https://github.com/MyNiuuu/3DarkFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29567 2026-08-03 cs.RO 新提交

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware

TransGraspNet:透明实验器皿的物理与几何一致性操纵

Hailing Hu, Mingyi Zhu, Yiquan An, Yifei Tian, Tianyou Zuo, Lifeng Zhou

机构 * Peking University(北京大学) School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

AI总结 TransGraspNet是实现透明实验器皿物理与几何一致性操纵的框架,通过三个耦合原则解决跨阶段不一致问题,在真实机器人平台上实现了高抓取成功率与零液体泼洒的可靠操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29279 2026-08-03 cs.SD 新提交

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测

Qingjian Lin, Yuxin Li, Haoyang Zhang, Jun Chen, Yechang Huang, Feng Tian, Xie Li, Xiangyu Tony Zhang, Daijiao Liu, Yuxin Zhang, Jinglan Gong, Bo Zhao, Fei Tian, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

机构 * StepFun(阶跃星辰) NTU(南洋理工大学) PKU(北京大学) UNSW(新南威尔士大学) SJTU(上海交通大学) USTC(中国科学技术大学)

AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。

Comments 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11567 2026-08-03 cs.CV 版本更新

Dynamic Execution Commitment of Vision-Language-Action Models

视觉-语言-动作模型的动态执行承诺

Feng Chen, Xianghui Wang, Yuxuan Chen, Boying Li, Yefei He, Zeyu Zhang, Yicheng Wu

机构 * University of Adelaide(阿德莱德大学) Sichuan University(四川大学) Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学) Zhejiang University(浙江大学) Imperial College London(伦敦帝国理工学院)

AI总结 本文提出A3机制,通过将动态执行承诺重新定义为自推测前缀验证问题,解决了视觉-语言-动作模型在动态或分布外情况下执行鲁棒性和推理吞吐量之间的平衡问题。

Comments code is available at https://inceptionwang.github.io/A3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23413 2026-08-03 cs.CV 版本更新

I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation

I3DM:隐式3D-aware记忆检索与注入用于一致的视频场景生成

Jia Li, Han Yan, Yihang Chen, Siqi Li, Xibin Song, Yifu Wang, Jianfei Cai, Tien-Tsin Wong, Pan Ji

机构 * Monash University(莫纳什大学) Vertex Lab(Vertex实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出I3DM,一种隐式3D-aware记忆机制,通过预训练FF-NVS模型的中间特征进行视图相关性评分,提升复杂遮挡下的场景一致性生成效果。

Comments Project page: https://riga2.github.io/i3dm

详情

展开后加载摘要…

URL PDF HTML 收藏