arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-03 至 2026-08-03 共收录 7
2607.29684 2026-08-03 cs.CV 新提交

Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

面向黑暗环境中鲁棒且具备三维感知能力的RGB-NIR成像

Muyao Niu, Mingze Ma, Yifan Zhan, Qingtian Zhu, Zhihang Zhong, Wei Guo, Chang Wen Chen, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Adelaide University(阿德莱德大学) School of Artificial Intelligence (SAI) Shanghai Jiao Tong University(上海交通大学人工智能学院) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对黑暗环境下低光照RGB-NIR成像鲁棒性不足的问题,提出一种无需干净RGB监督、具备三维感知能力的神经模型,可融合含噪RGB与NIR线索恢复干净RGB图像,经合成与真实数据验证效果优越。

Comments ACM Multimedia 2026, Codes and Models: https://github.com/MyNiuuu/3DarkFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29567 2026-08-03 cs.RO 新提交

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware

TransGraspNet:透明实验器皿的物理与几何一致性操纵

Hailing Hu, Mingyi Zhu, Yiquan An, Yifei Tian, Tianyou Zuo, Lifeng Zhou

机构 * Peking University(北京大学) School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

AI总结 TransGraspNet是实现透明实验器皿物理与几何一致性操纵的框架,通过三个耦合原则解决跨阶段不一致问题,在真实机器人平台上实现了高抓取成功率与零液体泼洒的可靠操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29279 2026-08-03 cs.SD 新提交

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测

Qingjian Lin, Yuxin Li, Haoyang Zhang, Jun Chen, Yechang Huang, Feng Tian, Xie Li, Xiangyu Tony Zhang, Daijiao Liu, Yuxin Zhang, Jinglan Gong, Bo Zhao, Fei Tian, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

机构 * StepFun(阶跃星辰) NTU(南洋理工大学) PKU(北京大学) UNSW(新南威尔士大学) SJTU(上海交通大学) USTC(中国科学技术大学)

AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。

Comments 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11567 2026-08-03 cs.CV 版本更新

Dynamic Execution Commitment of Vision-Language-Action Models

视觉-语言-动作模型的动态执行承诺

Feng Chen, Xianghui Wang, Yuxuan Chen, Boying Li, Yefei He, Zeyu Zhang, Yicheng Wu

机构 * University of Adelaide(阿德莱德大学) Sichuan University(四川大学) Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学) Zhejiang University(浙江大学) Imperial College London(伦敦帝国理工学院)

AI总结 本文提出A3机制,通过将动态执行承诺重新定义为自推测前缀验证问题,解决了视觉-语言-动作模型在动态或分布外情况下执行鲁棒性和推理吞吐量之间的平衡问题。

Comments code is available at https://inceptionwang.github.io/A3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23413 2026-08-03 cs.CV 版本更新

I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation

I3DM:隐式3D-aware记忆检索与注入用于一致的视频场景生成

Jia Li, Han Yan, Yihang Chen, Siqi Li, Xibin Song, Yifu Wang, Jianfei Cai, Tien-Tsin Wong, Pan Ji

机构 * Monash University(莫纳什大学) Vertex Lab(Vertex实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出I3DM,一种隐式3D-aware记忆机制,通过预训练FF-NVS模型的中间特征进行视图相关性评分,提升复杂遮挡下的场景一致性生成效果。

Comments Project page: https://riga2.github.io/i3dm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13319 2026-08-03 cs.LG 版本更新

LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning

LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡

Yanzhe Hu, Yijie Jin, Pengfei Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08390 2026-08-03 cs.RO cs.CV 版本更新

DuetHOI: Language-Guided Bimanual Hand--Object Motion Generation with Articulation Planning and Contact Refinement

StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成

Zhi Wang, Yuyan Liu, Liu liu, Ruonan Liu, Ruixuan Liu

机构 * Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏