arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-05-11 至 2026-05-11 共收录 14
2605.08084 2026-05-11 cs.RO cs.CV

123D: Unifying Multi-Modal Autonomous Driving Data at Scale

123D:规模化统一多模态自动驾驶数据

Daniel Dauner, Valentin Charraut, Bastian Berle, Tianyu Li, Long Nguyen, Jiabao Wang, Changhui Jing, Maximilian Igl, Holger Caesar, Boris Ivanovic, Yiyi Liao, Andreas Geiger, Kashyap Chitta

机构 * KE:SAI University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) NVIDIA Research(NVIDIA研究) Valeo Brain(法雷奥大脑) OpenDriveLab at Shanghai Innovation Institute(上海创新研究院自动驾驶实验室) Zhejiang University(浙江大学) Delft University of Technology(代尔夫特理工大学)

AI总结 123D通过单一API统一多模态自动驾驶数据,解决数据碎片化、同步难题,并提供分析工具,支持跨数据集3D目标检测和强化学习规划应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04651 2026-05-11 cs.LG cs.CL

FAAST: Forward-Only Associative Learning via Closed-Form Fast Weights for Test-Time Supervised Adaptation

FAAST:通过闭式快速权重实现的前向仅关联学习用于测试时监督适应

Guangsheng Bao, Hongbo Zhang, Han Cui, Ke Sun, Yanbin Zhao, Juncai He, Yue Zhang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Shanghai Polytechnic University(上海理工大学)

AI总结 FAAST通过单次传递将标注示例分析性编译为快速权重,实现常数时间推理,减少适应时间90%并节省内存使用,适用于资源受限模型的高效监督任务适应。

Comments 9 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07425 2026-05-11 cs.LG cs.CL math.OC

Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise

基于符号的优化器在重尾噪声下表现有效

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Software Technology, Zhejiang University(浙江大学软件学院) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 本文研究了在重尾梯度噪声下,基于符号的优化器如SignSGD和Lion相较于传统自适应方法的优越性,通过理论分析和实验验证,证明其在处理重尾噪声时的高效性。

Comments Code is available at https://github.com/Dingzhen230/Heavy-tailed-Noise-in-LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07478 2026-05-11 cs.CV

AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models

AudioFace: 基于语言的语音驱动面部动画与多模态语言模型

Kai Zheng, Zejian Kang, Rui Mao, Hongyuan Zou, Yuanchen Fei, Xuanyang Xu, Xiangru Huang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tiangong University(天工大学) Hunan University(湖南大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出AudioFace框架,通过语言和发音信息指导语音驱动的面部动作生成,提升语音与面部运动的对应精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07474 2026-05-11 cs.CV cs.AI

ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations

ForgeVLA:无需语言标注的联邦视觉-语言-动作学习

Yuhao Zhou, Yunpeng Zhu, Yang Zhou, Jindi Lyu, Jian Lan, Zhangyuan Wang, Dan Si, Thomas Seidl, Qing Ye, Jiancheng Lyu

机构 * Sichuan University(四川大学) Zhejiang University(浙江大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Lenovo Group Limited(联想集团有限公司) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心)

AI总结 本文提出ForgeVLA框架,通过分布式视觉-动作对训练联邦VLA模型,无需集中数据或人工标注。通过客户端指令分类器构建完整三元组,并引入对比规划损失和自适应聚合策略以解决特征坍塌问题,实验表明性能优于基线模型。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07393 2026-05-11 cs.AI

Offline Policy Optimization with Posterior Sampling

离线策略优化与后验采样

Hongqiang Lin, Dongxu Zhang, Yiding Sun, Mingzhe Li, Ning Yang, Haijun Zhang

机构 * Zhejiang University(浙江大学) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出PSPO方法,通过将动态建模作为贝叶斯推断过程,结合后验采样与约束策略优化,提升离线强化学习的泛化能力与鲁棒性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07353 2026-05-11 cs.AI

Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

增强置信度的对齐使推理大语言模型更加可靠

Kejia Chen, Jiawen Zhang, Yihong Wu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia

机构 * Zhejiang University(浙江大学) Université de Montréal(蒙特利尔大学) Sun Yat-sen University(中山大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文提出CASPO框架,通过迭代直接偏好优化将token级置信度与逐步逻辑正确性对齐,提升推理可靠性和效率,实验表明其在多个基准和模型家族中表现优异。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07178 2026-05-11 cs.CV

Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection

掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测

Kai Zheng, Hang-Cheng Dong, Jiatong Pan, Zhenkai Wu, Fupeng Wei, Wei Zhang

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) North China University of Water Resources and Electric Power(华北水利水电大学) University of Auckland(奥克兰大学)

AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06859 2026-05-11 cs.CV cs.AI cs.LG

Knowledge Transfer Scaling Laws for 3D Medical Imaging

三维医学影像中的知识迁移扩展定律

Ho Hin Lee, Dongna Du, Chu Wang, Yuankai Huo, Shi Gu, James C. Gee, Yifan Wu

机构 * Vanderbilt University(范德比大学) Zhejiang University(浙江大学) McGill University(麦吉尔大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文研究了三维医学影像中不同域的预训练扩展规律,提出基于可转移性的数据分配方法,提升跨域迁移效果,实验表明该方法在疾病分类和器官分割任务中表现更优。

Comments 20 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07277 2026-05-11 cs.LG cs.AI

Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions

Android Coach: 通过单状态多动作提升在线代理训练效率

Guo Gan, Yuxuan Ding, Cong Chen, Yuwei Ren, Yin Huang, Hong Zhou

机构 * Zhejiang University(浙江大学) Qualcomm AI Research(高通人工智能研究)

AI总结 本文提出Android Coach框架,通过单状态多动作方法提升在线强化学习效率,实验显示在AndroidLab和AndroidWorld上成功率提升7.5%和8.3%,训练效率比PPO和GRPO高1.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24789 2026-05-11 cs.LG stat.ML

Fidel-TS: A High-Fidelity Multimodal Benchmark for Time Series Forecasting

Fidel-TS:一种高保真多模态时间序列预测基准

Zhijian Xu, Wanxu Cai, Xilin Dai, Zhaorong Deng, Qiang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学) School of Software(软件学院) Tsinghua University(清华大学) ZJU-UIUC Institute(浙大-UIUC研究院) Zhejiang University(浙江大学) School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen(深圳香港中文大学)

AI总结 本文提出Fidel-TS,一种高保真多模态时间序列预测基准,解决现有基准数据源不纯、泄露问题及结构不清晰的问题,通过实验揭示现有基准的局限性和模型评估中的潜在差异。

Comments new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05276 2026-05-11 cs.LG cs.AI cs.CL

SpikingBrain: Spiking Brain-inspired Large Models

SpikingBrain:基于大脑的高效大模型

Yuqi Pan, Yupeng Feng, Jinghao Zhuang, Siyu Ding, Han Xu, Zehao Liu, Bohan Sun, Yuhong Chou, Xuerui Qiu, Anlin Deng, Anjie Hu, Shurong Wang, Peng Zhou, Man Yao, Jibin Wu, Jian Yang, Guoliang Sun, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhejiang University(浙江大学) LuxiTech MetaX Integrated Circuit Co., Ltd(MetaX集成电路有限公司)

AI总结 本文提出SpikingBrain,一种受大脑启发的大模型,通过高效架构和算法优化,在非NVIDIA平台实现大规模LLM训练与推理,提升长上下文处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏