arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2506.05280 2026-01-14 cs.CV

Unifying Appearance Codes and Bilateral Grids for Driving Scene Gaussian Splatting

统一外观代码与双侧网格用于驾驶场景高斯点漂浮

Nan Wang, Yuantao Chen, Lixing Xiao, Weiqing Xiao, Bohan Li, Zhaoxi Chen, Chongjie Ye, Shaocong Xu, Saining Zhang, Ziyang Yan, Pierre Merriaux, Lei Lei, Tianfan Xue, Hao Zhao

机构 * BAAI(北京人工智能研究院) AIR, THU(清华大学人工智能研究院) SJTU(上海交通大学) EIT(Ningbo)(宁波工程学院) CUHK(香港大学) LeddarTech

AI总结 本文提出了一种多尺度双侧网格方法,统一了外观代码与双侧网格,提升了自动驾驶场景中的几何重建精度。

Comments Accepted to NeurIPS 2025 ; Project page: https://bigcileng.github.io/bilateral-driving ; Code: https://github.com/BigCiLeng/bilateral-driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15727 2026-01-14 cs.CL

VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models

VocalBench: 语音交互模型的语音对话能力基准测试

Heyang Liu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yiqi Li, Yixuan Hou, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 VocalBench通过24000个精心挑选的语音实例,评估语音交互模型在语义质量、语音性能、对话能力和鲁棒性方面的表现,揭示当前模型的共同挑战并推动下一代语音交互系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04948 2026-01-14 cs.CL cs.AI

KaLM: Knowledge-aligned Autoregressive Language Modeling via Dual-view Knowledge Graph Contrastive Learning

KaLM: 通过双视角知识图谱对比学习实现知识对齐的自回归语言模型

Peng Yu, Cheng Deng, Beiya Dai, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 KaLM通过双视角知识图谱对比学习和三元组完成语言模型,实现LLMs与知识图谱的对齐,提升知识驱动任务的性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-50906-6}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07821 2026-01-13 cs.RO cs.AI cs.LG

Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation

具有自恢复能力的失败感知强化学习:用于现实世界操控的可靠离线到在线强化学习

Huanyu Li, Kun Lei, Sheng Zang, Kaizhe Hu, Yongyuan Liang, Bo An, Xiaoli Li, Huazhe Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) IIIS, Tsinghua University(清华大学人工智能研究院) Nanyang Technological University(南洋理工大学) A*STAR Institute for Infocomm Research(新加坡科技动力研究院) University of Maryland(马里兰大学)

AI总结 本研究提出FARL框架,通过整合安全批评者和恢复策略,有效减少现实世界强化学习中的失败并提升性能。

Comments Project page: https://failure-aware-rl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07660 2026-01-13 cs.CV

StdGEN++: A Comprehensive System for Semantic-Decomposed 3D Character Generation

StdGEN++: 一种用于语义分解3D人物生成的综合性系统

Yuze He, Yanning Zhou, Wang Zhao, Jingwen Ye, Zhongkai Wu, Ran Yi, Yong-Jin Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tencent AIPD(腾讯AIPD) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 StdGEN++是一种基于双分支语义感知模型的综合性系统,通过语义分解和高效生成技术,实现高保真3D人物生成,适用于自动化角色资产生产。

Comments 13 pages, 12 figures. Extended version of CVPR 2025 paper arXiv:2411.05738

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07462 2026-01-13 cs.CV

From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution

从草图到壁画:高效的扩散变换器与渐进分辨率

Shikang Zheng, Guantao Chen, Lixuan He, Jiacheng Liu, Yuqi Lin, Chang Zou, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学)

AI总结 Fresco通过渐进式上采样统一重加噪和全局结构,实现高效扩散变换器的加速,适用于多种模型和领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07396 2026-01-13 cs.CV

Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Efficient Diffusion Transformers

预测主成分,稳定残差:面向高效扩散变换器的子空间感知特征缓存

Guantao Chen, Shikang Zheng, Yuqi Lin, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) South China University of Technology(华南理工大学) Jilin University(吉林大学)

AI总结 本文提出SVD-Cache方法,通过子空间感知的特征缓存技术提升扩散变换器的推理效率,实现近无损效果并支持多种加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07347 2026-01-13 cs.CL

DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models

DiffER: 用于扩散大语言模型中反转诅咒的扩散实体-关系建模

Shaokai He, Kaiwen Wei, Xinyi Zeng, Xiang Chen, Xue Yang, Zhenyang Li, Jiang Zhong, Yu Tian

机构 * Chongqing University(重庆大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hong Kong University of Science and Technology(香港理工大学)

AI总结 DiffER通过实体感知训练和平衡数据构建,解决扩散大语言模型中的反转诅咒问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07272 2026-01-13 cs.CV

PALUM: Part-based Attention Learning for Unified Motion Retargeting

PALUM:基于部分的注意力学习用于统一的运动重定向

Siqi Liu, Maoyu Wang, Bo Dai, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Feeling AI The University of Hong Kong(香港大学)

AI总结 PALUM通过语义身体部分划分和注意力机制,实现跨多样化骨骼结构的运动重定向,提升运动真实性和语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06966 2026-01-13 cs.CL cs.AI

RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction

RealMem: 在真实世界中评估大语言模型的内存驱动交互

Haonan Bian, Zhiyuan Yao, Sen Hu, Zishan Xu, Shaolei Zhang, Yifu Guo, Ziliang Yang, Xueran Han, Huacan Wang, Ronghao Chen

机构 * Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 RealMem是一个基于真实项目场景的基准,评估大语言模型在长期项目导向交互中的记忆管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04770 2026-01-13 cs.AI cs.DB

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

SciIF: 科学指令遵循基准测试以实现严谨的科学智能

Encheng Su, Jianyu Wu, Chen Tang, Lintao Wang, Pengze Li, Aoran Wang, Jinouwen Zhang, Yizhou Wang, Yuan Meng, Xinzhu Ma, Shixiang Tang, Houqiang Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Fudan University(复旦大学) Tsinghua University(清华大学) Beihang University(北航大学)

AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08870 2026-01-13 cs.LG cs.AI

Fed-SE: Federated Self-Evolution for Privacy-Constrained Multi-Environment LLM Agents

Fed-SE: 联邦自我进化用于隐私约束下的多环境大语言模型代理

Xiang Chen, Yuling Shi, Qizhen Lan, Yuchao Qiu, Min Wang, Xiaodong Gu, Yanfu Yan

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) UTHealth Houston(UT健康科学中心休斯顿分校) University of Pennsylvania(宾夕法尼亚大学)

AI总结 Fed-SE通过局部进化与全局聚合范式,在隐私约束下提升多环境大语言模型代理的跨环境知识转移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20031 2026-01-13 cs.RO cs.CV

MG-SLAM: Structure Gaussian Splatting SLAM with Manhattan World Hypothesis

MG-SLAM:基于曼哈顿世界假设的结构高斯点撒SLAM

Shuhong Liu, Tianchen Deng, Heng Zhou, Liuzhuozheng Li, Hongyu Wang, Danwei Wang, Mingrui Li

机构 * Department of Information Science and Technology and Department of Complexity Science and Engineering, The University of Tokyo(信息科学与技术系和复杂科学与工程系,东京大学) Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University(医疗机器人研究所和自动化系,上海交通大学) Department of Mechanical Engineering, Columbia University(机械工程系,哥伦比亚大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Department of Computer Science, Dalian University of Technology(计算机科学系,大连理工大学)

AI总结 MG-SLAM基于曼哈顿世界假设,通过融合线段和平面假设提升室内场景重建的几何精度和完整性,实现高斯SLAM的先进性能。

Comments IEEE Transactions on Automation Science and Engineering

Journal ref IEEE Transactions on Automation Science and Engineering 22 (2025) 17034-17049

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16108 2026-01-13 cs.CV

LaneSegNet: Map Learning with Lane Segment Perception for Autonomous Driving

LaneSegNet: 用于自动驾驶的基于车道段的地图学习

Tianyu Li, Peijin Jia, Bangjun Wang, Li Chen, Kun Jiang, Junchi Yan, Hongyang Li

机构 * Fudan University(复旦大学) OpenDriveLab(OpenDrive实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 LaneSegNet通过引入车道段表示,实现了端到端的地图学习,提升车道线检测、中心线感知和车道段感知的性能,达到每秒14.7次的实时推理速度。

Comments Accepted in ICLR 2024

Journal ref ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06843 2026-01-13 cs.CV cs.CL

Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models

边看边说:解锁多模态大语言模型的实时视频理解能力

Junyan Lin, Junlong Tong, Hao Wu, Jialiang Zhang, Jinming Liu, Xin Jin, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shanghai Jiao Tong University(上海交通大学) Ocean University of China(中国海洋大学)

AI总结 本文提出并行流式框架,通过三种设计解决多模态大语言模型在实时视频理解中的位置连续性约束问题,实现边看边说的实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06525 2026-01-13 cs.CV

Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios

迈向可泛化的去模糊化:利用大规模模糊先验与线性注意力以应对现实场景

Yuanting Gao, Shuo Cao, Xiaohui Li, Yuandong Pu, Yihao Liu, Kai Zhang

机构 * Tsinghua University(清华大学) USTC, Shanghai AI Lab(USTC,上海人工智能实验室) SJTU, Shanghai AI Lab(上海交通大学,上海人工智能实验室) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出BPP和MoSeG方法,通过大规模模糊先验与线性注意力提升图像去模糊化在现实场景中的泛化能力。

Comments 19 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06088 2026-01-13 q-fin.ST cs.LG

PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction

PriceSeer:实时股票预测中大型语言模型的评估

Bohan Liang, Zijian Chen, Qi Jia, Kaiwei Zhang, Kaiyuan Ji, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

AI总结 PriceSeer通过实时动态数据评估LLMs在股票预测中的性能,提供数据无污染的基准测试及六种先进模型的多时间范围预测分析。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06059 2026-01-13 cs.IT cs.AI math.IT

Context Video Semantic Transmission with Variable Length and Rate Coding over MIMO Channels

基于MIMO信道的上下文视频语义传输与可变长度和速率编码

Bingyan Xie, Yongpeng Wu, Wenjun Zhang, Derrick Wing Kwan Ng, Merouane Debbah

机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系) School of Electrical Engineering and Telecommunications, University of New South Wales(新南威尔士大学电气与电信学院) KU 6G Research Center, Khalifa University of Science and Technology(卡里玛科学技术大学KU 6G研究中心) CentraleSupelec, University Paris-Saclay(巴黎萨克雷大学CentraleSupelec)

AI总结 本文提出了一种基于MIMO信道的上下文视频语义传输框架,通过多参考熵编码和棋盘式特征调制策略实现可变长度和速率编码,提升无线视频传输的性能和部署灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24629 2026-01-13 eess.AS cs.SD

Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis

词级情感表达控制在零样本文本到语音合成中

Tianrui Wang, Haoyu Wang, Meng Ge, Cheng Gong, Chunyu Qiang, Ziyang Ma, Zikang Huang, Guanrou Yang, Xiaobao Wang, Eng Siong Chng, Xie Chen, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(天津认知计算与应用重点实验室,智能与计算学院,天津大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) TeleAI, China Telecom(TeleAI,中国电信) Kuaishou Technology(快手科技) Shanghai Jiao Tong University(上海交通大学) Huiyan Technology (Tianjin)(慧颜科技(天津)) Shenzhen Institute of Advanced Technology(深圳先进技术研究院)

AI总结 本文提出WeSCon框架,通过自我训练实现零样本文本到语音合成中词级情感与语速控制,克服数据稀缺问题,达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12704 2026-01-13 cs.CL cs.AI

Flexible Realignment of Language Models

语言模型的灵活重校准

Wenhong Zhu, Ruobing Xie, Weinan Zhang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

AI总结 本文提出灵活的重校准框架,通过训练和推理时的可控对齐方法,提升语言模型的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18992 2026-01-13 cs.CV

VPGS-SLAM: Voxel-based Progressive 3D Gaussian SLAM in Large-Scale Scenes

基于体素的渐进式3D高斯SLAM:用于大规模场景的VPGS-SLAM

Tianchen Deng, Wenhua Wu, Junjie He, Yue Pan, Shenghai Yuan, Danwei Wang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education(系统控制与信息处理重点实验室,教育部) Thrust of Robotics and Autonomous Systems, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统研究 thrust,香港科技大学(广州)) University of Bonn(波恩大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学)

AI总结 VPGS-SLAM提出了一种基于体素的渐进式3D高斯SLAM方法,适用于大规模室内外场景,通过多子地图实现紧凑准确的场景表示,并结合2D-3D融合跟踪和回环闭合方法提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21272 2026-01-12 cs.CV

Co-Training Vision Language Models for Remote Sensing Multi-task Learning

联合训练遥感多任务学习的视觉语言模型

Qingyun Li, Shuran Ma, Junwei Luo, Yi Yu, Yue Zhou, Fengxiang Wang, Xudong Lu, Xiaoxing Wang, Xin He, Yushi Chen, Xue Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) East China Normal University(东华大学) Wuhan University(武汉大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Chinese University of Hong Kong(香港中文大学)

AI总结 RSCoVLM通过联合训练视觉语言模型,提升遥感多任务学习的性能和灵活性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05580 2026-01-12 cs.CV

Generalizable and Adaptive Continual Learning Framework for AI-generated Image Detection

通用且自适应的持续学习框架用于AI生成图像检测

Hanyi Wang, Jun Lan, Yaoyu Kang, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang, Shilin Wang

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(电子信息与电气工程学院,上海交通大学) Antgroup(蚂蚁集团)

AI总结 本文提出了一种通用且自适应的持续学习框架,用于AI生成图像检测,通过三阶段方法提升模型泛化能力和适应性,实验显示在精度上优于现有方法。

Comments Accepted by TMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05546 2026-01-12 cs.CV

MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation

MoGen:一种用于可控多对象图像生成的统一协作框架

Yanfeng Li, Yue Sun, Keren Fu, Sio-Kei Im, Xiaoming Liu, Guangtao Zhai, Xiaohong Liu, Tao Tan

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院) College of Computer Science, Sichuan University(四川大学计算机学院) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 MoGen通过区域语义锚和自适应多模态引导模块,实现了对多对象图像生成的可控性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05034 2026-01-12 cs.AI

How to Set the Batch Size for Large-Scale Pre-training?

如何为大规模预训练设置批次大小?

Yunhua Zhou, Junhao Huang, Shuhao Xing, Yechen Zhang, Runyu Peng, Qiping Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai JiaoTong University(上海交通大学)

AI总结 本文提出动态批次大小调度器,通过修订E(S)关系,优化大规模预训练中的批次大小选择,提升训练效率和模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05241 2026-01-09 cs.CV cs.AI cs.RO

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05049 2026-01-09 cs.AI

How to Set the Learning Rate for Large-Scale Pre-training?

如何为大规模预训练设置学习率?

Yunhua Zhou, Shuhao Xing, Junhao Huang, Xipeng Qiu, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) Fudan University(复旦大学)

AI总结 本文提出两种范式(拟合与迁移)来解决大规模预训练中学习率设置问题,通过缩放定律和μ迁移扩展,挑战了现有方法的可扩展性并提供实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏