Optimal Training-Time Scaling in Gradual Adaptation
渐进式适应中的最优训练时间缩放
机构 * Fudan University(复旦大学) ; Lawrence E. Elkins High School(劳伦斯·E·埃尔金斯高中)
AI总结 该研究针对过参数化线性回归任务,推导得出渐进式适应中最优单任务训练时间缩放为Θ(N⁻¹),实验验证了路径划分越精细应减少单任务训练的结论。
Comments 24 pages, 5 figures
高校专区
渐进式适应中的最优训练时间缩放
机构 * Fudan University(复旦大学) ; Lawrence E. Elkins High School(劳伦斯·E·埃尔金斯高中)
AI总结 该研究针对过参数化线性回归任务,推导得出渐进式适应中最优单任务训练时间缩放为Θ(N⁻¹),实验验证了路径划分越精细应减少单任务训练的结论。
Comments 24 pages, 5 figures
MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) ; The University of Adelaide(阿德莱德大学) ; Wuhan University(武汉大学) ; Southeast University(东南大学) ; Beijing Jiaotong University(北京交通大学) ; Fudan University(复旦大学) ; Li Auto(理想汽车) ; School of Information, Renmin University of China(中国人民大学信息学院)
AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。
OSReward:为跨平台计算机使用奖励模型建立标准化评估
机构 * The University of Hong Kong(香港大学) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学)
AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考
Comments Work in progress
深度研究代理能否检索和组织?通过专家分类法评估合成差距
机构 * Fudan University(复旦大学) ; Hunyuan Team, Tencent(腾讯 Hunyuan 团队)
AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。
SemiSAM-O1: 我们能将标注高效的医学图像分割边界推到多远?
机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University, Shanghai, China.(复旦大学人工智能创新与孵化院,上海,中国) ; Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院,上海,中国) ; Department of Radiotherapy, Tongji Hospital, School of Medicine, Tongji University, Shanghai, China.(同济大学附属同济医院放疗科,上海,中国) ; School of Information Science and Engineering, Lanzhou University, Lanzhou, China.(兰州大学信息科学与工程学院,兰州,中国) ; Department of Information and Intelligence Development, Zhongshan Hospital, Fudan University, Shanghai, China.(复旦大学中山医院信息与智能发展科,上海,中国)
AI总结 SemiSAM-O1通过仅使用一个标注模板图像,在极端一标签设置下实现高效分割,通过特征表示能力提升和迭代训练优化,显著缩小了半监督与全监督的性能差距并降低计算开销。
通过预言强化行动策略
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。