Geo-Align: Video Generation Alignment via Metric Geometry Reward
Geo-Align: 通过度量几何奖励实现视频生成对齐
机构 * USTC(中国科学技术大学) ; Shanghai AI Lab(上海人工智能实验室) ; ZJU(浙江大学)
AI总结 提出首个基于强化学习的框架Geo-Align,通过度量3D估计器提取相机轨迹并惩罚偏差,利用真实条件视频和合成目标轨迹消除配对数据依赖,提升相机控制精度和视觉保真度。
高校专区
Geo-Align: 通过度量几何奖励实现视频生成对齐
机构 * USTC(中国科学技术大学) ; Shanghai AI Lab(上海人工智能实验室) ; ZJU(浙江大学)
AI总结 提出首个基于强化学习的框架Geo-Align,通过度量3D估计器提取相机轨迹并惩罚偏差,利用真实条件视频和合成目标轨迹消除配对数据依赖,提升相机控制精度和视觉保真度。
元认知作为奖励:通过知识和调节信号强化LLM推理
机构 * Tongji University(同济大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; EPFL(苏黎世联邦理工学院) ; Wuhan University(武汉大学)
AI总结 提出元认知奖励(MaR)框架,利用元认知知识和调节信号作为过程奖励,提升LLM推理质量,在22个基准上平均提升7.7%。
从正确性到偏好:个性化智能体强化学习框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出PARPO框架,通过解耦通用任务奖励与个性化偏好奖励,结合偏好解耦奖励模型和偏好对齐技能演化图记忆,实现个性化智能体强化学习。
Comments 34 pages, 7 figures, Under Review
机器生成文本的隐藏类人本质:理论与检测增强
机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
AI总结 本文揭示了机器生成文本中隐藏的类人片段,理论分析其对检测的影响,并提出模型无关的堆叠增强框架,通过硬EM迭代过滤类人片段来提升检测性能。
Uni-Edit: 智能编辑作为统一模型调优的通用任务
机构 * CUHK MMLab(香港大学多模态实验室) ; Meituan(美团) ; TJU(天津大学) ; USTC(中国科学技术大学)
AI总结 提出将智能图像编辑作为统一多模态模型调优的通用任务,通过单一任务、单阶段训练和单一数据集同时提升图像理解、生成和编辑能力,并引入自动化数据合成流水线构建推理密集型指令数据集Uni-Edit-148k。
Comments Project Page: https://zhengdian1.github.io/Uni-Edit-proj/ Code: https://github.com/zhengdian1/Uni-Edit
WebGameBench: 通过浏览器原生游戏对编码代理进行需求到应用的评估
机构 * Baidu(百度) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出WebGameBench基准,通过将结构化Web游戏规范转化为可浏览器访问的游戏,评估编码代理从需求到应用交付的能力,并采用运行时评估器与人类审查对齐的可用性标签。
Comments 19 pages, 6 figures
HorizonDrive: 用于长时域驾驶仿真的自纠正自回归世界模型
机构 * Wuhan University(武汉大学) ; The University of Tokyo(东京大学) ; Horizon Robotics ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 针对自回归驾驶仿真中教师模型因自身预测漂移导致监督退化的问题,提出HorizonDrive框架,通过计划性滚转恢复(SRR)训练抗漂移教师模型,并利用教师滚转分布匹配蒸馏(TRD)实现长时域监督下的高效学生模型部署。
Comments Comments: 22 pages, 14 figures. Project page: https://zcliangyue.github.io/HorizonDrive Code: https://github.com/zcliangyue/HorizonDrive