LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing
LoomVideo: 统一多模态输入到视频生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。
高校专区
LoomVideo: 统一多模态输入到视频生成与编辑
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。
RealClawBench: 来自真实开发者-智能体会话的实时OpenClaw基准测试
机构 * Peking University(北京大学) ; Qiyuan Tech(启元科技)
AI总结 针对现有基准缺乏真实性的问题,提出RealClawBench框架,通过重构执行环境和确定性可验证评分器,将真实OpenClaw会话转化为可复现、自动评分的任务,评估14个模型后最佳仅解决65.8%任务,揭示了开发者-智能体工作负载上的巨大提升空间。
Comments 19 pages, 5 figures, 8 tables
利用群体回滚中的误差多样性进行强化学习
机构 * Peking University(北京大学) ; JD.COM(京东公司) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出EDAS方法,通过利用群体回滚中的误差多样性来提升强化学习的效果,通过调整错误回滚的优势信号,鼓励模型保持多样化的推理路径,从而提高训练成功率。
Comments Code available at https://github.com/EDAS-jd/EDAS
面向视觉原生多模态深度搜索智能体的在策略数据演化
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of Edinburgh(爱丁堡大学)
AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。
GraphWalker: 患者类比与信息增益结合用于大型语言模型的临床推理
机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) ; National Engineering Research Center for Software Engineering, Peking University, Beijing, China(软件工程国家工程研究中心,北京大学,北京,中国)
AI总结 提出GraphWalker框架,通过联合数据驱动和模型驱动视角、发现患者队列以及采用懒惰贪心搜索,从电子健康记录中检索患者案例进行类比推理,无需参数更新即可提升临床推理性能。
稳定推理,不稳定响应:通过稳定性不对称缓解大语言模型欺骗
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; School of Chinese as a Second Language, Peking University(北京大学第二语言学院)
AI总结 针对大语言模型内在欺骗问题,提出稳定性不对称正则化(SAR),通过惩罚内部思维链稳定性与外部响应稳定性之间的不对称性来抑制欺骗,实验证明其有效性且不损害模型能力。