Factored Latent Action World Models
因子化潜在动作世界模型
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频生成 :video generation(abstract)
AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
因子化潜在动作世界模型
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频生成 :video generation(abstract)
AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。
视频深度伪造滥用:公司选择如何可预测地塑造滥用模式
专题命中 视频生成 :video generation(abstract)
AI总结 本文通过分析2025年视频生成模型,指出少数开放权重的模型成为生成逼真AIG-NCII视频的主要工具,并论证开发者与分发平台的责任,强调风险管理可显著影响未来滥用难度。
WorldString: 可行动态世界表征
机构 * CalTech(加州理工学院) ; UC San Diego(南加州大学) ; Tsinghua University - IEI Lab(清华大学-IEI实验室) ; NVIDIA(英伟达)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。
用于噪声和任务级流形学习的Transformer:近似和泛化见解
机构 * School of Mathematics, Georgia Institute of Technology(佐治亚理工学院数学系) ; Department of Mathematics, Purdue University(普渡大学数学系) ; Department of Mathematics and Halicioğlu Data Science Institute, University of California, San Diego(加州大学圣地亚哥分校数学系和Halicioğlu数据科学研究所)
专题命中 视频生成 :video generation(abstract)
AI总结 本文研究了Transformer在噪声和任务级流形上的学习性能,证明了其在低维结构中泛化能力与任务级流形的内在维度密切相关。
TeachMaster: 通过代码生成教学内容
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。
Comments Accepted to ACL 2026; https://www.teachmaster.cn/
UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言
机构 * XPENG Robotics(小鹏机器人) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
专题命中 视频生成 :video generation(abstract)
AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。
Comments Project page: https://xpeng-robotics.github.io/unit/
sumo3Dviz: 一种三维交通可视化
专题命中 视频生成 :video generation(abstract)
AI总结 sumo3Dviz提供轻量级开源3D可视化工具,用于SUMO交通模拟,支持外部视角和第一人称视角,优化批量视频生成,适用于大规模场景可视化和教育演示。
Raven: 通过视频基础评估重新思考Scratch程序的自动化评估
专题命中 视频生成 :video generation(abstract)
AI总结 Raven通过视频生成规则替代传统断言,实现Scratch程序的自动化评估,提升评估的一致性和可扩展性。
超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK(科大讯飞)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。
Sima 1.0:一种用于纪录片视频制作的协作多智能体框架
专题命中 视频生成 :video generation(abstract)
AI总结 Sima 1.0通过多智能体系统优化纪录片视频制作流程,将任务分解为11个步骤,利用人类操作基础创作和录制,AI代理处理编辑、字幕优化等任务,减少生产负担,提升制作效率。
抓取如梦:从生成的人类示范中模仿功能抓取
机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习系) ; Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of Science and Technology(南方科技大学深圳市机器人视觉与感知重点实验室)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出GraspDreamer方法,利用视觉生成模型合成的人类示范实现零样本功能抓取,通过隐含的通用先验知识和动作优化,提升数据效率和泛化能力。
DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) ; School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)
专题命中 视频生成 :video generation(abstract)
AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。
Comments authors update
协同AI代理与批评者用于网络遥测中的故障检测与原因分析
机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) ; SheQAI Research(SheQAI研究)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。
EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; DexForce Technology Co., Ltd.(DexForce技术有限公司)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。
Comments Project page: https://eva-project-page.github.io/
通过机器人中心视频合成实现形态一致的人形交互
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen University(深圳大学) ; University of Cambridge(剑桥大学)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出Dream2Act框架,通过生成视频合成实现零样本人形机器人交互,避免传统retargeting的形态差距问题,提升任务完成率。
DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器
机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) ; Toyota Research Institute(丰田研究院)
专题命中 视频生成 :video generation(abstract)
AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。
EMMA: 通过生成性视觉迁移实现现实世界机器人操作的泛化
专题命中 视频生成 :video generation(abstract)
AI总结 EMMA通过生成性视觉迁移框架提升机器人操作的泛化能力,结合生成数据引擎与高效训练流程,实现多视角一致性和几何精度的提升,实验证明其在零样本场景下的显著性能提升。
从表演者到创作者:理解退休女性对技术增强舞蹈表演的认知
专题命中 视频生成 :video generation(abstract)
AI总结 本文通过交互式舞蹈技术与AI生成内容,帮助退休女性克服年龄相关限制,提升舞台表现并成为表演共创者。
DreamToNav: 通过生成式视频规划实现通用机器人导航
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)
专题命中 视频生成 :video generation(abstract)
AI总结 DreamToNav通过生成式视频规划实现通用机器人导航,利用自然语言提示生成精确运动路径,实现目标导向的自主导航。
Comments Submitted to conference
从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 视频生成 :video generation(abstract)
AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。
Comments 11 pages, 6 figures
生成式AI与人类创作者:跨域市场中的采购机制设计
专题命中 视频生成 :video generation(abstract)
AI总结 本文研究了生成式AI与人类创作者在跨域市场中的采购机制设计,揭示了数据中介带来的影响及对社会福利的负面影响,提出需政府监管以优化数据生态系统。
双粒度对比奖励 via 生成 episodic 引导 为高效 embodied RL
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出DEG方法,通过生成episodic引导实现高效具身RL,无需人工标注,提升样本效率和任务完成能力。
HLA: Hadamard线性注意力
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 视频生成 :video generation(abstract)
AI总结 HLA通过在计算成对相似性后应用非线性,提高线性注意力对softmax的近似精度,无需张量重塑,适用于大规模视频生成任务。
说、梦、做:学习视频世界模型以驱动指令式机器人操作
机构 * Fudan University(复旦大学)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。
DexImit:从单目人类视频中学习双臂灵巧操作
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; NVIDIA(英伟达)
专题命中 视频生成 :video generation(abstract)
AI总结 DexImit通过四阶段生成流程,将单目人类视频转化为物理合理的机器人数据,以解决双臂灵巧操作的泛化问题。
Kahaani:一种多模态协同创作叙事系统
机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院) ; University of Michigan(密歇根大学) ; Strategize Labs(战略实验室)
专题命中 视频生成 :text-to-video(abstract)
AI总结 Kahaani通过多模态技术帮助儿童提升英语能力、学习生活教训并理解故事结构,采用协同创作方式提供沉浸式教育体验。
人工智能进展:面向创意产业的综述
机构 * Visual Information Laboratory, University of Bristol, Bristol, UK(布里斯托大学视觉信息实验室)
专题命中 视频生成 :video generation(abstract)
AI总结 本文综述了自2022年以来人工智能在创意产业中的进展,探讨了生成式AI、大语言模型和扩散模型等技术对创意生产流程的影响,并分析了人类与AI协作的新趋势及面临的挑战。
Comments This is an updated review of our previous paper (see https://doi.org/10.1007/s10462-021-10039-7), and has been accepted by Artificial Intelligence Review journal
OnePiece:一种基于RDMA的大型分布式推理系统,用于复杂AI生成内容(AIGC)工作流
专题命中 视频生成 :video generation(abstract)
AI总结 OnePiece通过RDMA优化和微服务分解,提升AIGC工作流的吞吐量和资源利用率,减少GPU资源消耗16倍。
Comments 12 pages
SketchDynamics: 探索自由形式草图用于动画生成中的动态意图表达
专题命中 视频生成 :video generation(abstract)
AI总结 SketchDynamics通过自由形式草图与AI交互,探索动态意图表达在动画生成中的应用,展示草图如何有效传达运动意图并指导视频生成。
Comments conditionally accepted by CHI'26
通过链接实体进行空间动态系统的潜在空间建模:LaM-SLidE
机构 * ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单位、LIT AI实验室、机器学习研究所、JKU林茨) ; Department of Engineering Physics and Computation, TUM(工程物理与计算系、技术大学慕尼黑) ; Emmi AI GmbH(Emmi AI公司) ; Clinical Research Institute for Medical AI, JKU Linz(医学人工智能临床研究所、JKU林茨)
专题命中 视频生成 :video generation(abstract)
AI总结 LaM-SLidE通过引入标识符表示,实现对空间动态系统潜在空间的建模,提升轨迹生成的效率与准确性。
Comments Project page: https://ml-jku.github.io/LaM-SLidE/