Contextual RNN-GANs for Abstract Reasoning Diagram Generation
专题命中 视频生成 :video generation(abstract);分类 cs.CV
Comments To Appear in AAAI-17 and NIPS Workshop on Adversarial Training
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(abstract);分类 cs.CV
Comments To Appear in AAAI-17 and NIPS Workshop on Adversarial Training
专题命中 视频生成 :long video(abstract);分类 cs.MM
解锁哈密顿视频动力学模型中的时间泛化
机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)
专题命中 视频生成 :video generation(abstract,comments)
AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。
Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition
时间相关视频桥匹配
机构 * Kandinsky Lab(Kandinsky实验室) ; Applied AI Institute(应用人工智能研究所) ; HSE University(高等经济大学)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出时间相关视频桥匹配框架,解决视频生成中时间相关序列建模问题,通过建模序列间依赖性和时间相关性,提升视频生成质量与重建精度。
计算教育中学生对AI生成教学视频的感知与偏好
专题命中 视频生成 :video generation(abstract)
AI总结 本研究通过对170名计算专业学生的调查,探究其对Knowlify生成的Markdown教学AI视频的感知与偏好,发现学生认可视频质量但对其课堂广泛采用存顾虑,明确了AI视频的适用场景与潜在问题。
LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型
专题命中 视频生成 :video generation(abstract)
AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。
从被动视频到可编辑体验:具身智能的物理基础体验合成
专题命中 视频生成 :video generation(abstract)
AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。
GenHOI: 通过模仿生成视频实现接触感知的人形机器人-物体交互,无需任务特定训练
机构 * The University of Tokyo(东京大学) ; National University of Singapore(新加坡国立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Tsinghua University(清华大学)
专题命中 视频生成 :video generation(abstract)
AI总结 提出GenHOI框架,通过模仿单个生成视频实现人形机器人零样本执行多种物体交互任务,无需任务特定训练或物理演示数据,利用接触事件和手-物接触区域编码为几何约束优化轨迹。
自回归生成中自我修正盲点的频谱起源
机构 * European University of Tirana(地拉那欧洲大学)
专题命中 视频生成 :video generation(abstract)
AI总结 研究大型自回归语言模型自我修正盲点问题,提出频谱代数理论SPARC,定义错误传播算子,推导激活阈值,证明基于强化学习的验证器-校正器训练收敛条件,实验验证定理,频谱预测与盲点率匹配。
通过多模态大语言模型对策略进行视觉检查实现开放式多智能体自动课程
机构 * Sapienza University of Rome(罗马第一大学) ; Sony AI(索尼人工智能)
专题命中 视频生成 :video language model(abstract)
AI总结 研究强化学习中开放式多智能体自动课程设计难题,提出通过策略视觉检查(VIP)利用视频语言模型处理视频并提供课程建议,经星际争霸多智能体挑战赛实证,显示该方法能生成更有效课程。
世界模型的定义与路线图
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(abstract)
AI总结 本文针对人工智能领域对世界模型定义、预测内容及构建方式缺乏共识的问题,给出科学定义,讨论关键技术,提供分阶段路线图,以助力有效世界模型的开发。
Comments Technical report, 58 pages, 10 figures
HCMS: 用于长序列并行注意力中通信-计算重叠的头分块多流流水线
专题命中 视频生成 :video generation(abstract)
AI总结 提出HCMS方法,通过将注意力头分块并利用双CUDA流实现细粒度通信-计算重叠,在长序列并行注意力中加速10%-17.5%。
Comments 11 pages, 4 figures, 17 tables
SimWorlds: 一个用于动态3D场景创建的多智能体系统
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 视频生成 :video generation(abstract)
AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。
Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io
对话式调查:逼真的具身对话代理如何影响回答质量、参与度和满意度
专题命中 视频生成 :video generation(abstract)
AI总结 研究提出一种集成AI驱动视频生成、语音识别和大语言模型的虚拟化身对话调查工具,实验表明具身代理能显著提升回答信息量和详细度,提高参与效率,但对满意度无显著影响。
SharQ:桥接激活稀疏性与FP4量化用于LLM推理
机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)
专题命中 视频生成 :video generation(abstract)
AI总结 提出SharQ方法,通过在线稀疏-稠密分解结合N:M稀疏性与FP4量化,无需训练即可恢复NVFP4与FP16之间43-63%的精度差距,并在RTX 5090上实现2.2-2.4倍延迟降低。
Comments 20 pages, 4 figures
导航用户行为以实现个性化多模态生成
机构 * South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 视频生成 :video generation(abstract)
AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。
Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen
监督幸存信息:基于几何引导的合成机器人视频VLA适配
机构 * Show Lab, National University of Singapore(新加坡国立大学 Show Lab)
专题命中 视频生成 :video generation(abstract)
AI总结 提出GRA方法,从合成视频中提取几何信息(2D末端执行器路径点)监督视觉表征,仅用真实演示训练动作头,在真实机器人任务中优于伪动作基线。
Comments 14 pages, 5 figures
信息论分类器自由引导与自适应调度优化
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of Rochester(罗彻斯特大学)
专题命中 视频生成 :video generation(abstract)
AI总结 针对扩散模型中分类器自由引导(CFG)导致的多样性-覆盖权衡问题,提出基于信息论的CFG调度优化框架,通过清洁端点参考优化实际分布,在ImageNet-512和COCO上实现竞争性权衡。
IOI: 解耦运动学与物理学的交互式世界模型
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; Peking University(北京大学)
专题命中 视频生成 :video generation(abstract)
AI总结 提出IOI混合交互式世界模型,通过显式运动学先验与学习物理动力学解耦,实现精确控制对齐和物理合理视觉反馈,在RoboTwin基准上达到最优仿真性能与零样本泛化。
DataMagic: 将表格数据转化为数据洞察视频
机构 * HKUST (GZ)(香港理工大学(珠海)) ; China Unicom(中国联合网络通信集团)
专题命中 视频生成 :video generation(abstract)
AI总结 提出DataMagic系统,通过声明式规范DVSpec和多智能体架构,将原始表格数据和自然语言查询转化为叙事性数据洞察视频,并支持交互式探索。
Comments 5 pages, 3 figures, accepted at VLDB 2026
代理世界建模:基础、能力、定律及更远
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Chinese University of Hong Kong(香港中文大学) ; University of Hong Kong(香港大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院) ; XGEN Labs(XGEN实验室)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。
GRAIL: 从3D资产和视频先验生成人形机器人全身操作
机构 * NVIDIA ; UCLA(加州大学洛杉矶分校)
专题命中 视频生成 :video generation(abstract)
AI总结 提出GRAIL全虚拟生成管线,利用3D资产和视频基础模型先验合成人机交互演示,无需物理搭建或遥操作,实现人形机器人全身操作策略的模拟到现实迁移。
Comments Project page: https://research.nvidia.com/labs/dair/grail/
GeoSem-WAM:几何与语义感知的世界动作模型
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKU(香港大学) ; USTC(中国科学技术大学) ; SDU(山东大学) ; X-Humaniod
专题命中 视频生成 :video generation(abstract)
AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。
世界模型:架构、方法论、推理范式与应用的全面综述
机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) ; School of Computing, University of Georgia(佐治亚大学计算机学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) ; Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) ; Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) ; Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) ; School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) ; Tandon School of Engineering, New York University(纽约大学泰坦工程学院) ; Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) ; Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) ; Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。
以人类演示视频为提示学习可泛化的机器人策略
机构 * Tsinghua University, China(清华大学,中国) ; Shanghai Qi Zhi Institute, China(上海启智研究院,中国)
专题命中 视频生成 :video generation(abstract)
AI总结 提出两阶段框架,利用人类演示视频学习可泛化机器人策略,无需遥操作数据或微调即可执行新任务。
Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA), 2026
通过解耦影响函数优化多维视频奖励模型
机构 * The University of Tokyo(东京大学) ; HKUST (Guangzhou)(香港科技大学(广州))
专题命中 视频生成 :text-to-video(abstract)
AI总结 针对文本到视频生成任务中训练样本在不同评估维度上可靠性不一致的问题,提出解耦影响框架以估计维度特定监督风险,并设计维度解耦剪枝与重加权策略,显著提升多维视频奖励模型与真实标注的对齐效果。
GE-Sim 2.0:迈向机器人操作综合闭环视频世界模拟器的路线图
机构 * AgiBot ; BUAA(北京航空航天大学) ; LV-NUS Lab(国立大学理工学院实验室) ; TJU(天津大学)
专题命中 视频生成 :video generation(abstract)
AI总结 提出GE-Sim 2.0,一种基于动作条件视频生成的闭环视频世界模拟器,通过重新训练数千小时真实机器人数据并新增状态专家、世界裁判和加速框架三个模块,实现高保真动作跟随和轨迹覆盖,在WorldArena排行榜上以2B参数超越专用模型和通用视频生成器,并验证了基于其生成轨迹和奖励训练的策略在真实世界中的有效性。
因子化潜在动作世界模型
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频生成 :video generation(abstract)
AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。
视频深度伪造滥用:公司选择如何可预测地塑造滥用模式
专题命中 视频生成 :video generation(abstract)
AI总结 本文通过分析2025年视频生成模型,指出少数开放权重的模型成为生成逼真AIG-NCII视频的主要工具,并论证开发者与分发平台的责任,强调风险管理可显著影响未来滥用难度。
WorldString: 可行动态世界表征
机构 * CalTech(加州理工学院) ; UC San Diego(南加州大学) ; Tsinghua University - IEI Lab(清华大学-IEI实验室) ; NVIDIA(英伟达)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。