Douyin Multimodal Embedding Model Technical Report
抖音多模态嵌入模型技术报告
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
抖音多模态嵌入模型技术报告
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
TokenSwap:多模态大语言模型中模态差距的基准测试与缩减
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出TokenSwap方法构建基准TokenSwap-Bench,发现42个多模态大语言模型普遍存在模态差距,推理模型差距更小,训练中引入TokenSwap可有效缓解该差距。
CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹
机构 * Technical University of Munich(慕尼黑工业大学) ; Huawei Dresden Research Center(华为德累斯顿研究中心)
专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。
Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/
Mage-VL:一种高效的编解码器原生流式多模态基础模型
机构 * Microsoft(微软)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。
Comments Project page: https://microsoft.github.io/Mage
推理以规范:用于交通规则理解的思维链
机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) ; HKUST(GZ)(香港科技大学(广州)) ; Tencent T Lab(腾讯T实验室)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。
Comments Technical Report
VIPER:用于物理上合理的视频生成的视觉上下文物理推理
机构 * Zhejiang University(浙江大学) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。
Comments tech report
RS-RIE-Bench:推理引导的遥感图像编辑基准测试
机构 * Huawei(华为)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。
Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试
机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。
PreSIST:开放世界场景中视觉-语言信息的对象持久性预测
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; National Science Foundation(美国国家科学基金会) ; ARO(美国陆军研究办公室) ; Amazon(亚马逊公司) ; JP Morgan(摩根大通公司)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 研究长期部署机器人对环境变化的推理,提出PreSIST方法,通过对象属性和场景上下文估计实例级持久性先验,结合概率持久性过滤器预测对象未来姿态,有两种变体,实验表明优于基线。
Comments 8 pages, 6 figures, 3 tables
将交错多模态推理作为统一决策过程进行衔接
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Washington(华盛顿大学) ; The Chinese University of Hong Kong(香港中文大学) ; Australian National University(澳大利亚国立大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。
Comments 22 pages, 8 figures
ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维
机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。
Comments Accepted by ECCV 2026
SpaceEra++: 面向视频中3D空间推理的统一框架
机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) ; Shenzhen Loop Area Institute(深圳河套学院) ; School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; City University of Hong Kong(香港城市大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出SpaceEra++框架,通过ScenePick帧采样策略缓解输入不足,并利用SpaceAlign对齐绝对坐标与相对空间关系增强推理,在多个基准上超越强基线。
Comments Accepted by IEEE TPAMI 2026
Falcon: X射线中组合推理的功能组装与语言
机构 * Khalifa University(哈利法大学)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 针对X射线安检中威胁来自分散组件功能兼容性的问题,提出Falcon框架,通过结构化安全状态表示实现组合威胁推理,并构建Falcon-X基准验证其有效性。
Comments Accepted at ECCV2026; Project Page: https://yonathan-kiflom.github.io/FALCON/page/
EgoSAT: 一个全面的自我中心流式交互理解基准
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。
Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/
神经符号驱动:基于规则忠实推理的驾驶VLA
机构 * Texas A&M University(德克萨斯农工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学) ; University of California, Riverside(加利福尼亚大学河滨分校) ; University of Pittsburgh(匹兹堡大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。
WorldOlympiad:你的世界模型能经受铁人三项考验吗?
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; The Hong Kong University of Science and Technology(香港科技大学) ; Monash University(莫纳什大学) ; TRE, Alibaba Group(阿里巴巴TRE)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。
Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad
CFPO:用于多模态推理的反事实策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。
Comments Accepted to ICML 2026. 17 pages
FinAcumen: 通过自演化经验记忆实现的金融多模态推理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。
WeGenBench:面向文本到图像模型优化的多维诊断基准
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Dalian University of Technology(大连理工大学) ; Weixin, Tencent(腾讯微信)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。
IndustryBench-MIPU:面向工业产品的多图像属性值提取基准
机构 * Multimodal and Industrial AI Team(多模态与工业AI团队) ; Taobao&Tmall, Alibaba Group(淘宝&天猫,阿里巴巴集团)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出首个多图像工业产品理解基准IndustryBench-MIPU,通过结构化属性提取任务评估多模态大模型在规格表、铭牌、技术图纸上的文本识别、视觉推理、领域知识和跨图像证据整合能力,发现多图像完整性是核心瓶颈。
SGFormer++:用于增量式3D场景图生成的语义图Transformer
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出SGFormer++,通过图嵌入层和语义注入层实现全局消息传递,并引入空间引导特征适配器和级联二值预测头解决增量场景图生成中的灾难性遗忘问题,在3DSSG基准上达到最优性能。
GeoDial:面向几何问题求解的多模态对话式辅导数据集,包含可视化辅导轮次
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; Bocconi University(博科尼大学)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI
AI总结 提出GeoDial数据集,包含1300+几何师生对话,通过可扩展标注协议整合对话行为、视觉高亮和反馈,微调视觉语言模型发现其难以生成准确图解高亮。
Skill-3D:面向智能体3D空间推理的场景感知技能进化
机构 * Zhejiang University(浙江大学) ; University of Technology Sydney(技术悉尼大学) ; OPPO Research Institute(OPPO研究院)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出Skill-3D框架,通过场景记忆和技能库的协同进化,使智能体根据场景自适应选择工具,显著提升3D空间推理中工具使用的正确性和充分性。
SVoT: 基于强化学习的空间推理状态感知思维可视化
机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 提出SVoT框架,通过强化学习生成可验证的中间状态和可视化,结合文本与视觉推理链,提升多模态大模型在多跳空间推理中的可靠性。
TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV
AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。
Comments ICML2026
Struct-Searcher:代理式结构化思维推进多模态深度信息检索
机构 * CUHK(香港中文大学) ; LIGHTSPEED ; PKU(北京大学) ; Tongji University(同济大学) ; THU(清华大学) ; HKUST(香港科技大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出基于信念修正理论的结构化代理工作流Struct-Searcher,通过维护多模态结构图实现冲突感知的深度信息检索,在多个基准上平均相对准确率提升17.2%。
权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习
专题命中 视觉推理 :VLM(abstract,abstract_cn)
AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。
Comments 9 pages, 4 figures, and 3 tables
CADEngBench:它看起来像CAD,但真的能用吗?——参数化设计、装配推理与物理仿真的评估
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出CADEngBench双轨基准,从参数化设计、装配推理等维度评估8种多模态代码模型,发现编辑现有CAD更易,复杂编辑与匹配FEA仍难,装配预测存在缺陷,强调CAD评估需关注工程行为而非外观。
TRAM:利用轨迹衍生辅助记忆增强多模态推理
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract)
AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。
桥接语义与运动学:零样本机器人操作的模块化框架
机构 * Atlantic Technological University(大西洋理工大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn)
AI总结 提出一种模块化免训练框架,通过视觉感知、语义路由和任务编排三阶段,实现零样本语言引导的机器人操作,在两种零样本实验中达到62%端到端成功率。
Comments Accepted to RO-MAN 2026