Unordered Landmark Visual Navigation
无序地标视觉导航
专题命中 视频多模态 :multimodal(abstract)
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
无序地标视觉导航
专题命中 视频多模态 :multimodal(abstract)
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
Loom:利用局部邻域和全局轨迹对空间转录组学进行多区域分析
专题命中 视频多模态 :multi-modal(abstract)
AI总结 Loom是用于空间转录组学分析的视觉计算系统,利用新颖图形符号和计算框架,应对多模态整合挑战,经案例研究和可用性研究评估,有效支持细胞转变及时空表达动态发现。
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; USI Lugano(卢加诺大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。
Comments 37 pages, 8 figures, 28 tables
M$^3$Prune: 多模态多智能体分层通信图剪枝用于高效多模态多智能体检索增强生成
机构 * East China Normal University(东华大学) ; Hefei University of Technology(合肥工业大学) ; China University of Petroleum(中国石油大学) ; Guangdong university of Finance & Economics(广东财经大学) ; Alibaba Group(阿里巴巴集团)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI
AI总结 M$^3$Prune通过分层通信图剪枝提升多模态多智能体检索增强生成的效率和性能。
Comments Critical flaw in Eq.(5)/Alg.1 (Sec 3.2): scoring fails Lipschitz continuity in multi-modal spaces, causing invalid hierarchy. Thus, latency/FLOPs in Tables 2&3 are overestimated & irreproducible. Core defect unfixable by minor update. Withdraw to avoid misleading; will revise theory & experiments
用于检索增强推理、物体感知与损伤分析的集成多模态AI系统
机构 * City College of New York(纽约城市学院) ; Air Force Research Lab(空军研究实验室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。
监督之前的感知:来自反事实盲区的自包含视觉蒸馏
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Aalto University(阿尔托大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。
Comments BMVC 2026
FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索
机构 * Vietnamese-German University(越南-德国大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology(信息技术大学) ; Ho Chi Minh city University of Science(胡志明市科学大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
月球地质学的可验证机器解释
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。
AquiLLM:支持研究群体中隐性知识捕获的架构
机构 * Southern Oregon University(南俄勒冈大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。
Comments Accepted for publication in the NGEN-AI 2026 proceedings
基于开放词汇概念发现的密集音乐检索控制
专题命中 跨模态检索 :multimodal(abstract);分类 eess.AS
AI总结 本研究提出一种轻量无需训练的开放词汇概念发现方法,用于可控音乐检索,可恢复与概念音频示例对齐更紧密的稀疏特征,实现更优的编辑强度与内容保留权衡。
Comments Accepted to ISMIR 2026
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; University of Adelaide(阿德莱德大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
Comments Accepted as a conference paper at ECCV 2024; v7: Minor corrections to the adversarial robustness results and corresponding text. Conclusions unchanged
融合UI结构与语义的面向特征的应用屏幕检索与聚类
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。
Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy
面向表达性与忠实性的音频到图像生成:一个统一的多模态数据集与合成框架
机构 * University of Science and Technology of China(中国科学技术大学) ; China Telecom (TeleAI)(中国电信(电信人工智能研究院)) ; Northwest Polytechnical University(西北工业大学)
专题命中 多模态生成 :multimodal(title);cross-modal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对音频到图像生成受限于传统数据集的问题,提出A2I-Set数据集与AudioCanvas模型,实现了更优的跨模态对齐与视觉表达性。
Comments 23 pages, 16 figures
FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Duke University(杜克大学)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.CL
AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。
Comments CoLM 2026
Aero Realtime:用于低延迟流式多模态生成的完全对齐输入输出流
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出4B参数流式多模态模型Aero Realtime,采用双工架构实现输入输出流完全对齐,通过时隙对齐等技术降低延迟,在4块NVIDIA A6000 GPU上验证了其低延迟多模态交互的可行性。
ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型
机构 * Pengcheng Laboratory(鹏城实验室) ; South China University of Technology(华南理工大学) ; Peking University(北京大学) ; Huazhong University of Science and Technology(华中科技大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 多模态生成 :cross-modal(title);分类 cs.CV
AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。
Comments 17 pages, 9 figures, 8 tables
Sci-VBench:面向科学领域知识与推理密集型视频生成的评估
机构 * Zhejiang University(浙江大学) ; UCAS(中国科学院大学) ; Tongji University(同济大学) ; Yale University(耶鲁大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。
Comments COLM 2026
ExpertVerse:知识密集型视觉合成中专家级推理的通用基准
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。
Comments 14 pages, 6 figures
LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学) ; Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。
下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) ; Southeast University(东南大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。
超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间
机构 * Macquarie University(麦考瑞大学) ; York University(约克大学) ; Northern Illinois University(北伊利诺伊大学) ; University of Technology Sydney(悉尼科技大学) ; North South University(北南大学) ; Lancaster University(兰卡斯特大学) ; Australian National University(澳大利亚国立大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。
Comments BMVC 2026
结合FaME-G2E的RAGMesh:长文本驱动的3D人脸生成与编辑
机构 * Beihang University(北京航空航天大学) ; Pengcheng Laboratory(鹏城实验室) ; Shanxi University of Finance and Economics(山西财经大学) ; North China University of Technology(北方工业大学) ; Cardiff University(卡迪夫大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 该研究构建了含文本-网格等标注的FaME-G2E数据集,提出RAGMesh框架,含MSRF模块与AdaRAGS约束,在3D人脸生成编辑任务上性能优于现有方法。
SI-Edit:面向草图-指令引导的像素级精度局部图像编辑
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) ; City University of Macau(澳门城市大学) ; Meitu Inc(美图公司)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。
Comments accepted by ACM MM 2026
LogiShot:逻辑连贯的跨镜头视频生成
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对跨镜头视频生成的内容脱节问题,提出LogiShot模型,通过联合编码与视觉记忆路径实现逻辑连贯,构建11万样本数据集及基准,性能优于现有方法。
UniPCB: 一种用于PCB缺陷检测的生成辅助检测框架
机构 * School of Information Engineering, Guangdong University of Technology(广东工业大学信息工程学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 提出UniPCB框架,通过多模态条件生成器合成缺陷样本以增强数据,并设计倒残差移位注意力与跨级互补融合模块提升检测性能,在DsPCBSD+上实现98.0% mAP@0.5。
MultiShadow: 基于扩散模型的多物体阴影生成用于图像合成
机构 * School of Information Technology, Murdoch University(信息科技学院,穆尔彻大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出基于扩散模型的多物体阴影生成方法,通过多模态特征融合和注意力对齐损失,实现多物体阴影的物理合理合成。
Comments This work is currently under consideration for publication
结构化参数环境下用于鲁棒导航策略的课程生成
机构 * Cornell University(康奈尔大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。
Comments 22 pages, 5 figures
利用生成模型辅助蒙特卡洛采样
专题命中 多模态生成 :multimodal(abstract)
AI总结 本教程综述介绍了机器学习与计算统计物理交叉领域的新范式——用生成模型辅助蒙特卡洛采样,探讨相关方法方向及优劣势,为相关领域研究者提供入门基础。
分布式量子计算架构的高效可扩展模块间交换
专题命中 多模态生成 :any-to-any(abstract)
AI总结 针对分布式量子计算模块间的高效可扩展交换需求,基于广义马赫-曾德尔干涉仪构建去中心化交换方案,实现主动光深度随逻辑块数对数缩放且不损失连通性。
Comments v2: an example showing asymptotic scaling of resources and active optical depth added