EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks
EgoLive:一个大规模的第一人称视角数据集,源自现实世界的人类任务
机构 * Joy Future Academy, JD(京东探索研究院)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出EgoLive数据集,用于机器人操作学习,具有大规模、高质量、真实场景采集等优势,推动通用机器人模型突破和实际应用。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
EgoLive:一个大规模的第一人称视角数据集,源自现实世界的人类任务
机构 * Joy Future Academy, JD(京东探索研究院)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出EgoLive数据集,用于机器人操作学习,具有大规模、高质量、真实场景采集等优势,推动通用机器人模型突破和实际应用。
MERIT:基于网络基础推理的多模态虚假信息检测模块化框架
机构 * University of Rochester(罗切斯特大学)
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。
Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis
AutoGUI-v2:一个全面的多模态GUI功能理解基准
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; New Laboratory of Pattern Recognition(模式识别新实验室) ; State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) ; Hong Kong Institute of Science & Innovation(香港科学创新研究院) ; PolyU ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态Agent :multi-modal(title);分类 cs.CV
AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。
Comments Technical Report
SoccerRef-Agents: 多智能体系统用于自动足球裁判
机构 * University of Michigan(密歇根大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。
Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents
增强隐私保护的移动GUI代理:可用但不可见
机构 * Tsinghua University(清华大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。
Comments 15 pages, 4 figures
视觉-语言-动作安全性:威胁、挑战、评估与机制
机构 * National University of Singapore(新加坡国立大学) ; Monash University(墨尔本大学) ; Peking University(北京大学)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)
AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。
从静态到交互:通过自然语言实现交互式可视化
机构 * Nanyang Technological University(南洋理工大学) ; Ajou University(阿乔大学) ; Providence Health & Services(普罗维登斯健康与服务)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出Athanor方法,利用多模态大语言模型和自然语言指令将静态可视化转为交互式,通过三种创新设计提升用户交互体验。
EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层
专题命中 多模态Agent :multimodal(abstract)
AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。
通过几何参考的3D场景表示提升MLLM空间推理能力
机构 * Zillow Group(智域集团)
专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出几何参考3D场景表示GR3D,使MLLM能利用语言能力处理3D空间,无需额外训练,在空间推理基准中提升GPT-5性能9%和12%。
DRIFT:用于高效MLLM微调的推理先验转移
机构 * University of Rochester(罗切斯特大学) ; AMD
专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV
AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。
Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/
面向长视界代理多模态搜索
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 polled 智能学院) ; City University of Hong Kong(香港城市大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出LMM-Searcher框架,通过文件化视觉表示和定制化图像加载工具,解决长视界多模态搜索中的信息管理与成本问题,实验证明其在长视界基准测试中表现优异。
LinguDistill: 通过选择性跨模态蒸馏恢复视觉语言模型中的语言能力
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出LinguDistill方法,通过利用冻结的原始语言模型作为教师,选择性蒸馏语言信号以恢复语言能力,同时保持视觉基础,提升了语言和知识基准性能。
开放词汇语义分割网络:整合对象级标签与场景级语义特征用于多模态遥感图像
机构 * Faculty of Geosciences and Engineering, Southwest Jiaotong University, Chengdu 611756, China(西南交通大学地质工程学院,成都 611756,中国) ; State-Province Joint Engineering Laboratory of Spatial Information Technology for High-Speed Railway Safety, Southwest Jiaotong University, Chengdu 611756, China(高速铁路安全空间信息技术省部共建工程实验室,西南交通大学,成都 611756,中国) ; School of Artificial Intelligence, Wuhan University, Wuhan 430072, China(武汉大学人工智能学院,武汉 430072,中国) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, Wuhan 430072, China(武汉大学测绘遥感信息工程国家重点实验室,武汉 430072,中国)
专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出TSMNet,通过整合文本监督与视觉表示,实现开放词汇语义分割,利用双分支文本编码器提取场景级语义和对象级标签信息,提升遥感图像分割的准确性和可解释性。
基于文本引导的多模态统一工业异常检测
机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; School of Computing and Information Technology, Great Bay University(海湾大学计算机与信息学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出基于文本语义的多模态统一工业异常检测框架,解决跨模态对齐和几何建模不足问题,通过几何感知跨模态映射和对象条件文本特征适配器实现多模态特征对齐,实现跨类别的准确异常检测。
Comments 12 pages
大型视觉语言模型的结构和解耦适应用于多模态推荐
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出SDA框架,通过跨模态结构对齐和模态解耦适应,解决多模态推荐中表示不一致和梯度冲突问题,实验显示在三个Amazon数据集上提升了推荐性能。
Comments Accepted to SIGIR '26
通过多模态融合进行诱导愉悦的认知评估预测建模
机构 * Iran University of Science and Technology(伊朗科学技术大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一种多模态融合模型,通过认知评估变量预测视频诱导的愉悦,解决标签噪声、语义鸿沟、数据稀缺和解释性不足等问题,实验验证了模型在检测视频诱导愉悦方面的有效性。
多模态联邦学习中模态内缺失的条件补全
机构 * University of Central Florida(佛罗里达大学)
专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)
AI总结 本文提出CondI框架,通过条件扩散模型解决多模态联邦学习中的模态内缺失问题,采用两阶段训练流程提升模态特定提取器和联合嵌入空间的性能,实验表明在三个临床数据集上效果与现有方法相当。
Comments Wugeng Zheng and Ziwen Kan contributed equally to this work. Song Wang is the corresponding author. Accepted to FedVision 2026
神经康复中的学习健康系统作为多模态患者表示的基础
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出通过整合多模态数据采集、模型计算和临床可视化,构建神经康复中的学习健康系统,以促进临床与机器学习的合作,解决数据碎片化、互操作性差和临床人员参与度低的问题。
本地非网格天气预报与多模态地球观测数据
机构 * Massachusetts Institute of Technology(麻省理工学院) ; IBM Research(IBM研究院) ; Shell Information Technology International Inc.(壳牌信息技术国际公司)
专题命中 多模态训练与对齐 :multi-modal(title,abstract)
AI总结 本文提出一种多模态Transformer模型,通过端到端训练将网格化预报降尺度至非网格位置,提升局部天气预测精度,实验显示其优于多种非数据驱动和数据驱动的非网格预报方法。
CheXmix:用于医学影像的统一生成预训练
机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) ; Oracle Health AI(Oracle健康AI) ; Department of Radiology, Stanford University(斯坦福大学放射科)
专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。
Comments CVPR Findings (2026)
DriVerse:通过多模态轨迹提示和运动对齐实现驾驶模拟的导航世界模型
机构 * Baidu Inc.(百度公司)
专题命中 多模态训练与对齐 :multimodal(title)
AI总结 DriVerse通过多模态轨迹提示和运动对齐技术,实现从单张图像和未来轨迹生成导航驱动的驾驶场景,提升了动态对象的生成精度和时间一致性。
Comments 13 pages, 5 figures
Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型
机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。
量子与经典特征的互补性:面向乳腺癌分类的自适应混合量子-经典特征融合
机构 * Department of Computing, São Paulo State University(圣保罗州大学计算机系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种混合量子-经典架构,通过双分支特征提取管道融合经典模型和量子电路的互补表示,引入三种特征融合策略提升乳腺癌分类性能。
Comments 41 pages, 16 figures. This manuscript is a preprint under review at Artificial Intelligence in Medicine
基于影像表型和扰动转录组的干预感知多尺度表征学习
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种干预感知蒸馏框架,利用扰动转录组指导图像表征学习,通过基因表达和干预元数据生成化学感知的代码本,提升对未见干预的迁移能力及药物-靶点基因发现。
Comments CVPR 2026 main conference
RACANet:面向RGB-T人群计数的可靠性感知人群锚网络
机构 * School of Computer Science, China University of Geosciences, Wuhan(中国地质大学(武汉)计算机科学学院) ; School of Software, Tsinghua University(清华大学软件学院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出RACANet,通过两阶段融合框架解决RGB-T人群计数中跨模态融合的可靠性建模问题,引入轻量级预训练和局部锚点融合模块,提升计数精度与可解释性。
大型视觉语言模型的结构剪枝:对剪枝动态、恢复和数据效率的全面研究
机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) ; Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国) ; Helmholtz Munich, Germany(海德堡-慕尼黑赫尔姆霍尔茨研究中心,德国) ; University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) ; University of Trento, Italy(特伦托大学,意大利) ; Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 本文研究了通过结构化剪枝压缩现有大型视觉语言模型的方法,发现宽度剪枝在低资源环境下表现更优,结合监督微调和隐藏状态蒸馏可实现高效恢复,仅需5%的数据即可保持95%性能。
Comments Accepted at International Journal of Computer Vision (IJCV) 2026
SIMPLER: 基于H&E的结构光照明显微镜表示学习
机构 * Kahlert School of Computing, University of Utah, Salt Lake City, UT 84112, USA Scientific Computing \& Imaging Institute, University of Utah, Salt Lake City, UT 84112, USA Instapath Inc., Houston, TX 77021 Tulane University, Department of Biomedical Engineering, New Orleans, Louisiana, United States
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SIMPLER框架,利用H&E作为语义锚点学习可重用的SIM表示,通过对抗、对比和重建目标逐步对齐SIM和H&E,提升跨模态任务性能。
多视图协同学习与视觉-语言适应用于低资源生物医学图像分类
机构 * Chongqing University of Technology(重庆理工大学) ; Collge of Computer Science, Sichuan University(四川大学计算机学院) ; Hebei University of Technology(河北工业大学) ; Nanyang Technological University(南洋理工大学) ; Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(新加坡科技研究局前沿人工智能研究中心)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出多视图协同学习框架,通过视觉-语言适应提升低资源下生物医学图像分类性能,采用多粒度对比学习和结构监督增强跨模态对齐与细粒度区分。
混合JIT-CUDA图优化用于低延迟大语言模型推理
机构 * Department of Computer Science(计算机科学系) ; University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校) ; Milwaukee, WI, USA(美国威斯康星州密尔沃基)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 本文提出一种混合运行时框架,结合JIT编译与CUDA图执行,以降低启动开销并保持自回归解码的运行时灵活性,通过静态组件和动态组件的分离,有效减少短序列LLM推理的延迟和方差。
从不完美文本指导中学习:在高噪声标签下的鲁棒长尾视觉识别
机构 * CSSE, Shenzhen University(软件学院,深圳大学) ; SCST, Guangdong University of Technology(软件学院,广东技术大学) ; INFORMATICS, Xiamen University(信息学院,厦门大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出利用预训练视觉-语言模型的跨模态对齐能力,通过弱教师监督纠正长尾噪声数据中的标签-图像不一致问题,提升模型在高噪声环境下的识别性能。
Comments Accepted by CVM 2026