arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-28 至 2026-07-28 共收录 38 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2507.05515 2026-07-28 cs.AI cs.CL cs.CV 版本更新 82%

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei

机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic Centrum Wiskunde \& Informatic Leiden University University College London Vrije University of Amsterdam Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University Vrije University of Amsterdam Centrum Wiskunde \& Informatic

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。

Comments This version has been accepted by ICMI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19060 2026-07-28 cs.CV cs.LG 版本更新 74%

Shift-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment

用于微调CLIP的移位感知校准:利用图像-文本对齐

Song-Lin Lv, Yu-Yang Chen, Zhi Zhou, Lan-Zhe Guo

专题命中 图文多模态 :image-text(title);分类 cs.CV

AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03316 2026-07-28 cs.CV 版本更新 70%

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

当汇点帮助或伤害:面向大视觉-语言模型的注意力汇点统一框架

Jiho Choi, Jaemin Kim, Sanghwan Kim, Seunghoon Hong, Jin-Hwi Park

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学) Technical University of Munich(慕尼黑工业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文研究了大视觉-语言模型中注意力汇点的影响,提出统一框架分析其作为冗余 artifacts 或全局先验的作用,并通过 Layer-wise Sink Gating 模块平衡全局推理与局部证据。

Comments Acknowledgments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31513 2026-07-28 cs.CV 版本更新 57%

Personalize Your Large Vision-language Models With In-context Prompt Tuning

用上下文提示调优个性化你的大型视觉语言模型

Yanshu Li, Jiaqian Li, Kuai Yu, Xi Xiao, Dongfang Liu, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Purdue University(普渡大学) Rutgers University(罗格斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。

Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25629 2026-07-28 cs.CV cs.LG 版本更新 57%

LanteRn: Latent Visual Structured Reasoning

LanteRn:潜在视觉结构推理

André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins

机构 * Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LanteRn框架,通过将语言与紧凑的潜在视觉表示结合,使大多模态模型能在潜在空间中进行视觉推理,提升视觉理解和细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2602.03570 2026-07-28 cs.LG 版本更新 88%

Asymmetric Hierarchical Anchoring for Robust Audio-Visual Cross-Modal Generalization

非对称层次锚定用于音频-视觉联合表示:解决信息分配模糊性以实现鲁棒跨模态泛化

Bixing Wu, Yuhong Zhao, Zongli Ye, Jiachen Lian, Xiangyu Yue, Gopala Anumanchipalli

机构 * Zhejiang University, China(浙江大学) University of California, Berkeley, USA(加州大学伯克利分校) MMLab, Chinese University of Hong Kong, China(香港中文大学MMLab)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract)

AI总结 本文提出非对称层次锚定框架,通过结构化语义锚点解决跨模态泛化中的信息分配模糊性,提升语义一致性和表示纯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04498 2026-07-28 cs.CV cs.SD 版本更新 85%

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20541 2026-07-28 cs.CL cs.CY 版本更新 57%

SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes

SAFE-MEME:用于表情包中鲁棒性仇恨言论检测的结构化推理框架

Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究表情包中仇恨言论检测难题,提出SAFE-MEME框架及其两个变体,通过构建新型数据集进行基准测试,实验表明SAFE-MEME-QA和SAFE-MEME-H能有效检测仇恨言论,且不同方法在常规和混淆场景各有优势,还分析了错误案例。

Comments 44 pages, 27 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2506.03168 2026-07-28 cs.CV cs.LG 版本更新 83%

Farm-LightSeek: An Edge-centric Multimodal Agricultural IoT Data Analytics Framework with Lightweight LLMs

Farm-LightSeek:一种以边缘为中心的多模态农业物联网数据分析框架,集成轻量级语言模型

Dawen Jiang, Zhishu Shen, Qiushi Zheng, Tiehua Zhang, Wei Xiang, Jiong Jin

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Engineering, Swinburne University of Technology(斯威本科技大学工程学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Computing, Engineering and Mathematical Sciences, La Trobe University(拉筹伯大学计算、工程与数学科学学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对智能农业面临的挑战,提出Farm-LightSeek框架,将大语言模型与边缘计算集成。通过传感器收集多源数据,在边缘节点进行跨模态推理等。创新包括闭环架构等,实验表明该框架在关键任务中性能可靠,推动了智能实时农业及两者深度集成。

Comments Accepted by IEEE Internet of Things Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18080 2026-07-28 cs.CV cs.AI 版本更新 81%

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

稀疏证据就足够了:用于多模态视频错误信息检测的智能证据搜索

Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态视频错误信息检测,提出SIEVE框架,通过智能体探索多模态证据构建证据包,由验证器判断真实性。智能体经特殊训练,实验表明该框架性能优于基线,能提供可检查证据线索,提升检测透明度与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15505 2026-07-28 cs.IR 版本更新 78%

Binge Watch: Reproducible Multimodal Benchmarks Datasets for Large-Scale Movie Recommendation on MovieLens-10M and 20M

binge观看:用于大规模电影推荐的可重复多模态基准数据集,基于MovieLens-10M和20M

Giuseppe Spillo, Alessandro Petruzzelli, Cataldo Musto, Marco de Gemmis, Pasquale Lops, Giovanni Semeraro

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文发布M3L-10M和M3L-20M两个大规模多模态数据集,通过丰富MovieLens-10M和20M数据集,为大规模电影推荐提供可重复的基准数据。

Comments Accepted at RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03753 2026-07-28 cs.HC 版本更新 67%

VisTR: Visualizations as Representations for Time-series Table Reasoning

VisTR:将可视化作为时间序列表推理的表示

Jianing Hao, Zhuowen Liang, Chunting Li, Yuyu Luo, Jie Li, Wei Zeng

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 针对时间序列表推理难题,VisTR框架以可视化核心,利用其连接数据与认知,通过多模态大语言模型对齐输入,集成机制处理大数据,实现交互式可视化,经评估和案例验证了其在时间序列推理任务中的有效性和适用性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08757 2026-07-28 cs.RO 版本更新 50%

A Visuo-Tactile Data Collection System with Haptic Feedback for Coarse-to-Fine Imitation Learning

一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习

Yeseung Kim, Nayoung Oh, Jun Park, Teetat Thamronglak, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 3 篇

2603.05607 2026-07-28 cs.CV cs.AI 版本更新 81%

DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces

DreamCAD: 通过可微参数曲面实现多模态CAD生成的扩展

Mohammad Sadil Khan, Muhammad Usama, Rolandos Alexandros Potamias, Didier Stricker, Muhammad Zeshan Afzal, Jiankang Deng, Ismail Elezi

机构 * DFKI RPTU Imperial College London(帝国理工学院伦敦分校) Huawei London Research Center(华为伦敦研究中心)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 DreamCAD通过可微参数曲面直接生成可编辑的BRep,无需CAD特定注释,实现多模态CAD生成的扩展,并在多个基准测试中取得最佳性能。

Comments For Caption Dataset: https://huggingface.co/datasets/SadilKhan/CADCap-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-07-28 cs.CV cs.AI 版本更新 62%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05382 2026-07-28 cs.CV cs.AI 版本更新 62%

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

超越可教内容的搜索:拓展智能体视觉生成的知识边界

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Waterloo(滑铁卢大学) Qwen Applications(通义千问应用) Imperial College London(帝国理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉生成器的世界知识瓶颈,构建专用数据集与基准,提出教-搜协同训练框架定位动态知识边界,实现知识驱动的可迭代视觉生成性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 10 篇

2604.07263 2026-07-28 cs.HC cs.CV cs.MM 版本更新 81%

BATON: A Multimodal Benchmark for Bidirectional Automation Transition Observation in Naturalistic Driving

BATON:一种多模态基准,用于自然驾驶中的双向自动化过渡观察

Yuhang Wang, Yiyao Xu, Chaoyun Yang, Lingyao Li, Jingran Sun, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 BATON通过多模态数据捕捉真实驾驶自动化场景,定义了驾驶动作理解、手柄预测和接管预测三个任务,证明多模态数据融合对提升自动化过渡预测的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02570 2026-07-28 eess.SP cs.AI 版本更新 79%

DOSE-I: A Multimodal Biosignal Dataset of Procedural Sedation for Endoscopy -- Technical Report

DOSE-I:用于内镜操作镇静的多模态生理信号数据集——技术报告

Jakob Garbe, Jan W. Kantelhardt, Katja Seeliger, Thomas Schmid

机构 * Universitätsmedizin Halle (Saale)(哈勒(萨勒)大学医学院) Universitätsklinikum Halle (Saale)(哈勒(萨勒)大学医院) Universitätsklinik und Poliklinik für Innere Medizin I(内科学I大学医院和多科医院) Martin‑Luther‑Universität Halle‑Wittenberg(哈勒-维滕贝格马尔伯特大学) Medizinische Fakultät(医学系) Ernst‑Grube‑Straße 40(埃尔斯特-格鲁布街40号)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文介绍内镜镇静多模态生理信号数据集DOSE-I的构建细节,提供标注数据、预处理方案与开源代码,支撑相关医疗AI研究。

Comments Dataset can be accessed via zenodo DOI https://doi.org/10.5281/zenodo.18483292 For citation use the primary academic reference: Garbe J et al. Towards predicting sedation depth in endoscopy with large clinically annotated EEG data of continuous Propofol sedation. In: P. Andreevetal (Eds.): AIME2026, LNAI 16749, p.1-6, Springer, 2026. https://doi.org/10.1007/978-3-032-30813-9_58

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05080 2026-07-28 q-fin.TR 版本更新 78%

MM-ARC: Multimodal Adaptive Routing of Capital with Robustness-Audited Strategy Pools

MM-ARC:具有稳健性审核策略池的资本多模态自适应路由

Yang Chen, Yuchen Cao, Jacky Keung, Leilei Gan, Kun Kuang, Yueheng Jiang, Zhaozhao Ma, Jianping Zhu, Fei Wu, Jinpeng Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究金融交易系统如何转化多模态市场历史,提出MM-ARC方法,通过多视图在不同专家间分配资本,经稳健性审核筛选候选方案,实验显示该方法在夏普比率和最大回撤等指标上优于基线,有相对基准的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22135 2026-07-28 cs.CV 版本更新 74%

GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels

GLI-AL:一个具有统一解剖-病变标签的多模态胶质瘤MRI标签资源

Xingyu Xiang, Shuang Hao, Fan Wang, Jianhua Ma, Chunfeng Lian

机构 * Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi’an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi’an Jiaotong University(西安交通大学智能医疗设备与器械研究中心)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 研究针对现有BraTS-GLI数据集不足,引入BraTS-GLI Anatomy-Lesion资源,提供统一解剖-病变标签集及元数据。通过WMH感知监督,提升对共存病变敏感性,保持健康组织分割性能,支持多方面研究,数据和代码可获取。

Comments Minor revision: Figure 1 was repositioned. The scientific content remains unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25897 2026-07-28 cs.RO cs.LG cs.SY eess.SY 版本更新 71%

Variational Neural Belief Parameterizations for Robust Dexterous Grasping under Multimodal Uncertainty

变分神经信念参数化用于多模态不确定性下的鲁棒灵巧抓取

Clinton Enwerem, Shreya Kalyanaraman, John S. Baras, Calin Belta

机构 * Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA(电气与计算机工程系和系统研究所,马里兰大学,College Park, MD, USA) Maryland Applied Graduate Engineering, A. James Clark School of Engineering, University of Maryland, College Park, MD, USA(马里兰应用研究生工程学院,A. James Clark工程学院,马里兰大学,College Park, MD, USA)

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出变分推理方法,通过可微高斯混合模型表示信念,利用Gumbel-Softmax和位置-尺度重参数化实现平滑采样,提升抓取鲁棒性并减少规划时间。

Comments 11 pages, 10 figures. Accepted for publication at IROS 2026. Code, simulation assets, and dataset at https://github.com/coenwerem/vnb-grasp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08728 2026-07-28 cs.AI cs.CL cs.CV cs.LG 版本更新 67%

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。

Comments Under review, 47 pages, 14 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 62%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 62%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24118 2026-07-28 cs.CV 版本更新 57%

An LMM for Precisely Grounding Elements in Documents

一种用于精确文档元素定位的大型多模态模型

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Ji Qi, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PreciseDoc,一种通过合成数据与强化学习联合训练实现文档元素精确定位的大型多模态模型,显著提升文档理解与视觉定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02929 2026-07-28 cs.IR cs.AI cs.LG 版本更新 57%

Realizing Scaling Laws in Recommender Systems: A Foundation-Expert Paradigm for Hyperscale Model Deployment

在推荐系统中实现扩展定律:超大规模模型部署的基础-专家范式

Dai Li, Kevin Course, Wei Li, Hongwei Li, Jie Hua, Yiqi Chen, Zhao Zhu, Rui Jian, Xuan Cao, Bi Xue, Yu Shi, Jing Qian, Kai Ren, Matt Ma, Qunshu Zhang, Rui Li

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 针对推荐系统中跨多界面部署基础模型的挑战,提出基础-专家范式,中央FM生成目标感知嵌入供特定界面专家模型使用,迁移率超现有方法,自2025年在Meta部署后实现线上指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态Agent 3 篇

2607.21013 2026-07-28 cs.AI cs.CV 版本更新 84%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05147 2026-07-28 cs.CV cs.RO 版本更新 57%

Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models

行动、思考或退缩:面向视觉-语言-动作模型的复杂度感知自适应推理

Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种复杂度感知的自适应推理框架,通过动态路由视觉-语言-动作模型的执行,提升任务复杂性检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10397 2026-07-28 cs.IR 版本更新 50%

RecoWorld: Building Simulated Environments for Agentic Recommender Systems

RecoWorld:为代理推荐系统构建模拟环境

Fei Liu, Xinyu Lin, Hanchao Yu, Mingyuan Wu, Jianyu Wang, Qiang Zhang, Zhuokai Zhao, Yinglong Xia, Yao Zhang, Weiwei Li, Mingze Gao, Qifan Wang, Lizhu Zhang, Benyu Zhang, Xiangjun Fan

专题命中 多模态Agent :multimodal(abstract)

AI总结 RecoWorld通过双视角架构和多轮强化学习,构建了代理推荐系统的模拟环境,旨在提升用户留存和参与度。

Comments HCRS @ WWW 2026, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 8 篇

2607.06882 2026-07-28 cs.RO cs.AI 版本更新 83%

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

GemNav:使用多模态大语言模型的离散令牌视觉机器人导航

Peter Bohm, Saimunur Rahman, Abdelwahed Khamis, Sagun Man Singh Shrestha, Chris McCool, Peyman Moghadam

机构 * CSIRO Technology(联邦科学与工业研究组织)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究探索基于大型预训练模型的视觉机器人导航策略新方法,提出GemNav,仅对语言塔用LoRA适配冻结的多模态大语言模型用于中短程航点导航,无辅助视觉编码器等,在小语料库上零样本转移到未见环境,提供了数据高效、可部署的导航替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏