arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-17 至 2026-07-17 共收录 71 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2607.14682 2026-07-17 cs.AI cs.CL cs.LG 新提交 82%

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

停止思考,开始观察:通过无推理对齐实现多模态文档问答的高效训练后优化

Harikrishnan P M, Goutham Vignesh, Ganesh Parab, Saisubramaniam Gopalakrishnan, Vishal Vaddina, Varun V, Rohit Agrawal

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究多模态文档问答中高效训练后优化问题,提出感知 - RFT 框架,用组相对策略优化绕过推理令牌直接对齐视觉与基础输出,通过构建变体评估推理必要性,发现启用推理模型有优势,还识别基础差异,表明早期转换可减少训练数据并保持精度。

Comments Accepted at ICML 2026, Workshop on Efficient Multimodal Question Answering (EMM-QA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04043 2026-07-17 cs.CV 版本更新 79%

AnyStyle: Single-Pass Multimodal Stylization for 3D Gaussian Splatting

AnyStyle: 单次传递多模态风格化用于3D高斯点云

Joanna Kaleta, Bartosz Świrta, Kacper Kania, Tomasz Trzciński, Przemysław Spurek, Marek Kowalski

机构 * Warsaw University of Technology(华沙技术大学) Sano Centre for Computational Medicine(Sano计算医学中心) Jagiellonian University(雅盖隆大学) Microsoft(微软公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 AnyStyle通过多模态条件化实现姿态无关的零样本风格化,支持文本和视觉输入,提升3D重建的风格可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13976 2026-07-17 cs.CV 版本更新 70%

CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition

CF-Net:用于矛盾/犹豫识别的具有说话者归一化和确定性加权的冲突融合

Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对无约束视频中矛盾和犹豫检测的挑战,提出CF-Net,用特定主干编码多模态流,经归一化和冲突融合模块处理,结合多种训练方法,在相关数据集上取得了较好成绩。

Comments 6 pages, 3 figures, 3 tables, 26 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15220 2026-07-17 cs.CV 新提交 57%

Structural-Semantic Reciprocal Learning for Unsupervised Visible-Infrared Person Re-Identification

用于无监督可见光-红外行人重识别的结构-语义交互学习

Moyao Tian, Shijia Liu, Yan Yang, Xin Yuan, Minshi Chen, Wei Wang, Xiao Wang

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-Time Industrial System, Wuhan University of Science and Technology(武汉科技大学智能信息处理与实时工业系统湖北省重点实验室) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) China University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对无监督可见光-红外行人重识别的挑战,提出结构-语义交互学习框架SSRL。通过细粒度结构解耦和闭环语义校准机制,实现结构与语义学习的交互,有效过滤伪标签噪声,在相关数据集上表现优于现有方法。

Comments Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15054 2026-07-17 cs.CV 新提交 57%

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解

Xiao Lin, Xiaohu Huang, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13800 2026-07-17 eess.IV cs.CV 版本更新 57%

Prospective clinical indication, post-hoc report leakage, and fusion design in multi-image chest radiograph classification: a patient-clustered evaluation

多图像胸部X光片分类中的前瞻性临床指征、事后报告泄露和融合设计:患者聚类评估

Kamran Shahid, Muhammad Munwar Iqbal

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究多图像胸部X光片分类,用多种模型比较,含仅图像、仅指征等。评估不同模型在多指标下表现,发现前瞻性指征与报告目标关联大,排列感知融合有竞争力,事后报告文本存在问题,如造成报告标签循环等。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09118 2026-07-17 cs.CV 版本更新 57%

LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data

LPCAN:用于使用RGB-D数据进行铁路表面缺陷检测的轻量级金字塔交叉注意力网络

Jackie Alex, Guoqiang Huan

机构 * St. Petersburg College(斯波伯学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对铁路表面缺陷检测方法局限,提出LPCANet,利用RGB-D数据,集成MobileNetv2等模块,经多模态融合与结构分析提升性能。在多数据集上评估效果显著,消融研究验证关键模块作用,为工业缺陷检测提供实用框架,未来将聚焦模型压缩。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14842 2026-07-17 cs.RO 新提交 50%

KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking

KineFuse:用于手中遮挡物体姿态跟踪的运动感知触觉融合

Chanyoung Ahn, Jaesung Lee, Sungwoo Park, Donghyun Hwang

机构 * Center for Humanoid Research, KIST(韩国科学技术院人形机器人研究中心) Korea University(韩国大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 研究如何利用多手指手上的稀疏触觉信号补充预训练视觉姿态跟踪器以应对遮挡,提出运动感知手指级编码器,经多级别评估对比,验证其能提升跟踪成功率,在下游任务表现更好并提供真实世界演示。

Comments 8 pages, 10 figures. Accepted for presentation at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 3 篇

2606.28149 2026-07-17 cs.CV cs.AI 版本更新 73%

Toward Robust In-Context Segmentation via Concept Guidance

通过概念引导实现鲁棒的上下文分割

Zhigang Chen, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14769 2026-07-17 cs.CL cs.AI cs.MA 新提交 62%

Dialogue Summarization with Emotion Dynamics Using Topic- and Participant-Centric Decomposition

使用以主题和参与者为中心的分解方法进行具有情感动态的对话摘要

Linyun Xiang, Mark Neerincx, Stephanie Tan

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对对话摘要问题,提出基于改进分层智能体链方法的框架,从主题和参与者两个视角分解对话,结合自动推断情感生成摘要,并引入情感轨迹指标评估,实验表明其框架能生成含语义和情感内容的摘要,凸显方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01735 2026-07-17 astro-ph.EP astro-ph.GA astro-ph.IM astro-ph.SR 50%

KMT-2025-BLG-1314 and KMT-2025-BLG-1392: two microlensing planetary/brown-dwarf candidates analyzed with differentiable code

KMT-2025-BLG-1314和KMT-2025-BLG-1392:两种微透镜行星/褐矮星候选体的不同可微代码分析

Haibin Ren, Weicheng Zang, Wei Zhu, Yoon-Hyun Ryu, Yuchen Tang, Jiyuan Zhang, Michael D. Albrow, Sun-Ju Chung, Andrew Gould, Cheongho Han, Kyu-Ha Hwang, Youn Kil Jung, In-Gu Shin, Yossi Shvartzvald, Hongjing Yang, Jennifer C. Yee, Dong-Jin Kim, Chung-Uk Lee, Byeong-Gon Park, Yunyi Tang, Dan Maoz, Shude Mao, Qiyue Qian

专题命中 其他多模态 :multimodal(abstract)

AI总结 利用不同可微代码分析KMT-2025-BLG-1314和KMT-2025-BLG-1392两个微透镜事件,揭示行星/褐矮星候选体的退化问题,并展示HMC方法在双峰后验中的优越性。

Comments 20 pages, 7 figures, submitted to RAA

详情

展开后加载摘要…

URL PDF HTML 收藏