arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 502 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 502 篇

2606.10166 2026-06-10 cs.CV 新提交 57%

Fusing Satellite Imagery and Planimetric Maps for Cross-View Localization

融合卫星图像与平面地图的跨视角定位

Quang Long Ho Ngo, Zimin Xia, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑校区)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种融合卫星图像与平面地图的模块,通过跨模态条件化和补丁级融合规则,将定位误差降低30.13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09605 2026-06-09 cs.AI 新提交 57%

Next-Token Prediction Learns Generalisable Representations of Sleep Physiology

下一个词预测学习睡眠生理学的可泛化表示

Jonathan F. Carter, Lionel Tarassenko

机构 * Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 提出Hypnos模型,通过下一个词预测目标,从多模态生理信号中学习可泛化表示,在睡眠阶段分类和房颤检测等任务上显著优于现有基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09585 2026-06-09 cs.AI 新提交 57%

Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text

光学推理:重新思考图像作为超越文本的表达性推理媒介

Yutong Bian, Dongjie Cheng, Heming Xia, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出光学推理概念,将图像作为独立推理媒介,通过排版和图形两种变体实现,在语言和多模态任务中匹配或超越文本推理,同时减少推理令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 57%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08708 2026-06-09 cs.CV 新提交 57%

PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping

PRPO: 通过令牌级动态优势重塑的感知强化策略优化

Qiming Li, Tianlun Li, Xiaolong Cheng, Hangyu Li, Ruiyan Gong, Kangning Niu, Kaitao Jiang, Mu Xu

机构 * Amap CV Lab, Alibaba Group(阿里巴巴集团高德地图计算机视觉实验室) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出令牌级强化学习框架PRPO,通过鲁棒视觉依赖(RVD)指标识别关键感知令牌,并利用感知优势重塑(PAR)技术增强其学习信号,在7个多模态推理基准上平均提升23.3%(3B模型)和21.1%(7B模型)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08634 2026-06-09 cs.CV 新提交 57%

SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders

SSAFE: 通过冻结视觉编码器实现简单而强大的AI生成图像检测

Seunghyun Lee, Byoungkwon Kim, Jaehyun Nam, Kyungmin Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Google Cloud AI(谷歌云AI)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文发现冻结的多模态视觉编码器在嵌入空间中自然分离真实与合成图像,通过线性分类器即可实现强检测性能,并提出一种表示感知的数据策展策略,仅用10K图像训练,在多个基准上表现优异。

Comments Preprint. 22 pages, 10 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08602 2026-06-09 cs.LG cs.AI 新提交 57%

Reinforcement Learning for Flow-Matching Policies with Density Transport

基于密度传输的流匹配策略强化学习

Boshu Lei, Kostas Daniilidis, Antonio Loquercio

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出在线强化学习算法RLDT,利用Stein变分梯度下降构建传输场,微调预训练流匹配策略,通过期望目标估计稳定训练,在连续控制任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06534 2026-06-08 eess.IV cs.AI 新提交 57%

Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models

基于视觉基础模型的注意力一致纵向医学视觉问答

Jialin Wu, Qianru Zhang, Georges El Fakhri, Xiaofeng Liu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。

Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06498 2026-06-08 cs.GR cs.CV 新提交 57%

Semantic-Structural Alignment for Generative Pictorial Charts

生成式图形图表的语义-结构对齐

Zhida Sun, Yulin Zhang, Zheng Gu, Min Lu, Bongshin Lee, Daniel Cohen-Or, Hui Huang

机构 * Visual Computing Research Center (VCC), College of Computer Science and Software Engineering (CSSE) Shenzhen University China(视觉计算研究中心(VCC)、计算机科学与软件工程学院(CSSE)深圳大学中国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出一种生成式框架,通过多模态扩散变压器中的结构对齐和语义对齐机制,实现兼具艺术表现力和结构保真度的图形图表自动合成。

Comments 11 pages, 17 figures, Accepted to ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22271 2026-07-27 cond-mat.mtrl-sci 新提交 56%

SAGE-Net: Semantics-Augmented Geometric Encoder for Material Property Prediction

SAGE-Net:用于材料属性预测的语义增强几何编码器

Guanghui Zhang, Yuxuan Yao, Kieran B. Spooner, Jun Yin, Dan Han, David O. Scanlon, Lijun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(comments)

AI总结 研究针对材料属性预测,提出语义增强几何编码器网络SAGE-Net,通过语义引导消息传递将晶体学语义注入几何消息传递,在多基准测试中表现出色,能有效捕捉晶体学特征,是深度集成多模态材料学习的通用可转移框架。

Comments 29 pages, 5 figures, multi-modal network

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13911 2026-08-17 cs.LG 新提交 50%

MedMix: Specialization-Consistent Federated Sparse MoEs under Modality Heterogeneity

MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型

Adiba Orzikulova, Dong Min Kim, Jaehong Yoon, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11364 2026-08-13 cs.HC 新提交 50%

QUARTZ: Qualitative Understanding via Accessible Representation and Visualization

QUARTZ:通过可访问表示与可视化实现定性理解

Omar Khan, JooYoung Seo

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对盲人和低视力研究者无法访问定性数据可视化的问题,提出基于网络的QUARTZ系统,通过用户研究揭示相关障碍并提出设计准则,以提升该群体参与定性研究的可访问性。

Comments 24 pages, accepted at ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10350 2026-08-12 cond-mat.str-el cond-mat.mtrl-sci 新提交 50%

Observation geometry for uncertainty-aware Hamiltonian inference and experimental design in quantum magnets

量子磁体中不确定性感知哈密顿量推断与实验设计的观测几何

Roy Liu, Venugopal Ranganathan, David Dahlbom, Shizhou Xu, Tianyu Zhang, Yuan Ni, Daniel M. Pajerowski, Garrett Granroth, Thomas Strohmer, Matthew B. Stone, Andrew F. May, Mark D. Lumsden, Joshua J. Turner, Yongqiang Cheng, Zhantao Chen

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究提出AI赋能的不确定性感知哈密顿量推断与自适应实验设计框架,结合哈密顿量条件神经代理等方法,通过NiPS₃的中子散射测量验证,为量子材料表征与实验设计提供通用策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09166 2026-08-11 cs.RO cs.LG stat.ME 新提交 50%

Particle-Based Conformal Prediction for Contact-Aware Uncertainty Calibration in Stratified Configuration Spaces

分层构型空间中接触感知不确定性校准的基于粒子的保形预测

Luís Marques, Kristian Popov, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对机器人接触障碍物时运动模型不准确、未来构型分布异常的问题,提出CaPTURe算法,实现了接触与非接触场景下的指定覆盖率要求,任务成功率较最佳基线提升30%。

Comments 31 pages, 10 figures, 5 tables. Accepted at COPA 2026 (Conformal and Probabilistic Prediction with Applications). Project page: https://um-arm-lab.github.io/capture/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07183 2026-08-10 cs.LG 新提交 50%

Conformal Fusion Under Missing Modalities

缺失模态下的共形融合

Alireza Moayedikia

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出MCCF架构,解决缺失模态下的多模态融合问题,该架构兼具模态缺失鲁棒性与校准不确定性,在多基准测试中表现出良好的覆盖率与精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06246 2026-08-07 cs.LG 新提交 50%

A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

用于人工智能治理的后训练适应技术的六维分类法

Fardin Afdideh, Fernando Seoane, Farhad Abtahi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05238 2026-08-07 cs.LG 新提交 50%

Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐

Xinran Feng, Yi Xie, Chao Zhang, Ruikun Li, Wanyun Ling, Ziyue Li, Chenxi Liu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。

Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05595 2026-08-07 quant-ph cs.DC cs.LG 新提交 50%

How Much Reconstruction Does Quantum Machine Learning Need? Late Fusion of Independently Trained Quantum Subcircuits

量子机器学习需要多少重构?独立训练量子子电路的后期融合

Prabhjot Singh, Adel N. Toosi, Rajkumar Buyya

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对电路切割量子机器学习中重构成本过高的问题,提出后期融合方法,其准确率与完全重构差距极小但成本指数级降低,且鲁棒性更强,是重构的高效替代方案。

Comments 11 pages, 6 figures. Includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03344 2026-08-05 cond-mat.mtrl-sci physics.app-ph physics.ins-det 新提交 50%

Picometre-scale real-time drift correction in TEM and STEM by dynamic control of the specimen stage for atomic-resolution imaging

用于原子分辨率成像的透射电子显微镜(TEM)与扫描透射电子显微镜(STEM)中通过动态控制样品台实现皮米级实时漂移校正

Christophe Gatel, Julien Dupuy, Teresa Hungria, Martin J. Hytch

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究开发无需硬件修改的动态控制软件框架,通过控制样品台实现皮米级实时漂移校正,提升TEM、STEM成像质量,支持原子分辨率成像及各类实验应用。

Comments 27 pages, 9 figures. Submitted to Ultramicroscopy Christophe Gatel: Writing original draft, Software, Methodology, Investigation, Data treatment, Conceptualization, Resources, Funding acquisition. Julien Dupuis: Software, Conceptualization, Methodology. Teresa Hungria: STEM experiment, Review & editing. Martin Hytch: Review & editing, Data treatment, Resources, Funding acquisition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00368 2026-08-04 eess.SP 新提交 50%

Agent-Native Task-Oriented Communication with Joint Token Compression Coding and Modulation

面向智能体原生的任务导向通信:联合令牌压缩编码与调制

Zhuoran Xiao, Yihang Huang, Tianyu Jiao, Xiaohua Xu, Yin Xu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。

Comments This paper is accepted by IEEE Globecom 2026, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交 50%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02573 2026-08-04 astro-ph.IM 新提交 50%

Foundation Models for Astrophysics

天体物理学领域的基础模型

Xiaosheng Zhao, Yuan-Sen Ting

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本章介绍面向天文领域的基础模型,阐述其核心是可迁移表示,指出当前天文领域此类模型的可迁移性验证案例较少,未来需进一步探索提升路径。

Comments Invited chapter for the edited book "Machine Learning Techniques for Astrophysics and Cosmology" (Eds. Cosimo Bambi, Vinay Kashyap, Swarnim Shashank, Naoki Yoshida, Springer Singapore, expected in 2026). Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 50%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25339 2026-07-29 cs.IR 新提交 50%

SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation

SPARC:用于生成式推荐的序列感知渐进式属性路由与压缩框架

Chang Liu, Changfa Wu, Hui Qian, Binbin Cao, Jian Wu, Yuliang Yan, Han Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对生成式推荐中现有离散语义ID问题,提出SPARC框架,通过建模序列依赖、路由多表示到插槽及轻量级交互,在不增输入长度下丰富用户历史表示,实验证明其性能优于基线,改进源于上下文条件信息保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24260 2026-07-28 cs.LG 新提交 50%

KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

KAP:弥合大语言模型系统中知识选择与运行时消耗的差距

Shuo Wang, Fang Xi, Wenyuan Huang, Qing Wang, Junming Su

机构 * QiYuanLab(启元实验室)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。

Comments 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21899 2026-07-27 cs.SD 新提交 50%

CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following

CODA:用于基于图像的实时乐谱跟随的级联在线不连续感知对齐

Yining Yang, Ruogu Chen, Jie Han

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文针对实时乐谱跟随难题,提出CODA系统。它利用乐谱级联结构增强预测一致性,通过静音驱动中断模式实现不连续恢复。在多模态乐谱数据集钢琴基准测试中,CODA在实时吞吐量下取得了领先的跟踪精度和不连续恢复性能。

Comments 8 pages, 3 figures, accepted by the International Society for Music Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21921 2026-07-27 cs.CE math-ph math.MP 新提交 50%

Learning Population-Level Dynamics through a Latent Fokker--Planck Model and Discrepancy Transport Maps

通过潜在福克 - 普朗克模型和差异传输映射学习总体水平动力学

Chengyang Huang, Krishna Garikipati

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对科学和工程系统概率分布动力学未知问题,提出总体水平推理框架,通过潜在福克 - 普朗克模型和差异传输映射恢复潜在随机动力学,经正则化联合学习,能准确重建复杂概率演化,为动力学推理提供通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20598 2026-07-24 eess.IV 新提交 50%

MedDiT4SR: Tri-Stream Joint Adaptation of Pre-Trained Diffusion Transformers for Medical Image Super-Resolution

MedDiT4SR:用于医学图像超分辨率的预训练扩散Transformer的三流联合自适应

Zhi Chen, Le Zhang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对医学图像超分辨率难题,提出MedDiT4SR三流自适应框架,集成多种表示于扩散Transformer块,引入SR Adapter和SA Refiner,实验验证该框架能有效让预训练DiT模型适应不同医学成像域的超分辨率任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19006 2026-07-22 cs.LG q-bio.QM 新提交 50%

Subject-Conditioned Glucose Forecasting in Type-1 Diabetes

1型糖尿病中基于个体条件的血糖预测

Giorgia Rigamonti, Mirko Paolo Barbato, Davide Marelli, Paolo Napoletano

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对1型糖尿病血糖预测问题,提出多模态深度学习架构SCGP,基于观测数据和个体表征预测血糖,通过分离特征与建模避免早期融合,实验证明其能提高预测性能,利于个性化糖尿病管理。

Comments Accepted at the IEEE EMBC 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏