arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 530 篇

2608.03344 2026-08-05 cond-mat.mtrl-sci physics.app-ph physics.ins-det 新提交 50%

Picometre-scale real-time drift correction in TEM and STEM by dynamic control of the specimen stage for atomic-resolution imaging

用于原子分辨率成像的透射电子显微镜(TEM)与扫描透射电子显微镜(STEM)中通过动态控制样品台实现皮米级实时漂移校正

Christophe Gatel, Julien Dupuy, Teresa Hungria, Martin J. Hytch

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究开发无需硬件修改的动态控制软件框架,通过控制样品台实现皮米级实时漂移校正,提升TEM、STEM成像质量,支持原子分辨率成像及各类实验应用。

Comments 27 pages, 9 figures. Submitted to Ultramicroscopy Christophe Gatel: Writing original draft, Software, Methodology, Investigation, Data treatment, Conceptualization, Resources, Funding acquisition. Julien Dupuis: Software, Conceptualization, Methodology. Teresa Hungria: STEM experiment, Review & editing. Martin Hytch: Review & editing, Data treatment, Resources, Funding acquisition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00368 2026-08-04 eess.SP 新提交 50%

Agent-Native Task-Oriented Communication with Joint Token Compression Coding and Modulation

面向智能体原生的任务导向通信:联合令牌压缩编码与调制

Zhuoran Xiao, Yihang Huang, Tianyu Jiao, Xiaohua Xu, Yin Xu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。

Comments This paper is accepted by IEEE Globecom 2026, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交 50%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02573 2026-08-04 astro-ph.IM 新提交 50%

Foundation Models for Astrophysics

天体物理学领域的基础模型

Xiaosheng Zhao, Yuan-Sen Ting

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本章介绍面向天文领域的基础模型,阐述其核心是可迁移表示,指出当前天文领域此类模型的可迁移性验证案例较少,未来需进一步探索提升路径。

Comments Invited chapter for the edited book "Machine Learning Techniques for Astrophysics and Cosmology" (Eds. Cosimo Bambi, Vinay Kashyap, Swarnim Shashank, Naoki Yoshida, Springer Singapore, expected in 2026). Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 50%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25339 2026-07-29 cs.IR 新提交 50%

SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation

SPARC:用于生成式推荐的序列感知渐进式属性路由与压缩框架

Chang Liu, Changfa Wu, Hui Qian, Binbin Cao, Jian Wu, Yuliang Yan, Han Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对生成式推荐中现有离散语义ID问题,提出SPARC框架,通过建模序列依赖、路由多表示到插槽及轻量级交互,在不增输入长度下丰富用户历史表示,实验证明其性能优于基线,改进源于上下文条件信息保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24260 2026-07-28 cs.LG 新提交 50%

KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

KAP:弥合大语言模型系统中知识选择与运行时消耗的差距

Shuo Wang, Fang Xi, Wenyuan Huang, Qing Wang, Junming Su

机构 * QiYuanLab(启元实验室)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。

Comments 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21899 2026-07-27 cs.SD 新提交 50%

CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following

CODA:用于基于图像的实时乐谱跟随的级联在线不连续感知对齐

Yining Yang, Ruogu Chen, Jie Han

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文针对实时乐谱跟随难题,提出CODA系统。它利用乐谱级联结构增强预测一致性,通过静音驱动中断模式实现不连续恢复。在多模态乐谱数据集钢琴基准测试中,CODA在实时吞吐量下取得了领先的跟踪精度和不连续恢复性能。

Comments 8 pages, 3 figures, accepted by the International Society for Music Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21921 2026-07-27 cs.CE math-ph math.MP 新提交 50%

Learning Population-Level Dynamics through a Latent Fokker--Planck Model and Discrepancy Transport Maps

通过潜在福克 - 普朗克模型和差异传输映射学习总体水平动力学

Chengyang Huang, Krishna Garikipati

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对科学和工程系统概率分布动力学未知问题,提出总体水平推理框架,通过潜在福克 - 普朗克模型和差异传输映射恢复潜在随机动力学,经正则化联合学习,能准确重建复杂概率演化,为动力学推理提供通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20598 2026-07-24 eess.IV 新提交 50%

MedDiT4SR: Tri-Stream Joint Adaptation of Pre-Trained Diffusion Transformers for Medical Image Super-Resolution

MedDiT4SR:用于医学图像超分辨率的预训练扩散Transformer的三流联合自适应

Zhi Chen, Le Zhang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对医学图像超分辨率难题,提出MedDiT4SR三流自适应框架,集成多种表示于扩散Transformer块,引入SR Adapter和SA Refiner,实验验证该框架能有效让预训练DiT模型适应不同医学成像域的超分辨率任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19006 2026-07-22 cs.LG q-bio.QM 新提交 50%

Subject-Conditioned Glucose Forecasting in Type-1 Diabetes

1型糖尿病中基于个体条件的血糖预测

Giorgia Rigamonti, Mirko Paolo Barbato, Davide Marelli, Paolo Napoletano

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对1型糖尿病血糖预测问题,提出多模态深度学习架构SCGP,基于观测数据和个体表征预测血糖,通过分离特征与建模避免早期融合,实验证明其能提高预测性能,利于个性化糖尿病管理。

Comments Accepted at the IEEE EMBC 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14842 2026-07-17 cs.RO 新提交 50%

KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking

KineFuse:用于手中遮挡物体姿态跟踪的运动感知触觉融合

Chanyoung Ahn, Jaesung Lee, Sungwoo Park, Donghyun Hwang

机构 * Center for Humanoid Research, KIST(韩国科学技术院人形机器人研究中心) Korea University(韩国大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 研究如何利用多手指手上的稀疏触觉信号补充预训练视觉姿态跟踪器以应对遮挡,提出运动感知手指级编码器,经多级别评估对比,验证其能提升跟踪成功率,在下游任务表现更好并提供真实世界演示。

Comments 8 pages, 10 figures. Accepted for presentation at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12281 2026-07-15 cs.IR cs.LG 新提交 50%

SlimPer: Make Personalization Model Slim and Smart

SlimPer:使个性化模型变得精简且智能

Siqi Wang, Xianjie Chen, Shaofeng Deng, Albert Chen, Romil Shah, Jiawei Huang, Zhaoqin Wang, Zhang Zhang, Yiqun Liu, Meilei Jiang, Anish Dubey, Moyan Mei, Tongxin Wang, Nathan Berrebbi, Misael Manjarres, Armand Sauzay, Shardul Kothapalli, Aryaman Vinchhi, Kevin Johnstone, Juheon Lee, Gufan Yin, Ziheng Huang, Justin Lin, Mert Terzihan, Yilin Qi, Cynthia Yang, Colin Peppler, Qi Ding, Ruohan Sun, Ge Song, Litao Deng, Parichay Kapoor, Matt Ma, Huihui Cheng, Jiyuan Zhang, Yanli Zhao, Yiping Han, Fangqiu Han, Ning Yao, Arun Singh, Jordan Edwards, Zhengyu Su, Abhishek Kumar, Guangdeng Liao, Ankit Asthana

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究针对工业推荐系统中Transformer架构的不足,提出SlimPer方法,将个性化排名重构成对紧凑知识库的迭代细化,可解耦模型深度与用户历史长度,统一多种特征并具可解释性,在Instagram相关业务上提升了用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 50%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07927 2026-07-10 quant-ph 新提交 50%

Invariance Audits for Quantum Kernels and Variational Rewinding: A Real-to-Hermitian Taxonomy of Projector, Flag, Anchor, and Density Geometry

量子核与变分回绕的不变性审计:投影器、标志、锚和密度几何的实到厄米特分类法

Azadeh Alavi, Fatemeh Kouchmeshki, Hossein Akhoundi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究量子机器学习中向量替换表示的不变性决策,开发实到厄米特分类法,形式化相关核并证明性质,通过多种实验表明量子和几何提升在不变性与任务匹配时有用,丢弃带标签信息时正确失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25998 2026-07-02 cs.CR 新提交 50%

BlowLive: Blow-Based Multi-Factor Biometrics with Liveness Detection and Revocability

BlowLive:基于吹气的多因素生物识别与活体检测及可撤销性

Eyasu Getahun Chekole, Howard Halim, Daniël Reijsbergen, Jianying Zhou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出BlowLive框架,融合吹气声学信号与面部生物特征,采用模糊提取器生成稳定密钥进行认证,并引入多普勒频移活体检测,实现高精度、强安全与可撤销性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16517 2026-07-01 cs.LG q-bio.QM 新提交 50%

How Post-Training Shapes Biological Reasoning Models

后训练如何塑造生物学推理模型

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27984 2026-06-29 cs.LG 新提交 50%

Dual-Learning based Penalized Multi-Align Clustering for Multi-View Incomplete and Disorderly Data

基于对偶学习的惩罚多对齐聚类用于多视图不完整与无序数据

Liang Zhao, Shubin Ma, Bo Xu, Qingchen Zhang

机构 * Dalian University of Technology(大连理工大学) Hainan University(海南大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对多模态数据的不完整和时间异步问题,提出基于对偶学习的惩罚多对齐聚类模型(DLPMAC),通过对偶学习保持语义和结构一致性,并利用惩罚机制实现多对多数据对齐,提升对齐精度并避免数据聚合。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27811 2026-06-29 cs.RO 新提交 50%

LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations

LXD-SLAM:基于LiDAR+X的密集SLAM,支持∑_{i=0}^{5}C_5^i种可配置传感器组合

Zhong Wang, Lin Zhang, Linfei Li, Ying Shen, Shaoming Zhang, Pengcheng Shi, Shengjie Zhao

机构 * Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出LXD-SLAM,一种以3D LiDAR为中心的多传感器融合框架,支持32种传感器组合,通过统一的迭代误差状态卡尔曼滤波和混合位姿图实现高保真、全局一致的密集建图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23668 2026-06-23 cs.LG 新提交 50%

On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

关于提示条件语言模型作为通用学习器的局限性

David Mguni, Julian Ma, Jun Wang

机构 * Queen Mary University London(伦敦玛丽女王大学) University College London(伦敦大学学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文通过廉价谈话博弈模型分析提示条件语言模型,证明语言作为容量受限通道导致任务不可区分性,并因对齐约束产生不可约误差,从而否定其通过提示实现通用问题求解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20920 2026-06-23 cs.LG math.DS 新提交 50%

$Ω$: Operator-based Mixture Ensemble for Generative Assimilation

$Ω$: 基于算子的混合集成生成同化

Pouria Behnoudfar, Nan Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对高维非线性系统中非高斯后验分布难以刻画的问题,提出Ω框架,融合条件高斯代理、无监督分数学习和生成采样,无需真实后验样本即可高效重构后验分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20382 2026-06-19 cs.LG 新提交 50%

Towards Modality-imbalanced Federated Graph Learning: A Data Synthesis-based Approach

面向模态不平衡的联邦图学习:一种基于数据合成的方法

Zhengyu Wu, Hongchao Qin, Xunkai Li, Zekai Chen, Rong-Hua Li, Guoren Wang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对联邦图学习中客户端级和节点级模态不平衡问题,提出隐式图感知潜在语义表示合成范式FedMGS,通过可用性感知图编码器、原型引导语义合成器和可靠性校准融合机制恢复缺失模态语义,在四个任务上最高提升17.41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19989 2026-06-19 cs.DC cs.LG 新提交 50%

Online Dynamic Batching with Formal Guarantees for LLM Training

面向LLM训练的具有形式保证的在线动态批处理

Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

机构 * Tencent(腾讯)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出在线动态批处理(ODB)系统,在数据加载器侧将批构建延迟到样本真实成本可观测时,解决离线批采样中预处理成本不可见问题,实现1.58-4.43x吞吐量提升,并提供无死锁有界终止的形式化保证。

Comments 29 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19529 2026-06-19 cs.DC 新提交 50%

The Sheaf Laplacian: A Topological Framework for Data Fusion and Consensus in Distributed Sensing Networks

层拉普拉斯算子:分布式传感网络中数据融合与共识的拓扑框架

Manuel Hernández, Eduardo Sánchez-Soto

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出层理论作为传统图模型的替代,利用层拉普拉斯算子实现异构分布式传感网络中的数据融合与共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19194 2026-06-18 cs.RO 新提交 50%

Invertible Neural Network Adapter for One-Step Flow Matching in Robot Manipulation

用于机器人操作中一步流匹配的可逆神经网络适配器

Yu Zhang, Kangyi Ji, Yongxiang Zou, Rongtao Xu, Feng Zheng, Long Cheng

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出可逆神经网络适配器,通过一步去噪过程生成高维动作,降低推理复杂度并保持精度,在仿真和真实实验中提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17010 2026-06-16 cs.LG 新提交 50%

From Tokens to Policy: Causal and Interpretable Heterogeneous Treatment Effects Identification

从令牌到策略:因果且可解释的异质性处理效应识别

Riccardo Cadei, Frank Otchere, Nyasha Tirivayi, Gustavo Angeles Tagliaferro, Falco J. Bargagli-Stoffi, Francesco Locatello

机构 * ISTA UNICEF(联合国儿童基金会) UCLA(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出NEXIS方法,利用多模态预处理表示将HTE识别转化为马尔可夫毯发现问题,实现因果可解释的异质性处理效应识别,并在非洲反贫困项目中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15221 2026-06-16 cs.CR 新提交 50%

Robust and Precise Application Fingerprinting on 5G Physical Uplink Channel

5G物理上行链路上的鲁棒且精确的应用指纹识别

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对5G加密控制信道打破传统攻击链的问题,本文发现物理层侧信道(上行MCS稳定导致PRB数量反映IP包长度),结合上行控制信道重构双向流量,设计了三步被动攻击Crosshair,通过盲提取、数据增强和跨模态对齐实现高精度应用识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13970 2026-06-15 cs.RO cs.LG 新提交 50%

An Attention-based Model for Robust Forecasting with Missing Modality

基于注意力的缺失模态鲁棒预测模型

Zhitian Zhang, Wenjie Zi, Yunduz Rakhmangulova, Saghar Irandoust, Hossein Hajimirsadeghi, Thibaut Durand

机构 * Simon Fraser University(西蒙菲莎大学) RBC Borealis

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种基于条件变分自编码器和Transformer的多模态模型,通过注意力机制学习统一固定维度的表示,在训练和推理中处理缺失模态,在人类轨迹预测和机器人操作预测任务上优于现有方法。

Comments Work originally done in 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12559 2026-06-12 physics.comp-ph cs.LG cs.NA math.NA physics.flu-dyn 新提交 50%

Feature-preserving Latent-EnKF for Data Assimilation of Flows with Shocks

保持特征的潜在EnKF用于含激波流动的数据同化

Hemanth Chandravamsi, Hangchuan Hu, Ponkrshnan Thiagarajan, Tamer A. Zaki

机构 * Department of Mechanical Engineering, Johns Hopkins University(约翰霍普金斯大学机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对含激波流动中EnKF因多模态统计产生伪振荡的问题,提出在学习的低维潜在空间进行集合更新以保持激波特征,并通过共享解码器恢复物理状态,数值实验验证了无伪振荡的准确特征恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏