arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-01 至 2026-07-01 共收录 96 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 26 篇

2506.19610 2026-07-01 cs.CE 50%

V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis

V2T-CoT:从视觉到文本链式推理用于医学推理与诊断

Yuan Wang, Jiaxiang Liu, Shujian Gao, Bin Feng, Zhihang Tang, Xiaotang Gai, Jian Wu, Zuozhu Liu

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 11 篇

2511.00810 2026-07-01 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新 87%

GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位

Shijie Zhou, Viet Dac Lai, Hao Tan, Jihyung Kil, Wanrong Zhu, Changyou Chen, Ruiyi Zhang

机构 * University at Buffalo(布法罗大学) Adobe Research(Adobe研究院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 85%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31613 2026-07-01 cs.CV cs.RO 新提交 79%

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

基于多模态智能体AI和主动波浪补偿的自主无人机稳健海上平台着陆

Francisco S. Neves, Pedro N. Pereira, Raul D. S. G. Campilho, Andry M. Pinto

机构 * Fundação Para a Ciência e a Tecnologia(葡萄牙科学技术基金会)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种解耦的多飞行器着陆框架,利用双深度强化学习智能体(SAC和模态RL)实现无人机在海上平台的稳健着陆,在15次试验中达到100%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31504 2026-07-01 cs.CV 新提交 79%

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

SimpleSearch-VL:多模态智能深度搜索的简单配方

Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen

机构 * Southeast University(东南大学) Ant Group(蚂蚁集团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17442 2026-07-01 cs.CV cs.AI 版本更新 62%

REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

REMSA:通过约束感知代理进行遥感基础模型选择

Binger Chen, Tacettin Emre Bök, Behnood Rasti, Volker Markl, Begüm Demir

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) U AI(5U AI) Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。

Comments Code and data available at https://github.com/be-chen/REMSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19600 2026-07-01 cs.SE cs.AI cs.CL 版本更新 62%

Human-Agent Collaborative Paper-to-Page Crafting

人机协作的论文到网页制作

Qianli Ma, Siyu Wang, Yilin Chen, Yinhao Tang, Yixiang Yang, Chang Guo, Bingjie Gao, Zhening Xing, Yanan Sun, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出AutoPage多智能体系统,通过粗到细的流水线将论文转化为交互式网页,并引入Checker智能体验证和人工检查点,在15分钟内以低于0.1美元的成本生成高质量网页。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31392 2026-07-01 cs.AI 新提交 57%

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO: 用于工具使用智能体的反思增强策略优化

Binjie Zhang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31157 2026-07-01 cs.CV 新提交 57%

Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

重新思考基础模型协作:通过代理任务推理增强专用模型

Hongyi Lin, Yang Liu, Jinhua Zhao, Xiaobo Qu

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出FAT框架,将基础模型与专用模型协作视为任务分解而非替代,通过代理任务(如选择或验证)提升结构化预测性能,在多个任务上优于直接使用基础模型回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30662 2026-07-01 cs.CY cs.AI 新提交 57%

ELEVATE: Designing Human-Centered GenAI Virtual Tutors for Scalable and Inclusive Education

ELEVATE:面向可扩展与包容性教育的人本生成式AI虚拟导师设计

Lorenzo Stacchio, Michele Giordano, Daniele Berardini, Primo Zingaretti, Emanuele Frontoni

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出ELEVATE框架,通过本地执行、多模态3D虚拟形象与教师治理层,实现隐私保护、低成本的生成式AI虚拟导师,解决云端文本聊天机器人存在的隐私、成本和数字鸿沟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30658 2026-07-01 cs.CY cs.AI 新提交 57%

Agentic AI Enhances Physician Trust in Clinical Decision Making

智能体AI增强医生在临床决策中的信任

Zhiling Yan, Zhe Fang, David J King, Ann Pongsakul, Eashan Adhikarla, Hui Ren, Sunyang Fu, Quanzheng Li, Lifang He, Xiang Li, Hongfang Liu, Yonghui Wu, Lichao Sun

机构 * Department of Computer Science and Engineering, Lehigh University(里海大学计算机科学与工程系) Department of Epidemiology, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院流行病学系) Department of Medicine, Division of Cardiology, University of Florida(佛罗里达大学医学院心脏病学系) McGovern Medical School, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦戈文医学院) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院放射学系) McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦克威廉姆斯生物医学信息学院) Department of Health Outcomes & Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究通过医生评估多模态临床病例,发现智能体AI相比非智能体基线显著提升医生的认知和行为信任,尤其在治疗规划任务中,但存在对错误输出的过度依赖。

Comments Accepted by AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31142 2026-07-01 math.OC 新提交 50%

Augmenting airline networks using airside-to-airside buses to strengthen system resilience under disruptions

利用空侧对空侧巴士增强航空网络以加强系统在中断下的韧性

Micah M. Borrero, Max Z. Li

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出通过空侧对空侧巴士替代短途区域航班,重构航空网络拓扑以主动提升韧性,模拟显示在1000万美元预算下转换10条航线可减少8%中断日和6%正常日的旅客延误。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 18 篇

2606.31903 2026-07-01 cs.CV cs.AI 新提交 86%

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃

Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Sun Yat-sen University(中山大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型视觉令牌计算冗余问题,提出算子级视觉跳跃框架,选择性跳过冗余注意力或FFN算子,在Qwen3-VL上减少33.7%计算量并保持99.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00547 2026-07-01 cs.CV cs.AI cs.HC 84%

Milmer: a Framework for Multiple Instance Learning based Multimodal Emotion Recognition

Milmer: 一种基于多实例学习的多模态情感识别框架

Zaitian Wang, Jian He, Yu Liang, Xiyuan Hu, Tianhao Peng, Kaixin Wang, Jiakai Wang, Chenlong Zhang, Weili Zhang, Shuang Niu, Xiaoyang Xie

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Milmer框架,结合面部表情分析与EEG信号,采用Transformer融合方法提升多模态情感识别性能,通过细调Swin Transformer和交叉注意力机制实现高效特征融合,实验显示在DEAP数据集上达到96.72%的四类情感识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31135 2026-07-01 cs.CV cs.LG 新提交 83%

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration

MSNN-LINet:通过连续线性集成进行跨模态学习

Gabriel Clinger

机构 * The George Washington University(乔治华盛顿大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出线性集成网络LINet,通过连续线性集成卷积操作实现RGB-D场景分类中的逐层跨模态学习,解决多模态融合的结构性妥协问题,并在SUN RGB-D数据集上取得领先结果。

Comments 14 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31599 2026-07-01 cs.CV cs.AI 新提交 81%

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

通过双流强化学习实现令牌稀疏的医学多模态推理

Kaitao Chen, Weiqian Zhao, Jiamin Wu, Qihao Zheng, Shangquan Sun, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出双流强化学习框架ViToS,通过主动视觉令牌剪枝实现令牌稀疏的医学多模态推理,在七个医学基准上减少77%令牌并提升性能。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30647 2026-07-01 cs.CV cs.AI 新提交 81%

Cross-Modal Hierarchical Fusion for from Multi-Sensor Ground Observation

跨模态分层融合用于多传感器地面观测

Xinze Zhang

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出AtmoFuseNet框架,通过跨模态分层聚合、条件变分精化和相关运动估计,融合多视角天空相机、毫米波云雷达和云高仪数据,实现云微物理场和风场的4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 79%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31383 2026-07-01 cs.CV 新提交 79%

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

MS-Resampler: 用于高效多模态大语言模型的多范围视觉重采样

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * Li Auto Inc.(理想汽车) East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MS-Resampler,通过多范围视觉重采样框架,注入显式空间范围先验,使模型在固定令牌预算内同时捕获局部细节和全局上下文,提升多模态理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32016 2026-07-01 cs.LG 新提交 78%

FedLAB: Traceable Semantic Codebooks for Federated Multimodal Graph Foundation Learning

FedLAB: 面向联邦多模态图基础学习的可追踪语义码本

Zekai Chen, Kairui Yang, Xuaner Chen, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出FedLAB框架,通过类型化分层码本组织模态证据、节点语义和拓扑上下文,实现联邦多模态图学习中的可追踪语义,在10个基准和6个下游任务上提升达7.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 73%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL、cs.MM

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31496 2026-07-01 cs.CV 新提交 70%

HVPNet: A Bio-Inspired Network for General Salient and Camouflaged Object Detection

HVPNet:一种用于通用显著和伪装目标检测的仿生网络

Jiawei Xu, Qiangqiang Zhou, Zhouping Li, Yanjiao Shi, Yugen Yi, Jiacong Yu

机构 * School of Artificial Intelligence, Jiangxi Normal University(江西师范大学人工智能学院) Faculty of Business Information, Shanghai Business School(上海商学院商务信息学院) School of Computer Science and Information Engineering, Shanghai Institute of Technology(上海应用技术大学计算机科学与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 受人类视觉过程启发,提出简单通用的仿生架构HVPNet,通过视网膜整合模块和皮层解码器实现多模态特征高效融合,在7个任务22个数据集上取得精度-效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 70%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31015 2026-07-01 cs.CV 新提交 70%

Dual Sparse Aggregation Transformer for Multispectral Object Detection

双稀疏聚合Transformer用于多光谱目标检测

Wencong Wu, Xiuwei Zhang, Hanlin Yin, Hongxi Zhang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络空间安全学院) Shaanxi Provincial Key Laboratory of Speech and Image Information Processing(陕西省语音与图像信息处理重点实验室) National Engineering Laboratory for Integrated Aerospace-Ground-Ocean Big Data Application Technology(空天地海一体化大数据应用技术国家工程实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出双稀疏聚合Transformer(DSAFormer),通过空间和通道稀疏注意力机制减少冗余交互,并引入可学习加法融合模块增强多模态特征融合,在四个数据集上达到最优检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31982 2026-07-01 cs.CV 新提交 57%

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型

Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) OPPO Research Institute(OPPO研究院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31800 2026-07-01 cs.AI 新提交 57%

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

Evo-PI:通过演化原则引导的对齐医学推理

Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael Witbrock, Kaiqi Zhao, Shangyang Li

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) National Yang Ming Chiao Tung University(国立阳明交通大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31136 2026-07-01 cs.CV 新提交 57%

FROST: Training-Free Few-Shot Segmentation with Frozen Features and Nonparametric Statistics

FROST:基于冻结特征和非参数统计的无训练少样本分割

Junghwan Park

机构 * TelePIX

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出FROST,一种无训练少样本分割方法,将参考前景和背景视为冻结DINOv3特征单位球上的点云,通过非参数密度比标记查询像素,在遥感基准上超越现有方法。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30936 2026-07-01 cs.LG astro-ph.EP astro-ph.IM cs.AI 新提交 57%

Physics-informed Conditional Normalizing Flows for Angles-only Cislunar Orbit Determination

基于物理信息的条件归一化流用于仅角度地月空间轨道确定

Walther Litteri, Massimiliano Vasile

机构 * University of Strathclyde(斯特拉斯克莱德大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出使用条件归一化流从短弧角度测量中推断地月空间初始状态的后验分布,结合物理信息采样并通过非线性最小二乘优化提供经典算法的热启动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27313 2026-07-01 cs.CV 新提交 57%

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ: 任意分辨率下的文本对齐视觉量化表示

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

机构 * Tencent HY Vision Team(腾讯HY视觉团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16517 2026-07-01 cs.LG q-bio.QM 新提交 50%

How Post-Training Shapes Biological Reasoning Models

后训练如何塑造生物学推理模型

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。

详情

展开后加载摘要…

URL PDF HTML 收藏