arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-10 至 2026-08-10 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 8 篇

2608.06938 2026-08-10 cs.CV cs.AI 新提交 84%

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

机构 * Ant Group(蚂蚁集团)

专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06707 2026-08-10 cs.RO 新提交 78%

Hoverflie: An empirical investigation of rotor shrouds to transform micro air vehicles into multi-modal hovercraft

Hoverflie:对转子导流罩将微型飞行器转变为多模式气垫船的实验研究

Mrinmoy Modak, Daniel S. Drew

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本研究通过设计定制转子导流罩系统,将Crazyflie 2.1微型飞行器转变为多模式机器人,开发经验模型优化导流罩配置,提升了地面效应性能并延长了续航时间,为相关后续研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06494 2026-08-10 astro-ph.EP astro-ph.IM physics.app-ph 新提交 78%

Asteroid Disruption and Deflection Simulations for Multi-Modal Planetary Defense

用于多模态行星防御的小行星破坏与偏转模拟

Alexander N. Cohen, Philip Lubin, Darrel Robertson, Mark Boslough, Sasha Egan, Brin Bailey, Angela M. Stickle, Elizabeth A. Silber, Peter Meinhold, Dharv Patel

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 该研究针对小行星行星防御的终端场景问题,采用PI方法结合ALE3D模拟,证实20-100米级碎石堆小行星可通过特定参数的超高速钨侵彻体撞击有效减缓,为多模态行星防御提供可行方案。

Comments 9 pages, 8 figures

Journal ref Acta Astronautica, Volume 225, December 2024, Pages 960-967

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04451 2026-08-10 cs.CV 版本更新 77%

RemoteZero: Geospatial Reasoning with Zero Labels

RemoteZero:零样本地理空间推理

Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng

专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06919 2026-08-10 cs.CV cs.RO 新提交 70%

Vernata: Self-Supervised Learning of LiDAR Point Representations

Vernata:激光雷达点表示的自监督学习

Oliver Lemke, Alexander Liniger, Abel Gawel, Marco Hutter

机构 * Robotics and AI Institute(机器人与人工智能研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 其他多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出基于Sonata架构的Vernata自监督学习框架,通过三项扩展优化激光雷达点云表示,在多数据集上相比基线取得显著性能提升,模态减少场景下仍保持竞争力

Comments IROS 2026. Implementation: https://github.com/rai-opensource/vernata

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06758 2026-08-10 cs.CL 新提交 57%

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader: Structured Document Parsing via Capability Injection and Forgetting Control

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:基于能力注入与遗忘控制的结构化文档解析模型

Shi Chen, Hayato Aida, Makoto Morinaga, Shohei Tanaka, Kosuke Arima

机构 * Stockmark Inc.(斯托克马克公司)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究提出Stockmark-Nemotron-3-Nano-Omni-JapanDocReader模型,通过能力注入与遗忘控制优化结构化文档解析性能,结合混合SFT与DAPO式RL取得优于SFT的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06354 2026-08-10 cs.RO 版本更新 50%

A Master-Slave Robot Manipulator for Needle-Based Teleoperation in MRI Chamber

用于MRI室内经针遥操作的主从机器人操纵器

Omar Curiel, Jing-Yuan Huang, Po-Chih Chen, Ji Ma, Qing Dai, Wenqi Zhou, David Lu, Holden H. Wu, Tsu-Chin Tsao

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究开发了一种MRI安全的主从机器人操纵器,可实现多模态控制,支持协作任务,经初步实验验证适用于MRI室内床边手动控制模式下的活体猪介入操作。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08527 2026-08-10 math.NA cs.LG cs.NA math.PR stat.ML 版本更新 50%

Sampling via Stochastic Interpolants by Langevin-based Velocity and Initialization Estimation in Flow ODEs

通过基于Langevin的速度和初始化估计在流ODEs中进行采样

Chenguang Duan, Yuling Jiao, Gabriele Steidl, Christian Wald, Jerry Zhijian Yang, Ruizhe Zhang

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种基于Langevin采样器和概率流ODE的方法,用于高效采样复杂分布并提升贝叶斯推断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏