arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 198 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 19 篇

2606.23270 2026-06-23 cs.CV 新提交 57%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20689 2026-06-23 cs.CV cs.LG 新提交 57%

NeoJaundice-AI: Smartphone-Based Neonatal Jaundice Detection Using Dual-Input Deep Learning and Synthetic Augmentation

NeoJaundice-AI: 基于智能手机的新生儿黄疸检测,采用双输入深度学习与合成增强

Rahul Patel, Nirjala Jarpula

机构 * Indian Institute of Information Technology Surat(印度信息技术学院苏拉特分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出NeoJaundice-AI系统,通过双分支EfficientNet-B0处理皮肤和巩膜图像,融合手工YCbCr颜色特征,实现四类严重度分类和胆红素回归,采用合成黄疸生成和肤色归一化,在印度新生儿数据集上达到91.8%准确率。

Comments 7 pages, 10 figures, 8 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21036 2026-06-23 stat.ML cs.LG 新提交 50%

Diffusion-Driven State Space Models

扩散驱动的状态空间模型

Jack Ruder, Michael Wojnowicz

机构 * Montana State University(蒙塔纳州立大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出扩散驱动状态空间模型(DDSSM),用扩散模型替代高斯转移分布,联合训练自编码器和扩散模型,提升时间序列拟合与预测能力。

Comments Accepted to ProbML 2026 Workshop Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21935 2026-06-23 cs.RO 新提交 50%

CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation

CoRDE:面向机器人操作结构泛化的概念先验路由扩散专家

Haidong Huang, Xixin Zhao, Yaohua Zhou, Jiayu Song, Jiayi Zhang, Jun Ma, Haiyue Zhu, Xiaocong Li

机构 * College of Information Science and Technology, Eastern Institute of Technology, Ningbo(宁波东方理工大学(暂名)信息科学与技术学院) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo(浙江省工业智能与数字孪生重点实验室,宁波东方理工大学(暂名)) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统学域) Faculty of Science and Engineering, University of Nottingham Ningbo China(宁波诺丁汉大学理工学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出CoRDE框架,通过概念先验引导路由和低秩专家池,解决扩散模型在多任务长时程操作中的结构泛化不足和路由崩溃问题。

Comments 8 pages, 3 figures, Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20607 2026-06-23 cs.HC 新提交 50%

LLM4CAD-Editor: An Intent-Aware Large Language Model Framework for Multi-Level Computer-Aided Design Editing

LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架

Yuewan Sun, Zhenghui Sha

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18457 2026-06-23 eess.SP 版本更新 50%

Sense Smarter, Think Better: A Survey on Edge Perception for Next-Generation Networks

智能感知,更优思考:面向下一代网络的边缘感知

Zhonghao Lyu, Xiaowen Cao, Xianxin Song, Yuchen Li, Jiacheng Wang, Shuoyao Wang, Yuanhao Cui, Weijie Yuan, Xianghao Yu, Guangxu Zhu, Hai Liu, Jie Xu, Derrick Wing Kwan Ng, Shuguang Cui

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了边缘感知的核心方法与贡献,涵盖传感模态、边缘AI技术及其协同作用,分析了边缘AI如何增强感知能力,并探讨了任务驱动感知在边缘AI中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02581 2026-06-23 cs.LG 版本更新 50%

Training Diffusion Policies via Prior-Mapping Co-Evolution

通过先验映射协同进化训练扩散策略

Chubin Zhang, Zhenglin Wan, Feng Chen, Fuchao Yang, Lang Feng, Yaxin Zhou, Xingrui Yu, Yang You, Ivor Tsang, Bo An

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Carnegie Mellon University(卡内基梅隆大学) CFAR Agency for Science Technology and Research(科技研究局(CFAR)) IHPC Agency for Science Technology and Research(科技研究局(IHPC))

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出GoRL框架,通过将策略优化限制在易处理的潜空间,同时用条件生成解码器合成动作,解耦优化与生成,实现稳定优化与表达力提升,在连续控制任务上显著超越基线。

Comments Ver 3 (Accepted as a conference paper by ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 39 篇

2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 91%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20961 2026-06-23 cs.LG cs.AI 新提交 84%

Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs

我们的基准测试足够吗?多模态大语言模型持续学习分析

Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。

Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21613 2026-06-23 cs.CV cs.AI 新提交 81%

Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring

跨模态验证实现无标注野生动物监测

Bharath Pillai, Varun Viswapriyan, Christopher Stewart, Tanya Berger-Wolf, Jenna Kline

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 多模态评测 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出利用物种活动模式专家知识作为无标注验证信号,通过视觉和声学管道独立恢复活动模式并与行为先验三方一致,实现无需人工标注的野生动物监测。

Comments Presented at the 2026 CV4Animals Workshop, colocated with CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11454 2026-06-23 cs.CV cs.AI 81%

HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation

HumaniBench: 一种以人为中心的大型多模态模型评估框架

Shaina Raza, Aravind Narayanan, Vahid Reza Khazaie, Ashmal Vayani, Ahmed Y. Radwan, Mukund S. Chettiar, Amandeep Singh, Mubarak Shah, Deval Pandya

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出HumaniBench框架,通过32000个专家验证的图像-问题对评估大型多模态模型在公平性、伦理、包容性等人类中心原则上的对齐情况,揭示了不同模型在伦理、推理和共情方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21408 2026-06-23 eess.AS 新提交 79%

Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi

Vaani 基准测试 V1.0:一个包容性的印地语多模态基准数据集

Sujith Pulikodan, Agneedh Basu, Saurabh Kumar, Pranav Bhat, Pavan Kumar J, Visruth Sanka, Nihar Desai, Prasanta Kumar Ghosh

专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS

AI总结 针对印地语自动语音识别系统缺乏地理和人口多样性基准的问题,本文提出一个包含104个地区、多参考转录的多模态数据集,用于更鲁棒和包容的ASR评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23092 2026-06-23 cs.CL 新提交 79%

PIVOTSBench: Evaluating Fine-Grained Interpersonal Relationship Reasoning in Multimodal Large Language Models

PIVOTSBench:评估多模态大语言模型中的细粒度人际关系推理

Shuxiang Zhang, Yiting Yin, Wenxuan Song, Yuhang Wu, Miao Liu

机构 * Sun Yat-sen University(中山大学) University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出PIVOTS基准,基于Social-IQ 2.0和YouTube数据,评估多模态大语言模型在心理学研究基础上预测双向人际关系维度的能力,并包含辅助任务分析关键视觉线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22442 2026-06-23 cs.AI 新提交 79%

Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

用于肺栓塞风险评估的高效多模态临床问答

Xiangyuan Xue, Yang Yu, Yan Gao, Junyan Wang, Bin Chen, Lingyan Ruan, Ting Dang, Hong Jia

机构 * University of Auckland(奥克兰大学) University of Cambridge(剑桥大学) University of Adelaide(阿德莱德大学) University of Melbourne(墨尔本大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究构建了基于INSPECT数据集的肺栓塞多模态基准,通过结构化问答任务评估高效多模态大模型在CTPA和EHR输入下的诊断与预后性能,发现Gemma4模型在结合CTPA+EHR时表现更优,且诊断任务优于预后任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21618 2026-06-23 cs.CL 新提交 79%

CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

CulMind:中国文化遗产中的多模态理解与推理基准

Zhangwei Cao, Shuhan Fan, Yuting Wei, Jiajun Zhang, Yihang Peng, Qi Meng, Yangfu Zhu, Liangbin Yang

机构 * University of International Relations(国际关系学院) Kedge Business School(凯致商学院) Peking University(北京大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Capital Normal University(首都师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14837 2026-06-23 cs.CV 版本更新 79%

DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架

Yifan Yang, Lei Zou, Wenjing Gong, Kani Fu, Zongrong Li, Siqin Wang, Bing Zhou, Heng Cai, Hao Tian

机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA organization= Department of Industrial Systems Engineering, University of Florida , city= Gainesville , country= USA organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA organization= Department of Geography Sustainability, University of Tennessee , city= Knoxville , country= USA

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26088 2026-06-23 cs.CV 79%

Predicting Penalty Kick Direction Using Multi-Modal Deep Learning with Pose-Guided Attention

利用多模态深度学习与姿态引导注意力预测点球方向

Pasindu Ranasinghe, Pamudu Ranasinghe

机构 * University of New South Wales(新南威尔士大学) Virtusa Pvt. Ltd.(维塔萨私人有限公司) University of Moratuwa(摩图瓦大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种实时多模态深度学习框架,通过RGB帧和2D关键点预测点球方向,采用双分支架构和注意力机制,准确率达89%,适用于门将训练与战术分析。

Journal ref Sports Analytics, ISACE 2025, Lecture Notes in Computer Science, vol. 15925, pp. 179-192, Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 79%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14145 2026-06-23 cs.CL cs.CV 版本更新 79%

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Bryan Catanzaro, Mohammad Shoeybi, Wei Ping

机构 * NVIDIA, USA(NVIDIA美国分公司) University of Maryland, College Park, USA(马里兰大学帕克分校)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。

Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 78%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22188 2026-06-23 cs.LG 新提交 78%

Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

贝叶斯适应健身房:多模态语言模型贝叶斯低秩适应的基准

Colin Samplawski, Ramneet Kaur, Manoj Acharya, Anirban Roy, Adam D. Cobb

机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) Computer Science Laboratory(计算机科学实验室) SRI International(SRI国际)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出贝叶斯适应健身房(BAG)基准,用于评估多模态语言模型的贝叶斯低秩适应方法,涵盖校准、分布偏移鲁棒性和主动学习下的不确定性决策。

Comments Oral Paper at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23354 2026-06-23 cs.CV 新提交 77%

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

通过学习的代理令牌实现忠实的接地视觉推理

Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

机构 * CEA-LIST(法国原子能委员会-信息与系统技术实验室)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出Composer模型,利用基于学习代理令牌的视觉接地机制,通过离散符号指针显式索引图像潜在空间,在保持答案准确性的同时将视觉接地准确率提升9.0个百分点。

Comments Accepted at ICIP 2026. Code, model and data available at: https://github.com/CEA-LIST/Composer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21222 2026-06-23 cs.RO cs.AI 新提交 77%

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

FleetAgent: 通过向量化V2N消息实现自主车队远程操作助手

Juntong Peng, Qi Chen, Deyuan Qu, Takayuki Shimizu, Yaobin Chen, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出FleetAgent,一种基于多模态大语言模型的云端助手,通过紧凑的向量化V2N消息实现高效远程操作监控,显著降低上行负载和内存占用,并提升操作员优先级判断与干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新 77%

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title_cn,abstract_cn);分类 cs.CV

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17782 2026-06-23 cs.CV 版本更新 74%

Thalia: A Global, Multi-Modal Dataset for Volcanic Activity Monitoring

Thalia:用于火山活动监测的全球多模态数据集

Nikolas Papadopoulos, Nikolaos Ioannis Bountos, Maria Sdraka, Andreas Karavias, Gustau Camps-Valls, Ioannis Papoutsis

机构 * Remote Sensing Lab, National Technical University of Athens, Greece(希腊国家技术大学远程传感实验室) Department of Informatics and Telematics, Harokopio University of Athens, Greece(希腊雅典霍罗科普利奥大学信息与电信系) Image Processing Laboratory (IPL), Universitat de València, Spain(西班牙瓦伦西亚大学图像处理实验室) National Observatory of Athens, Greece(希腊国家天文台)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 针对火山监测中InSAR数据复杂且标注数据集稀缺的问题,本文构建了Thalia数据集,整合多源高分辨率时空数据,并提供专家标注和基准评估,推动深度学习在火山变形监测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23678 2026-06-23 cs.CV cs.AI 新提交 62%

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

AIR: MLLMs中的自适应交错推理与代码

Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

机构 * Independent Researcher(独立研究员)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出自适应交错推理框架AIR,通过强化学习训练代码增强的复杂数值计算任务,采用分组约束奖励函数和两阶段数据构建,使性能平均提升6.1个百分点。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23144 2026-06-23 cs.CV cs.CL 新提交 62%

Koshur Pixel: a large-scale synthetic ocr dataset for kashmiri

Koshur Pixel:克什米尔语的大规模合成OCR数据集

Haq Nawaz Malik, Faizan Iqbal, Nahfid Nissar

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 针对低资源语言克什米尔语,提出首个大规模合成OCR数据集Koshur Pixel,包含613,078个图像-文本对,采用SynthOCR-Gen框架生成,覆盖多种字体和文本粒度,并集成25种以上数据增强策略,为训练OCR系统、数字化克什米尔文本遗产提供基础资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22608 2026-06-23 cs.CV cs.CL 新提交 62%

Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline

电子巴比伦图书馆中的自动楔形文字符号检测:大规模数据集与端到端楔形文字OCR流水线

Wentao Che, Esteban Garcés Arias, Asim Niaz, Andreas Bender, Enrique Jiménez

机构 * Institute of Assyriology and Hittite Studies, LMU Munich(慕尼黑大学亚述学与赫梯学研究所) Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出基于可变形检测Transformer(DETR)的楔形文字符号检测模型,在最大标注数据集上实现28-37%的COCO指标提升,并应用于eBL语料库生成290万检测结果。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20770 2026-06-23 cs.CL cs.AI cs.LG 新提交 62%

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。

Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 62%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏