arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-26 至 2026-02-26 共收录 49 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2602.21704 2026-02-26 cs.CV cs.AI 81%

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

动态多模态激活引导用于大型视觉-语言模型中的幻觉缓解

Jianghao Yin, Qin Chen, Kedi Chen, Jie Zhou, Xingjiao Wu, Liang He

机构 * East China Normal University(华东师范大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出动态多模态激活引导方法,通过构建语义真实性引导向量数据库,实现幻觉缓解,提升模型性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21441 2026-02-26 cs.LG cs.AI cs.CV 81%

Causal Decoding for Hallucination-Resistant Multimodal Large Language Models

因果解码用于抗幻觉的多模态大语言模型

Shiwei Tan, Hengyi Wang, Weiyi Qin, Qi Xu, Zhigang Hua, Hao Wang

机构 * Rutgers University(新泽西罗格斯大学) Meta Ranking AI(Meta 排名人工智能)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出因果解码框架,通过针对性干预减少多模态大语言模型中的物体幻觉,提升响应的准确性和忠实度。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22548 2026-02-26 cs.CV cs.RO 70%

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

JanusVLN: 通过双隐式记忆解耦语义与空间性用于视觉-语言导航

Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 JanusVLN通过双隐式记忆解耦语义与空间性,提升视觉-语言导航的性能和效率。

Comments Accepted to ICLR 2026. Project page: https://miv-xjtu.github.io/JanusVLN.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22144 2026-02-26 cs.CV cs.AI cs.CL 67%

NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors

NoLan: 通过动态抑制语言先验来缓解大视觉-语言模型中的对象幻觉

Lingfeng Ren, Weihao Yu, Runpeng Yu, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学) Peking University Shenzhen Graduate School, China(北京大学深圳研究生院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 NoLan通过动态抑制语言先验缓解大视觉-语言模型中的对象幻觉问题,有效提升模型准确性。

Comments Code: https://github.com/lingfengren/NoLan

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03594 2026-02-26 cs.CV 57%

TIPS Over Tricks: Simple Prompts for Effective Zero-shot Anomaly Detection

TIPS Over Tricks: 简单提示用于有效的零样本异常检测

Alireza Salehi, Ehsan Karami, Sepehr Noey, Sahand Noey, Makoto Yamada, Reshad Hosseini, Mohammad Sabokrou

机构 * University of Tehran(塔里哈大学) Amirkabir University of Technology(阿米尔卡比尔技术大学) Okinawa Institute of Science and Technology(冲绳科学技术大学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出TIPS模型,通过改进的backbone和解耦提示策略,在无需复杂模块的情况下提升零样本异常检测的图像和像素级性能。

Comments This is the extended version of the paper accepted in ICASSP'26, which will be publicly available in May. Authors' contributions may vary among the versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV 57%

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19610 2026-02-26 cs.CV 57%

JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models

JailBound: 视觉语言模型内部安全边界的劫持

Jiaxin Song, Yixu Wang, Jie Li, Rui Yu, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xuan Tong(宣通) NSFOCUS

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21619 2026-02-26 cs.CL 57%

When More Is Less: A Systematic Analysis of Spatial and Commonsense Information for Visual Spatial Reasoning

更多未必更好:对视觉空间推理中空间与常识信息的系统分析

Muku Akasaka, Soyeon Caren Han

机构 * The University of Melbourne(墨尔本大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过系统分析发现,过多信息未必提升视觉空间推理性能,针对性单空间提示和精确空间定位可提高准确性。

Comments 5 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2602.22131 2026-02-26 cs.HC 50%

Giving Meaning to Movements: Challenges and Opportunities in Expanding Communication by Pairing Unaided AAC with Speech Generated Messages

为动作赋予意义:通过将无辅助AAC与语音生成信息结合扩展沟通的挑战与机遇

Imran Kabir, Sharon Ann Redmon, Lynn R Elko, Kevin Williams, Mitchell A Case, Dawn J Sowers, Krista Wilkinson, Syed Masum Billah

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出AllyAAC系统,通过结合无辅助AAC与语音生成信息,解决个性化肢体动作识别挑战,提升沟通效率与可理解性。

Comments To appear in Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2511.11910 2026-02-26 cs.CV 79%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00288 2026-02-26 cs.CV cs.AI 73%

TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

TimeBlind: 一种用于视频大语言模型的时空组合性基准

Baiqi Li, Kangyi Zhao, Ce Zhang, Chancharik Mitra, Jean de Dieu Nyandwi, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。

Comments For code and data, see https://baiqi-li.github.io/timeblind_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22026 2026-02-26 cs.CV cs.AI 62%

RGB-Event HyperGraph Prompt for Kilometer Marker Recognition based on Pre-trained Foundation Models

基于预训练基础模型的RGB-Event超图提示用于基于预训练基础模型的公里标识别

Xiaoyu Xian, Shiao Wang, Xiao Wang, Daxin Tian, Yan Tian

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) CRRC Academy Co., Ltd(CRRC研究院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于预训练基础模型的RGB-Event超图提示方法,构建首个大规模RGB-Event数据集EvMetro5K,用于提升地铁公里标识别性能。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems (IEEE TCDS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22142 2026-02-26 cs.CV 57%

WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs

WeaveTime: 从早期帧中流式传输以形成涌现记忆在视频LLMs中

Yulin Zhang, Cheng Shi, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算科学与数据科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 WeaveTime通过引入时间重建目标和动态关注缓存,提升视频LLMs在流式场景中的时间感知能力,减少延迟并提高准确性。

Comments Accepted at CVPR 2026 (preview; camera-ready in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21684 2026-02-26 cs.RO cs.LG 50%

Primary-Fine Decoupling for Action Generation in Robotic Imitation

动作生成中的主-细分离

Xiaohan Lei, Min Wang, Wengang Zhou, Xingyu Lu, Houqiang Li

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 PF-DAG通过两阶段框架实现动作生成中的主-细分离,提升机器人模仿学习的多模态建模与闭环控制性能。

Comments The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2602.06034 2026-02-26 cs.CV 83%

V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval

V-Retrver: 以证据驱动的代理推理用于通用多模态检索

Dongyang Chen, Chaoyang Wang, Dezhao Su, Xi Xiao, Zeyu Zhang, Jing Xiong, Qing Li, Yuzhang Shang, Shichao Kan

机构 * Tsinghua University(清华大学) University of Central Florida(中央佛罗里达大学) Fudan University(复旦大学) The Australian National University(澳大利亚国立大学) The University of Hong Kong(香港大学) Pengcheng Laboratory(鹏城实验室) Central South University(中南大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 V-Retrver通过引入证据驱动的代理推理机制,提升多模态检索的准确率和推理可靠性。

Comments Project page: https://github.com/chendy25/V-Retrver

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 12 篇

2503.05236 2026-02-26 cs.CV 79%

Unified Reward Model for Multimodal Understanding and Generation

多模态理解和生成的统一奖励模型

Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。

Comments project page: https://codegoat24.github.io/UnifiedReward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21319 2026-02-26 cs.LG cs.CV cs.RO 79%

Uncertainty-Aware Diffusion Model for Multimodal Highway Trajectory Prediction via DDIM Sampling

面向多模态高速公路轨迹预测的不确定性感知扩散模型 via DDIM采样

Marion Neumeier, Niklas Roßberg, Michael Botsch, Wolfgang Utschick

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出cVMDx模型,通过DDIM采样提升效率和鲁棒性,实现高效多模态轨迹预测并增强不确定性估计能力。

Comments Accepted as a conference paper in IEEE Intelligent Vehicles Symposium (IV) 2026, Detroit, MI, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11627 2026-02-26 cond-mat.str-el cond-mat.mes-hall cond-mat.mtrl-sci 78%

Dynamic competition between phason and amplitudon observed by ultrafast multimodal scanning tunneling microscopy

相位振荡与振幅波之间的动态竞争通过超快多模扫描隧道显微镜观测

Seokjin Bae, Arjun Raghavan, Soyeun Kim, Kejian Qu, Chengxi Zhao, Daniel P. Shoemaker, Ziqiang Wang, Fahad Mahmood, Barry Bradlyn, Vidya Madhavan

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 通过超快多模扫描隧道显微镜观测到相位振荡与振幅波之间的动态竞争,揭示了量子材料中集体激发的生成与灭绝机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21472 2026-02-26 cs.LG 67%

The Design Space of Tri-Modal Masked Diffusion Models

三模态掩码扩散模型的设计空间

Louis Bethune, Victor Turrisi, Bruno Kacper Mlodozeniec, Pau Rodriguez Lopez, Lokesh Boominathan, Nikhil Bhendawade, Amitis Shidani, Joris Pelemans, Theo X. Olausson, Devon Hjelm, Paul Dixon, Joao Monteiro, Pierre Ablin, Vishnu Banna, Arno Blaas, Nick Henderson, Kari Noriy, Dan Busbridge, Josh Susskind, Marco Cuturi, Irina Belousova, Luca Zappella, Russ Webb, Jason Ramapuram

机构 * Apple(苹果公司) Google Deepmind(谷歌DeepMind) University of Cambridge(剑桥大学) MIT(麻省理工学院)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract)

AI总结 本文提出了一种从头开始预训练的三模态掩码扩散模型,通过分析多模态扩展定律和批大小效应,实现了优化的推理采样,并在文本生成、图像生成和语音生成任务中取得了显著成果。

Comments 41 pages, 29 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18022 2026-02-26 cs.CV cs.AI 62%

Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers

双通道注意力引导用于扩散变换器中无需训练的图像编辑控制

Guandong Li

机构 * iFLYTEK

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双通道注意力引导方法,通过同时操控键通道和值通道实现无需训练的图像编辑控制,显著提升编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21631 2026-02-26 cs.CV 57%

UniHand: A Unified Model for Diverse Controlled 4D Hand Motion Modeling

UniHand:一种统一模型,用于多样可控的4D手部运动建模

Zhihao Sun, Tong Wu, Ruirui Tu, Daoguo Dong, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究所) Fudan University(复旦大学) Stanford University(斯坦福大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 UniHand通过统一的扩散框架,将手部运动估计与生成统一为条件运动合成,有效整合异构输入并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21596 2026-02-26 cs.CV 57%

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

扩散变换器条件嵌入中的隐藏语义瓶颈

Trung X. Pham, Kang Zhang, Ji Woo Hong, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究揭示扩散变换器条件嵌入中的语义瓶颈,发现语义信息集中于少量维度,通过剪枝提升生成质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21461 2026-02-26 cs.CL 57%

VecGlypher: Unified Vector Glyph Generation with Language Models

VecGlypher: 一种基于语言模型的统一向量图形单元生成方法

Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han

机构 * Meta AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 VecGlypher通过多模态语言模型直接生成高质量向量图形,无需位图中间步骤,显著提升字体创建效率和可编辑性。

Comments Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21416 2026-02-26 cs.CV 57%

WildSVG: Towards Reliable SVG Generation Under Real-Word Conditions

WildSVG:迈向真实世界条件下可靠的SVG生成

Marco Terral, Haotian Zhang, Tianyang Zhang, Meng Lin, Xiaoqing Xie, Haoran Dai, Darsh Kaushik, Pai Peng, Nicklas Scharpff, David Vazquez, Joan Rodriguez

机构 * QuiverAI Columbia University(哥伦比亚大学) Illinois Institute of Technology(伊利诺伊理工学院) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ServiceNow Research(ServiceNow研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 WildSVG通过引入现实世界基准测试,揭示了现有多模态模型在真实场景下生成SVG的不足,并指出了改进方向。

Comments 10 pages, 6 pages of additional material

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03255 2026-02-26 cs.LG cs.AI 57%

SciTS: Scientific Time Series Understanding and Generation with LLMs

SciTS: 基于大语言模型的科学时间序列理解与生成

Wen Wu, Ziyang Zhang, Liwei Liu, Xuenan Xu, Jimin Zhuang, Ke Fan, Qitan Lv, Junlin Liu, Chen Zhang, Zheqi Yuan, Siyuan Hou, Tianyi Lin, Kai Chen, Bowen Zhou, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 SciTS提出了一种基于LLM的科学时间序列理解与生成框架,通过基准测试发现通用LLM在泛化能力上优于专门模型,并引入TimeOmni框架提升性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21983 2026-02-26 cs.RO 50%

Humanizing Robot Gaze Shifts: A Framework for Natural Gaze Shifts in Humanoid Robots

使机器人目光转移人性化:一种在人形机器人中实现自然目光转移的框架

Jingchao Wei, Jingkai Qin, Yuxiao Cao, Jingcheng Huang, Xiangrui Zeng, Min Li, Zhouping Yin

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(机械科学与工程学院,华中科技大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出RGS框架,通过结合认知注意力机制与生物模仿运动生成,实现人形机器人自然且上下文合适的人类化目光转移。

Comments submitted to AIM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21427 2026-02-26 cs.LG cs.RO 50%

Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning

基于流的单步完成:用于高效且表达性的策略学习

Prajwal Koirala, Cody Fleming

机构 * Iowa State University(爱荷华州立大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 SSCP是一种基于流的单步完成策略,通过增强的流匹配目标实现高效且表达性的策略学习,适用于多种RL场景。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2602.21854 2026-02-26 cs.CL 83%

FewMMBench: A Benchmark for Multimodal Few-Shot Learning

FewMMBench: 一种多模态少样本学习的基准测试

Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

机构 * Aselsan Research(阿塞利桑研究)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 FewMMBench是一个用于评估多模态少样本学习能力的基准测试,通过系统分析不同任务类型、模型家族和提示策略,揭示指令调优模型在零样本性能上的优势及CoT推理的局限性。

Comments Preprint. 49 pages, 38 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21225 2026-02-26 cs.CL cs.AI cs.LG 81%

Architecture-Agnostic Curriculum Learning for Document Understanding: Empirical Evidence from Text-Only and Multimodal

文档理解的架构无关课程学习:来自纯文本和多模态的实证证据

Mohammed Hamdan, Vincenzo Dentamaro, Giuseppe Pirlo, Mohamed Cheriet

机构 * 1 Synchromedia Laboratory, \' E cole de Technologie Sup\' e rieure (\' E TS), 1100 Notre-Dame St W, Montreal, QC H3C 1K3, Canada 2 Department of Computer Science, University of Bari Aldo Moro, Via Orabona 4, 70125 Bari, Italy

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过实验证明,渐进式数据调度在文档理解任务中能有效提升效率,尤其在容量受限模型中表现显著,但多模态模型因具备充足归纳偏置而未获明显收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 81%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏