arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-04 至 2026-03-04 共收录 52 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2603.02438 2026-03-04 cs.CV 83%

ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering

ORCA:用于文档视觉问答的协作代理协同推理

Aymen Lassoued, Mohamed Ali Souibgui, Yousri Kessentini

机构 * Digital Research Center of Sfax, SMARTS Laboratory(突尼斯斯法克斯数字研究中心,SMARTS实验室) École Polytechnique de Tunisie, University of Carthage(突尼斯理工学院,卡塔赫纳大学) Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 ORCA通过协作代理协同推理提升文档视觉问答的复杂推理与多步骤工作流处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13139 2026-03-04 cs.CV cs.CL 79%

Multimodal Integration of Human-Like Attention in Visual Question Answering

多模态人类样注意机制在视觉问答中的整合

Ekta Sood, Fabian Kögel, Philipp Müller, Dominike Thomas, Mihai Bace, Andreas Bulling

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 MULAN通过整合文本和图像显著性模型的注意预测,提升了VQA模型的性能,同时减少参数数量,达到新的准确率水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13116 2026-03-04 cs.CV cs.CL 79%

VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering

VQA-MHUG:一个用于研究视觉问答中多模态神经注意机制的注视数据集

Ekta Sood, Fabian Kögel, Florian Strohm, Prajit Dhar, Andreas Bulling

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 VQA-MHUG数据集用于研究视觉问答中多模态神经注意机制,发现文本注意与模型性能的相关性是提升VQA性能的关键因素。

Comments CoNLL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13251 2026-03-04 cs.CV 70%

Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs

映射流:揭示视频大语言模型中的隐藏信息路径

Minji Kim, Taekyung Kim, Bohyung Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本研究通过机理可解释性技术揭示视频大语言模型中信息流的隐藏路径,展示了时间推理机制及提升模型可解释性和泛化能力的贡献。

Comments ICLR 2026, 32 pages, 39 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 18 篇

2505.13180 2026-03-04 cs.AI 87%

ViPlan: A Benchmark for Visual Planning with Symbolic Predicates and Vision-Language Models

ViPlan:一个用于视觉规划的基准,结合符号谓词和视觉-语言模型

Matteo Merler, Nicola Dainese, Minttu Alakuijala, Giovanni Bonetta, Pietro Ferrazzi, Yu Tian, Bernardo Magnini, Pekka Marttinen

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系) Department of Mathematics, Università degli Studi di Padova(帕多瓦大学数学系)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 ViPlan是一个用于视觉规划的基准,比较基于VLMs的符号方法与直接VLM规划方法,发现不同方法在不同任务中的表现差异。

Comments 8 pages, 5 figures and 1 table in the main text; 50 pages, 16 figures and 19 tables including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02556 2026-03-04 cs.CV cs.AI cs.CL cs.LG 85%

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

通过对比的视角:VLMs中的自改进视觉推理

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Cloud(阿里云)

专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 通过视觉对比提升VLMs的推理能力,提出VC-STaR框架,有效减少推理幻觉并提升多种VLMs的视觉推理性能。

Comments 19 pages, 9 figures, accepted to ICLR 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05612 2026-03-04 cs.LG cs.AI 84%

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Shuffle-R1: 通过数据导向的动态洗牌提升多模态大语言模型的强化学习框架

Linghao Zhu, Yiran Guan, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Bin Qin, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 Shuffle-R1通过动态洗牌和轨迹采样提升多模态大语言模型的强化学习效率,实现更高效的训练效果。

Comments This paper has been accepted by ICLR 2026. Conference link: https://iclr.cc/virtual/2026/poster/10007559 OpenReview link: https://openreview.net/forum?id=mYP33u1QBK Project page at: https://xenozlh.github.io/Shuffle-R1/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL 82%

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract)

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02865 2026-03-04 cs.CL cs.CV 79%

Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models

节点早于边,边晚于节点:在大规模视觉-语言模型中探测图表示

Haruto Yoshida, Keito Kudo, Yoichi Aoki, Ryota Tanaka, Itsumi Saito, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东大大学) Human Informatics Labs.(人文学信息实验室) NTT, Inc.(NTT公司)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究发现大规模视觉-语言模型在处理图结构时,节点信息早于边信息被线性编码,导致模型在理解边关系时存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07218 2026-03-04 cs.LG cs.AI cs.CV 75%

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力

Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV 70%

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00438 2026-03-04 cs.CV 70%

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave:通过跨模态整合实现主体一致的视频生成

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance(字节跳动) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 BindWeave通过跨模态整合解决主体一致视频生成难题,利用MLLM-DiT框架提升生成视频的主体一致性和自然度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02662 2026-03-04 cs.HC 67%

Behavior-Aware Anthropometric Scene Generation for Human-Usable 3D Layouts

面向人类可用性的行为感知场景生成

Semin Jin, Donghyuk Kim, Jeongmin Ryu, Kyung Hoon Hyun

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种行为感知的体格场景生成框架,通过结合视觉-语言模型和用户体格数据,提升3D布局的人体可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03241 2026-03-04 cs.CV cs.AI 62%

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02557 2026-03-04 cs.CV cs.AI 62%

CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment

CAPT:基于混淆的提示微调以减少视觉-语言不一致

Maoyuan Shao, Yutong Gao, Xinyang Huang, Chuang Zhu, Lijuan Sun, Guoshun Nan

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Library of China, Beijing, China(中国国家图书馆) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络安全学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CAPT通过引入混淆感知的提示微调框架,有效减少视觉-语言模型中的混淆误差,提升模型判别能力和泛化性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16654 2026-03-04 cs.CV 57%

Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?

视觉-语言模型是否准备好在自动驾驶中具备车道拓扑意识?

Xin Chen, Jia He, Maozheng Li, Dongliang Xu, Tianyu Wang, Yixiao Chen, Zhixin Lin, Yue Yao

机构 * Shandong University(山东大学) MBZUAI Sems

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文评估了VLMs在自动驾驶中理解道路拓扑结构的能力,发现尽管闭源模型在部分任务表现良好,但空间推理仍是其主要瓶颈,且模型规模和推理令牌数量对性能有显著影响。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02663 2026-03-04 cs.CL cs.CV 57%

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

利用多模态项目反应理论评估跨模态推理能力与问题特征

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi

机构 * Kyoto University(京都大学) CyberAgent The Institute of Statistical Mathematics(统计数学研究所) Tohoku University(东北大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 M3IRT通过分解模型能力和项目难度,提供了一种评估多模态推理能力的框架,有效提升基准测试的可靠性和质量。

Comments 24pages, 20 figures, accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02658 2026-03-04 cs.CV 57%

OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning

OmniFashion: 通过多任务视觉-语言学习实现通用时尚智能

Zhengwei Yang, Andi Long, Hao Li, Zechao Hu, Kui Jiang, Zheng Wang

机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心、人工智能研究院、计算机科学学院、武汉大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 OmniFashion通过多任务视觉-语言学习,构建百万级时尚数据集,实现统一的时尚对话范式,提升多任务推理和交互能力,推动通用时尚智能发展。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02635 2026-03-04 cs.LG 57%

SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety

SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理

Zixuan Xu, Tiancheng He, Huahui Yi, Kun Wang, Xi Chen, Gongli Xi, Qiankun Li, Kang Li, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02623 2026-03-04 cs.RO cs.LG 57%

Uni-Skill: Building Self-Evolving Skill Repository for Generalizable Robotic Manipulation

Uni-Skill:构建通用机器人操作的自演化技能库

Senwei Xie, Yuntian Zhang, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS(中国科学院人工智能安全重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.LG

AI总结 Uni-Skill通过自演化技能库提升机器人操作的通用性与适应性,实现高效技能检索与少样本推理。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02212 2026-03-04 cs.DB cs.AI 57%

GLEAN: Grounded Lightweight Evaluation Anchors for Contamination-Aware Tabular Reasoning

GLEAN:面向抗污染的轻量级评估锚点用于表格推理

Qizhi Wang

机构 * Data \& AI-Innovation Lab, PingCAP, Beijing, China

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 GLEAN提出了一种轻量级评估方法,通过整合污染感知探测器和结构化错误归因,提升小型模型在表格推理任务中的抗污染和诊断能力。

Comments 8 pages, 6 figures for the main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02099 2026-03-04 cs.CL 50%

Recursive Think-Answer Process for LLMs and VLMs

递归思考-回答过程用于LLMs和VLMs

Byung-Kwan Lee, Youngchae Chee, Yong Man Ro

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出递归思考-回答过程(R-TAP)以提升LLMs和VLMs的推理准确性,通过置信度生成器和双奖励机制实现迭代推理,减少错误输出并提高推理稳定性。

Comments CVPR 2026 Findings, Project page: https://litcoderr.github.io/rtap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 11 篇

2603.02329 2026-03-04 cs.CV 89%

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。

Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03101 2026-03-04 cs.LG cs.AI cs.CV 82%

ALARM: Automated MLLM-Based Anomaly Detection in Complex-EnviRonment Monitoring with Uncertainty Quantification

ALARM: 基于多模态大语言模型的复杂环境监控异常检测与不确定性量化

Congjing Zhang, Feng Lin, Xinyi Zhao, Pei Guo, Wei Li, Lin Chen, Chaoyue Zhao, Shuai Huang

机构 * Department of Industrial and Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) Wyze Labs, Inc.(Wyze实验室)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ALARM通过结合不确定性量化与多模态大语言模型,实现了复杂环境中的异常检测,展现出在不同领域中的高准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02484 2026-03-04 cs.RO math.OC 78%

COLREGs Compliant Collision Avoidance and Grounding Prevention for Autonomous Marine Navigation

自主水运船舶的碰撞规避与搁浅预防:符合国际海上避碰规则

Mayur S. Patil, Nataraj Sudharsan, Veneela Ammula, Jude Tomdio, Jin Wang, Michael Kei, Sivakumar Rathinam, Prabhakar R. Pagilla

机构 * Department of Mechanical Engineering, Texas A&M University, College Station, USA(德克萨斯A&M大学机械工程系) American Bureau of Shipping, Spring, TX, USA(美国船舶局)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文提出了一种基于凸优化的运动规划方法,用于自主水运船舶的碰撞规避、COLREGs合规性和搁浅预防。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02754 2026-03-04 cs.CV 70%

Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing

无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉

Yi Liu, Jing Zhang, Di Wang, Xiaoyu Tian, Haonan Guo, Bo Du

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) School of Computer Science, Chongqing University, China(重庆大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02519 2026-03-04 cs.MM cs.IR 67%

Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling

具有自适应测试时间缩放的代理混合源多模态虚假信息检测

Wei Jiang, Tong Chen, Wei Yuan, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 AgentM3D通过自适应测试时间缩放和多代理框架提升零样本多模态虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14572 2026-03-04 cs.LG cs.AI 62%

Robust Weight Imprinting: Insights from Neural Collapse and Proxy-Based Aggregation

鲁棒性权重印刻:来自神经坍缩和基于代理的聚合的见解

Justus Westerhoff, Golzar Atefi, Mario Koddenbrock, Alexei Figueroa, Alexander Löser, Erik Rodner, Felix A. Gers

机构 * DATEXIS, Berliner Hochschule für Technik (BHT), Germany(DATEXIS,柏林技术学院(BHT)) KI-Werkstatt, University of Applied Sciences Berlin, Merantix Momentum, Germany(KI工作室,柏林应用技术大学,Merantix Momentum) Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术与经济高等学院(HTW))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出IMPRINT框架,通过神经坍缩现象和代理聚合改进迁移学习,实现4%的性能提升。

Journal ref Transactions on Machine Learning Research (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02924 2026-03-04 cs.CV 57%

HDINO: A Concise and Efficient Open-Vocabulary Detector

HDINO:一种简洁且高效的开放词汇检测器

Hao Zhang, Yiqun Wang, Qinran Lin, Runze Fan, Yong Li

机构 * Chongqing University(重庆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 HDINO提出了一种简洁高效的开放词汇检测方法,通过两阶段训练策略和轻量级特征融合模块,在无需人工数据编纂的情况下实现了优于现有方法的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02896 2026-03-04 cs.CV 57%

3D-DRES: Detailed 3D Referring Expression Segmentation

3D-DRES: 详细3D指称表达分割

Qi Chen, Changli Wu, Jiayi Ji, Yiwei Ma, Liujuan Cao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 3D-DRES通过引入DetailRefer数据集和DetailBase架构,提升3D视觉语言理解的细粒度分割能力。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏