arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-28 至 2026-04-28 共收录 108 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 11 篇

2603.14882 2026-04-28 cs.CV 87%

LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models

LLMind: 基于生物启发的无训练自适应视觉表示用于视觉-语言模型

Soumyaratna Debnath, Bui Duc Manh, Zinan Liu, Lin Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 LLMind通过生物启发的自适应采样策略,实现视觉-语言模型在有限像素预算下的高效自适应表示,实验显示在多个基准测试中性能显著提升。

Comments CVPR 2026, Highlight, 10 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22884 2026-04-28 cs.CV cs.AI 86%

Can Multimodal Large Language Models Truly Understand Small Objects?

多模态大语言模型真的能理解小物体吗?

Fujun Han, Junan Chen, Xintong Zhu, Jingqi Ye, Xuanjie Mao, Tao Chen, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。

Comments Under Peer Review (26 pages, 9 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14837 2026-04-28 cs.CL 85%

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn)

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10185 2026-04-28 cs.CV 83%

Detecting and Evaluating Medical Hallucinations in Large Vision Language Models

在大型视觉语言模型中检测和评估医学幻觉

Jiawei Chen, Dingkang Yang, Tong Wu, Yue Jiang, Xiaolu Hou, Mingcheng Li, Shunli Wang, Dongling Xiao, Ke Li, Lihua Zhang

机构 * Academy for Engineering and Technology, Fudan University(复旦大学工程与技术学院) Tencent Youtu Lab(腾讯优图实验室) Cognition and Intelligent Technology Laboratory(认知与智能技术实验室)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出Med-HallMark基准,用于医疗多模态领域中的幻觉检测与评估,引入MediHall Score和MediHallDetector,通过多任务训练提升模型可靠性,实验表明其在医疗应用中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19482 2026-04-28 cs.CV 83%

Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following

无需指令的大型视觉语言模型在医疗指令遵循中的调优

Myeongkyun Kang, Soopil Kim, Xiaoxiao Li, Sang Hyun Park

机构 * Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Department of Robotics and Mechatronics Engineering, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院机器人与机电工程系) Division of Intelligent Robot, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院智能机器人系) Vector Institute(向量研究所) Department of Computer Science and Engineering, Pohang University of Science and Technology (POSTECH)(釜山科学技术大学计算机科学与工程系)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出无需指令的调优方法,利用图像描述对训练模型,提升医疗领域视觉语言模型的指令遵循能力,实现多选视觉问答任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05318 2026-04-28 cs.CV cs.AI 82%

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

mKG-RAG:利用多模态知识图谱在检索增强生成中进行知识密集型视觉问答

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出mKG-RAG框架,通过整合多模态知识图谱提升检索增强生成在知识密集型视觉问答中的性能,采用双阶段检索策略和图提取方法构建高质量知识图谱,实验表明优于现有方法。

Comments In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR'26), July 20-24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05970 2026-04-28 cs.CV cs.AI cs.CL 79%

PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling

PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样

Xudong Xie, Hao Yan, Liang Yin, Yang Liu, Jing Ding, Minghui Liao, Yuliang Liu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。

Comments Accepted by International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23276 2026-04-28 cs.CV cs.AI cs.CL 62%

Lightweight and Production-Ready PDF Visual Element Parsing

轻量且适用于生产的PDF视觉元素解析

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li

机构 * Oracle AI

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级PDF解析框架,通过空间启发式、布局分析和语义相似性结合,实现高准确率的视觉元素检测与标题关联,提升多模态RAG检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23665 2026-04-28 cs.CV 57%

HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA

HAC: CLIP在零样本视觉问答中的高效超几何适应

Francesco Dibitonto, Cigdem Beyan, Vittorio Murino

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) EVS - Embedded Vision Systems Srl(嵌入式视觉系统公司) AI for Good (AIGO), Istituto Italiano di Tecnologia(AI for Good(AIGO),意大利技术研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 HAC通过轻量级微调使预训练CLIP模型迁移到超几何空间,用于视觉问答任务,展现出任务无关的适应能力,在多个基准上超越欧几里得基线和先前超几何方法。

Comments This is the preprint version of the paper. The final version has been accepted for publication in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 50%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13312 2026-04-28 cs.CL cs.IR 50%

ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering

ChatR1: 基于强化学习的对话推理与检索增强问答

Simon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 ChatR1通过强化学习实现对话问答中的推理与检索增强,通过意图感知奖励提升多轮对话性能,优于多个基准数据集。

Comments 18 pages, 9 figures, Main ACL 2026 Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, July 2--7, 2026, San Diego, California

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 19 篇

2604.24339 2026-04-28 cs.CV cs.AI 91%

See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

看得更远,想得更深:通过低级视觉线索和反思提升VLM的推理能力

Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :VLM(title,title_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ForeSight框架,通过低级视觉线索和有效视觉反馈提升VLM推理能力,构建新数据集CG-SalBench,并验证其在参数规模相同和部分指标上优于现有SOTA模型。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24300 2026-04-28 cs.CV 91%

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

ReVSI:重建视觉空间智能评估以准确评估VLM 3D推理

Yiming Zhang, Jiacheng Chen, Jiaqi Tan, Yongsen Mao, Wenhu Chen, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science(香港科学大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所(Amii))

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 ReVSI通过改进数据质量和评估可控性,解决现有空间智能评估在VLM 3D推理中的系统性失效问题,提供更可靠的诊断评估。

Comments Project Page: https://3dlg-hcvc.github.io/revsi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23934 2026-04-28 eess.SY cs.SY 90%

VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions

VLM-VPI:一种用于改进自动驾驶车辆-行人交互的视觉语言推理框架

Qingwen Pu, Kun Xie, Yuxiang Liu

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract)

AI总结 本文提出VLM-VPI框架,结合多模态感知、视觉场景理解和意图推理,提升自动驾驶中行人意图识别和安全控制,实验证明其在安全性和效率上的提升。

Comments 40 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08592 2026-04-28 cs.CV 89%

Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations

通过几何参考的3D场景表示提升MLLM空间推理能力

Jiangye Yuan, Gowri Kumar, Baoyuan Wang

机构 * Zillow Group(智域集团)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出几何参考3D场景表示GR3D,使MLLM能利用语言能力处理3D空间,无需额外训练,在空间推理基准中提升GPT-5性能9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19652 2026-04-28 cs.CV 85%

Self-Rewarding Vision-Language Model via Reasoning Decomposition

通过推理分解实现自奖励视觉-语言模型

Zongxia Li, Wenhao Yu, Chengsong Huang, Zhenwen Liang, Rui Liu, Fuxiao Liu, Jingxi Che, Dian Yu, Jordan Boyd-Graber, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Maryland(马里兰大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出Vision SR1,通过分解视觉与语言推理,提升视觉推理能力,减少视觉幻觉和语言捷径依赖,效率优于需外部视觉奖励模型的方法。

Comments 16 pages, two figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10362 2026-04-28 cs.CV cs.AI 81%

Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models

视觉漏斗:缓解多模态大语言模型中的上下文盲区

Woojun Jung, Jaehoon Go, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of AI, Chung-Ang University(Chung-Ang 大学人工智能系)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉漏斗方法,通过上下文锚定和熵缩放投资组合缓解多模态大语言模型中的上下文盲区问题,通过动态调整裁剪尺寸和中心点,提升视觉细节与全局上下文的关联性。

Comments Accepted to CVPR 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24443 2026-04-28 cs.AI 79%

PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记

Sinin Zhang, Yunfei Xie, Yuxuan Cheng, Haoyu Zhang, Tong Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Rice University(里奇大学) City University of Hong Kong(香港城市大学) Fudan University(复旦大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。

Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17411 2026-04-28 cs.RO cs.LG 77%

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1:通过3D理解超越机器人演示

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

机构 * INSAIT

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出SPEAR-1,通过融合3D感知与语言指导的具身控制,提升机器人基础模型的泛化能力,使用20倍少的机器人演示数据在24个Open X-Embodiment数据集上训练,超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24191 2026-04-28 cs.CV 74%

Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

Omni-o3:深度嵌套多模态推理用于 deliberative 音视频推理

Zhicheng Zhang, Wentao Gu, Weicheng Wang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

AI总结 Omni-o3通过深度嵌套推理策略,解决多模态交互中搜索空间大且冗余的问题,提升音视频推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV 70%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI 70%

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07605 2026-04-28 cs.CV cs.AI 62%

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

Fine-R1: 通过链式推理使多模态大语言模型在细粒度视觉识别中脱颖而出

Hulingxiao He, Zijun Geng, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Fine-R1通过链式推理监督微调和三元组增强策略优化,提升多模态大语言模型在细粒度视觉识别中的表现,仅用4次训练即超越现有模型。

Comments Published as a conference paper at ICLR 2026. The models are available at https://huggingface.co/collections/StevenHH2000/fine-r1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM 62%

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23348 2026-04-28 cs.CV cs.AI 62%

EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试

He Hu, Tengjin Weng, Zebang Cheng, Yu Wang, Jiachen Luo, Björn Schuller, Zheng Lian, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Queen Mary University of London(女王学院伦敦大学) Technical University of Munich(慕尼黑技术大学) Imperial College London(伦敦帝国学院) Tongji University(同济大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 EmoTrans旨在评估多模态视频中情感动态理解能力,包含1000个手工标注的视频片段和3000多个任务特定问题-答案对,通过四个任务形成从粗粒度检测到深度推理的评估框架,发现当前大语言模型在细粒度情感动态建模上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI 62%

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24645 2026-04-28 cs.CL cs.AI 57%

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

K-MetBench:一个多维基准,用于细粒度评估气象学中的专家推理、局部性和多模态能力

Soyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI Kongju National University(康久国立大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 本文提出K-MetBench,一个基于韩国资格考试的多维基准,揭示了专家推理、逻辑有效性、韩国地理文化理解及领域分析四个维度的差距,发现韩国模型在本地情境中优于大模型。

Comments 39 pages, 32 figures, 14 tables, including appendices. Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24512 2026-04-28 cs.AI 57%

Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols

超越注意力稳定性边界:代理自我合成推理协议

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出SSRP框架,通过分离高层规划与执行流程,解决多轮对话中注意力锁定问题,实验显示其在多任务中显著提升稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16046 2026-04-28 cs.RO cs.CV 57%

DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

DextER:基于语言的灵巧抓取生成与具身推理

Junha Lee, Eunha Park, Minsu Cho

机构 * Pohang University of Science and Technology(釜山科学技术大学) RLWRLD

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 DextER通过具身推理生成灵巧抓取,结合任务语义与物理约束,提升抓取成功率与意图对齐度。

Comments CVPR 2026, Project page: https://junha-l.github.io/dexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23072 2026-04-28 cs.AI 57%

Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis

分析:用于稳健和可扩展的LLM驱动分析的软命题推理

Junyan Cheng, Kyle Richardson, Peter Chin

机构 * Dartmouth College(达特茅斯学院) Allen Institute for AI(人工智能研究院)

专题命中 视觉推理 :grounding(abstract_cn);分类 cs.AI

AI总结 本文提出Analytica,一种基于软命题推理的新型代理架构,通过并行分治框架减少误差,提升LLM在金融、科学等领域的预测准确性与稳定性。

Comments ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏