arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-21 至 2026-04-21 共收录 38 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 38 篇

2604.16871 2026-04-21 cs.AI cs.LG 90%

GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning

GRAIL:自主概念 grounding 用于神经符号强化学习

Hikaru Shindo, Henri Rößler, Quentin Delfosse, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) Google Intrinsic(谷歌内在) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI、cs.LG

AI总结 GRAIL通过环境交互自主 grounding 关系概念,利用大语言模型提供弱监督,提升在稀疏奖励和概念对齐问题中的性能,实验显示其在Atari游戏中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16517 2026-04-21 cs.CV cs.CL 89%

SmoGVLM: A Small, Graph-enhanced Vision-Language Model

SmoGVLM:一种小型、图增强的视觉-语言模型

Debjyoti Mondal, Rituraj Singh, Subhadarshi Panda

机构 * Samsung R\&D Institute India-Bangalore

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SmoGVLM,一种结合图神经网络的视觉-语言模型,通过结构化知识提升小规模多模态推理性能,实验表明小型模型性能提升达16.24%。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18575 2026-04-21 cs.CV 83%

ReCap: Lightweight Referential Grounding for Coherent Story Visualization

ReCap:轻量级指代 grounding 以实现连贯故事可视化

Aditya Arora, Akshita Gupta, Pau Rodriguez, Marcus Rohrbach

机构 * 1 Technical University of Darmstadt \& hessian.AI, Germany -2em

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 ReCap 提出一种轻量级框架,通过视觉锚点提升角色稳定性与视觉一致性,无需修改基础扩散模型,在两个故事可视化基准上取得新高。

Comments Diffusion Models, Story Visualization

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17354 2026-04-21 cs.CL cs.CV 83%

More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage

超越表象:通过语义锚定测量视觉语言模型中的象征性差距

Wei He

机构 * IDSAI, University of Exeter(IDSAI研究所,埃克塞特大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 研究通过引入DIVA基准测试,探讨高视觉保真度是否干扰视觉抽象中的隐喻构成性,提出语义对齐差距和方向偏置指标,发现模型规模无法解决字面偏好,高保真度导致象征性对齐减弱。

Comments 16 pages, 4 figures. Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17126 2026-04-21 cs.CV 83%

Prompt Sensitivity in Vision-Language Grounding: How Small Changes in Wording Affect Object Detection

视觉-语言接地中的提示敏感性:语言表述的微小变化如何影响目标检测

Dawar Jyoti Deka, Amit Sethi, Syed Mohammad Ali

机构 * Department of Aerospace Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校航空航天工程系) Department of Electrical Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校电气工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究通过控制实验发现,不同表述的提示会导致目标检测结果不稳定,且这种不稳定性源于argmax选择机制而非文本距离。

Comments 5 pages, 9 figures, 1 table. Accepted at ICCAI 2026 (The 12th International Conference on Computing and Artificial Intelligence), Okinawa, Japan, April 24-27, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18096 2026-04-21 cs.HC cs.AI cs.IR cs.LG 82%

The Collaboration Gap in Human-AI Work

人机协作中的鸿沟

Varad Vishwarupe, Marina Jirotka, Nigel Shadbolt, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了人机协作中稳定性不足的问题,提出三种工作结构并强调 grounding 条件的重要性。

Comments Accepted as a conference paper at ECSCW 2026, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17019 2026-04-21 cs.AI 82%

Mini-BEHAVIOR-Gran: Revealing U-Shaped Effects of Instruction Granularity on Language-Guided Embodied Agents

Mini-BEHAVIOR-Gran:揭示指令粒度对语言引导的具身智能体的影响

Sukai Huang, Chenyuan Zhang, Fucai Ke, Zhixi Cai, Gholamreza Haffari, Lizhen Qu, Hamid Rezatofighi

机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出Mini-BEHAVIOR-Gran基准,通过多级指令变体研究指令粒度对具身智能体性能的影响,发现粒度与性能呈非单调U型关系,粗粒度性能反弹与浅层 grounding 有关。

Comments 23 pages, Keywords: Language Grounding, Language Granularity, Instruction Following Agent, Width-based Planning Research Area: Multimodality and Language Grounding to Vision, Robotics and Beyond Research Area Keywords: vision language navigation, multimodality, neurosymbolic approaches

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16342 2026-04-21 cs.HC 82%

SAGE: Sensor-Augmented Grounding Engine for LLM-Powered Sleep Care Agent

SAGE:基于传感器的地面引擎用于LLM驱动的睡眠护理代理

Hansoo Lee, Yoonjae Cho, Sonya S. Kwak, Rafael A. Calvo

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 SAGE通过整合传感器数据,解决睡眠护理中数据与行动之间的鸿沟问题,提升个性化和信任度。

Comments Accepted to the Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26). 6 pages

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17422 2026-04-21 cs.CV cs.MM 81%

Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

聚焦何处:用于长视频理解的查询调节多模态关键帧选择

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Xuming Hu, Hui Xiong

机构 * Department of CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Q-Gate框架,通过动态模态路由解决长视频理解中关键帧选择问题,有效抑制模态噪声,提升多模态大语言模型的推理能力。

Comments 9 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18201 2026-04-21 cs.CV cs.LG 81%

DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery

DiffuSAM: 基于扩散的零样本目标定位用于遥感影像

Geet Sethi, Panav Shah, Ashutosh Gandhe, Soumitra Darshan Nayak

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出DiffuSAM,结合扩散模型与先进分割模型,提升遥感影像目标定位精度,实验显示在Acc@0.5上提升超14%。

Comments Accepted at ICLR 2026 ML4RS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG 81%

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02001 2026-04-21 cs.CV cs.AI 81%

Generating Findings for Jaw Cysts in Dental Panoramic Radiographs Using a GPT-Based VLM: A Preliminary Study on Building a Two-Stage Self-Correction Loop with Structured Output (SLSO) Framework

利用基于GPT的视觉语言模型生成牙槽囊肿的诊断发现:一种构建具有结构化输出(SLSO)框架的两阶段自校正循环的初步研究

Nanaka Hosokawa, Ryo Takahashi, Tomoya Kitano, Yukihiro Iida, Chisako Muramatsu, Tatsuro Hayashi, Yuta Seino, Xiangrong Zhou, Takeshi Hara, Akitoshi Katsumata, Hiroshi Fujita

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SLSO框架,通过整合图像分析、结构化数据生成等步骤,提升牙槽囊肿的AI诊断准确性。实验显示SLSO在牙数识别、牙移动检测等方面优于传统方法,但对多牙病变的识别仍有局限。

Comments Revised manuscript; supplementary materials added. Published in Diagnostics

Journal ref Diagnostics 2026, 16, 1096

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17880 2026-04-21 cs.RO cs.CV 77%

ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation

ST-$π$: 结构化时空VLA用于机器人操作

Chuanhao Ma, Hanyu Zhou, Shihan Peng, Yan Li, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本文提出ST-$π$模型,通过结构化时空视觉语言模型和动作专家,解决机器人操作中精细时空推理问题,同时引入结构化时空标注数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16397 2026-04-21 cs.CL cs.AI 77%

From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization

从归因到回避:基于注意力的无训练审计用于临床摘要

Qianqi Yan, Huy Nguyen, Sumana Srivatsa, Hari Bandi, Xin Eric Wang, Krishnaram Kenthapadi

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Oracle Health AI

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出ClinTrace框架,通过解码器注意力权重提取临床有用信号,实现无训练的注意力基于审计,提升临床摘要的透明性和可靠性,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18210 2026-04-21 cs.AI cs.LG cs.MA 76%

TacticGen: Grounding Adaptable and Scalable Generation of Football Tactics

TacticGen: 基于适应性和可扩展性的足球战术生成

Sheng Xu, Guiliang Liu, Tarak Kharrat, Yudong Luo, Mohamed Aloulou, Javier López Peña, Konstantin Sofeikov, Adam Reid, Paul Roberts, Steven Spencer, Joe Carnall, Ian McHale, Oliver Schulte, Hongyuan Zha, Wei-Shi Zheng

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Real Analytics, London(Real Analytics,伦敦) Birmingham City Football Club, Birmingham(伯明翰城足球俱乐部,伯明翰) Management School, University of Liverpool(利物浦大学管理学院) School of Computing Science, Simon Fraser University(Simon Fraser大学计算机科学学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 TacticGen通过多智能体扩散变换器生成适应性战术,结合规则、自然语言和神经模型实现可扩展的战术设计,验证了其在专业足球战术规划中的实用性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14902 2026-04-21 cs.AI cs.CL cs.CV cs.RO 73%

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

ADAPT:在未指定 affordance 约束下评估常识规划的基准测试

Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston Hsu

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 ADAPT 模块,通过显式 affordance 推理提升智能具身代理的鲁棒性和任务成功率,展示了领域适应的视觉语言模型在 affordance 推理中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17475 2026-04-21 cs.AI cs.CL cs.LG 73%

Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception

觉醒失明:为基于视觉感知的代理轨迹进行无监督的冷启动优化

Ashutosh Bajpai, Tamal Majumder, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎比) Microsoft Research(微软研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SPECTRA框架,通过冷启动强化学习提升小视觉语言模型的视觉鲁棒性和工具协调能力,无需监督即可提高任务准确性和工具效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17319 2026-04-21 cs.CV cs.CL 70%

E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

E2E-GMNER:端到端生成式 grounded 多模态命名实体识别

Meng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17888 2026-04-21 cs.RO 67%

SpaceDex: Generalizable Dexterous Grasping in Tiered Workspaces

SpaceDex:在分层工作空间中的通用灵巧抓取

Wensheng Wang, Chuanjun Guo, Wei Wei, Tong Wu, Ning Tan

机构 * Sun Yat-sen University(中山大学) Stellarobot Company(Stellarobot公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 SpaceDex提出了一种分层框架,通过视觉-语言模型规划和臂手特征分离网络,提升在受限3D环境中的灵巧抓取性能,实现在100次真实测试中达到63%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL 62%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16683 2026-04-21 cs.RO cs.AI cs.CV 62%

Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning

Rewind-IL:在线故障检测与状态重置用于模仿学习

Gehan Zheng, Sanjay Seenivasan, Matthew Johnson-Roberson, Weiming Zhi

机构 * College of Connected Computing, Vanderbilt University(范德比尔特大学连接计算学院) School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney(悉尼大学机器人研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Rewind-IL通过零样本故障检测和状态重置机制,提升模仿学习在长时域任务中的可靠性,解决执行漂移问题。

Comments 9 pages, 8 figures, 6 tables. Project page at https://sjay05.github.io/rewind-il

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16587 2026-04-21 cs.CV cs.AI 62%

Real-Time Visual Attribution Streaming in Thinking Model

多模态思维模型中的实时视觉归因流

Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang

机构 * Seil Kang Woojung Han Junhyeok Kim Jinyeong Kim Youngeun Kim Seong Jae Hwang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种用于多模态思维模型实时视觉归因流的近似框架,通过学习从注意力特征中直接估计语义区域的因果效应,实现轻量级学习而非暴力计算的高保真归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12831 2026-04-21 cs.CL cs.AI cs.DB cs.LG 62%

MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training

MTSQL-R1:通过代理训练实现长视界多轮文本到SQL

Taicheng Guo, Hai Wang, ChaoChun Liu, Mohsen Golalikhani, Xin Chen, Xiangliang Zhang, Chandan K. Reddy

机构 * University of Notre Dame(诺特丹大学) Amazon(亚马逊) Salesforce

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MTSQL-R1通过代理训练框架提升多轮文本到SQL任务的长视界表现,通过环境驱动验证和记忆引导细化提升对话连贯性。

Comments ACL 2026 Main camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18092 2026-04-21 cs.LG 57%

Generalization Boundaries of Fine-Tuned Small Language Models for Graph Structural Inference

微调小语言模型在图结构推断中的泛化边界

Michal Podstawski

机构 * NASK National Research Institute(NASK国家研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究微调小语言模型在图结构推断中的泛化能力,通过图大小和图族分布两个维度评估其在超出训练条件时的表现,揭示模型在不同架构下的退化特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 57%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17949 2026-04-21 cs.CV 57%

ZSG-IAD: A Multimodal Framework for Zero-Shot Grounded Industrial Anomaly Detection

ZSG-IAD:一种用于零样本 grounded 工业异常检测的多模态框架

Qiuhui Chen, Jiaxiang Song, Shuai Tan, Weimin Zhong

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出ZSG-IAD框架,通过多模态数据生成结构化异常报告和像素级掩码,采用语言引导的两跳接地模块和可执行规则GRPO提升可靠性,实现在多个工业异常基准上的强零样本性能和透明解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14548 2026-04-21 cs.SD cs.LG eess.AS 57%

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

VoxSafeBench:不仅仅是所说的内容,还有谁、如何以及在哪里

Yuxiang Wang, Hongyu Liu, Yijiang Xu, Qinke Ni, Li Wang, Wan Lin, Kunyu Feng, Dekun Chen, Xu Tan, Lei Wang, Jie Shi, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 VoxSafeBench首次联合评估SLM在安全、公平和隐私三个维度上的社会契合度,揭示语音识别中的普遍缺口,即模型在文本中能识别社会规范,但在语音中却无法正确应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV 57%

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12554 2026-04-21 cs.CV 57%

EmoVerse: A MLLMs-Driven Emotion Representation Dataset for Interpretable Visual Emotion Analysis

EmoVerse:一种基于大语言模型的emotion表示数据集用于可解释的视觉emotion分析

Yijie Guo, Dexiang Hong, Weidong Chen, Zihan She, Cheng Ye, Xiaojun Chang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出EmoVerse数据集,通过多层知识图谱注释实现可解释的视觉情绪分析,包含219k张图像和双注释,提供离散和连续情绪表示,结合新颖的多阶段流程和可解释模型推动高阶情绪理解。

Comments 11 pages, 7 figures. This is a preprint version of a paper submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17484 2026-04-21 cs.IR cs.LG 57%

Matlas: A Semantic Search Engine for Mathematics

Matlas:数学语义搜索引擎

Haocheng Ju, Leheng Chen, Peihao Wu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) IQuest Research(IQuest研究) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心和新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大亚湾先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Matlas通过构建大规模数学语义库,实现数学陈述的高效检索,提升数学家定理检索效率并为AI系统提供数学知识基础。

Comments Web Service: https://matlas.ai/, API Docs: https://matlas.ai/docs

详情

展开后加载摘要…

URL PDF HTML 收藏