arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-08 至 2026-04-08 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2411.05961 2026-04-08 cs.CV cs.AI 86%

Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models

对齐的向量量化用于边缘-云协作的视觉-语言模型

Xiao Liu, Lijun Zhang, Deepak Ganesan, Hui Guan

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 本文提出LLaVA-AlignedVQ系统,通过AlignedVQ算法实现中间特征高效压缩,减少数据传输开销,提升推理速度,保持高精度。

Comments I found a big mistake in the paper that causes significant bias on the results. The residual links are not taken into consideration when computing the transmission. All results about the compressed data size and transmission latency would be affected

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04838 2026-04-08 cs.CV 70%

Less Detail, Better Answers: Degradation-Driven Prompting for VQA

细节越少,答案越好:基于退化的提示方法用于视觉问答

Haoxuan Han, Weijie Wang, Zeyu Zhang, Yefei He, Bohan Zhuang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出退化驱动提示(DDP)方法,通过降低图像清晰度迫使模型关注关键结构信息,提升视觉问答性能。在物理属性和感知现象任务中,DDP通过降采样、结构辅助和提示技术实现更准确的推理。

Comments Accepted to CVPRW 2026. Project page: https://hhx-jpg.github.io/ddp/ , Code: https://github.com/ziplab/DDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 70%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13856 2026-04-08 cs.IR 50%

QKVQA: Question-Focused Filtering for Knowledge-based VQA

基于知识的视觉问答中基于问题的过滤

Wei Ye, Yixin Su, Yueguo Chen, Longxiang Gao, Jianjun Li, Ruixuan Li, Rui Zhang

专题命中 视觉问答 :visual question answering(abstract)

AI总结 本文提出基于问题的跨文章过滤方法,通过设计可训练的问题聚焦过滤器和基于块的动态跨文章选择模块,提升知识过滤效率和问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2601.03054 2026-04-08 cs.CV cs.AI 84%

IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation

IBISAgent: 通过MLLMs增强像素级视觉推理以实现通用生物医学对象指称与分割

Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai, Xuhong Zhang, Jianwei Yin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 视觉推理 :visual reasoning(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IBISAgent,通过多步决策过程增强MLLMs的像素级视觉推理能力,解决现有分割方法在隐式分割标记和迭代优化方面的不足,提升生物医学分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05887 2026-04-08 cs.AI 83%

HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference

HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩

Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出HybridKV框架,通过分层预算分配和不同压缩策略,有效减少KV缓存内存占用并提升解码速度,实验表明在11个多模态基准上内存减少达7.9倍,解码速度提升1.52倍,性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05497 2026-04-08 cs.AI cs.CV 82%

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05930 2026-04-08 cs.CL cs.AI 79%

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?

Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Palo Alto Networks Hangzhou Dianzi University(杭州电子科技大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁工业大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18740 2026-04-08 cs.IR 78%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 视觉推理 :multimodal large language model(title,abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05375 2026-04-08 cs.MM 75%

DAT: Dual-Aware Adaptive Transmission for Efficient Multimodal LLM Inference in Edge-Cloud Systems

DAT:双重视觉与带宽感知的自适应传输,用于边缘-云计算系统中高效多模态大语言模型推理

Qi Guo, Zheming Yang, Yunqing Hu, Chang Zhao, Wen Ji

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出DAT方法,通过轻量级边缘模型过滤非目标帧并触发MLLM推理,结合高效微调策略和多流自适应传输优化,实现高效多模态大语言模型推理,提升语义生成质量与低延迟警报性能。

Comments 10 pages, 6 figures. Submitted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05900 2026-04-08 cs.CV 57%

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

AICA-Bench:全面评估VLMs在情感图像内容分析中的能力

Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05638 2026-04-08 cs.CV 57%

PanopticQuery: Unified Query-Time Reasoning for 4D Scenes

PanopticQuery:4D场景的统一查询时推理

Ruilin Tang, Yang Zhou, Zhong Ye, Wenxi Liu, Yan Huang, Shengfeng He

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出PanopticQuery框架,通过4D高斯散射和多视角语义共识机制,实现动态场景的自然语言查询推理,提升复杂语义处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05484 2026-04-08 cs.RO cs.CV 57%

CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment

CoEnv:通过组合环境驱动具身体验多智能体协作

Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. Chen, Zhenfei Yin, Dongzhan Zhou, Wangmeng Zuo, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) CUHK-Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出CoEnv框架,通过模拟与现实结合的组合环境,实现多智能体协作的高效执行与安全部署,提升任务成功率和效率。

Comments 31 pages, 8 figures, including supplementary material. Project page: https://faceong.github.io/CoEnv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25021 2026-04-08 cs.CV 57%

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

VideoTIR:通过高效工具集成推理实现长视频的准确理解

Zhe Gao, Shiyu Shen, Taifeng Chai, Weinong Wang, Haotian Xu, Xing W, Wenbin Li, Qi Fan, Yang Gao, Dacheng Tao

机构 * Nanjing University(南京大学) Nankai University(南开大学) East China Normal University(华东师范大学) Tencent(腾讯) MiroMind Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VideoTIR,通过强化学习优化工具调用策略,提升长视频理解的准确性和效率,结合零样本RL和SFT冷启动方法,减少冗余调用并生成高质量轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17652 2026-04-08 q-bio.QM cs.CV 57%

TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots

TeamPath: 构建多模态病理专家的推理AI助手

Tianyu Liu, Weihao Xuan, Hao Wu, Peter Humphrey, Marcello DiStasio, Mohamed Kahila, Alfonso Garcia Tan, Heli Qi, Rui Yang, Simeng Han, Tinglin Huang, Fang Wu, Chen Liu, Qingyu Chen, Nan Liu, Irene Li, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Biomedical Informatics, Yale University(耶鲁大学计算生物学与生物医学信息学跨学科项目) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(博德研究所) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(理化学研究所先进智能项目中心) Department of Pathology, Yale University(耶鲁大学病理学系) Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理学系) Center for Biomedical Data Science, Duke–NUS Medical School, Singapore, Singapore(杜克-新加坡国立大学医学院生物医学数据科学中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

AI总结 TeamPath通过强化学习和路由增强方案,整合多模态数据提升病理诊断与跨模态生成能力,为临床提供可靠的信息交流系统。

Comments 45 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 57%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 15 篇

2511.01594 2026-04-08 cs.RO cs.CV 85%

MARS: Multi-Agent Robotic System with Multimodal Large Language Models for Assistive Intelligence

MARS:基于多模态大语言模型的多智能体机器人系统用于辅助智能

Renjun Gao

机构 * School of Computer Science and Engineering, Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 MARS系统利用多模态大语言模型实现风险感知和个性化辅助,通过多智能体决策框架提升智能家庭机器人在动态环境中的表现。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05482 2026-04-08 cs.CV cs.AI 84%

Unifying VLM-Guided Flow Matching and Spectral Anomaly Detection for Interpretable Veterinary Diagnosis

统一视觉语言模型引导的流匹配与谱异常检测用于可解释的兽医诊断

Pu Wang, Zhixuan Mao, Jialu Li, Zhuoran Zheng, Dianjie Lu, Youshan Zhang

机构 * School of Mathematics, Shandong University(山东大学数学学院) Shenzhen Loop Area Institute(深圳河套学院) Yeshiva University(叶史瓦大学) Qilu University of Technology(齐鲁工业大学) Shandong Normal University(山东师范大学) Chuzhou University(滁州学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种结合流匹配与谱异常检测的新方法,通过视觉语言模型引导分割和随机矩阵理论分析,实现高精度可解释的犬类气胸诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05117 2026-04-08 cs.CV cs.AI cs.CL 79%

Watch Before You Answer: Learning from Visually Grounded Post-Training

在回答前观看:从视觉引导的后训练中学习

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04579 2026-04-08 cs.CV 77%

Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation

Firebolt-VL: 通过跨模态调制实现高效的视觉-语言理解

Quoc-Huy Trinh, Mustapha Abdullahi, Bo Zhao, Debesh Jha

机构 * Aalto University(阿尔托大学) University of South Dakota(南达科他大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Firebolt-VL模型,通过替换Transformer解码器为液态基础模型解码器,并引入Token-Grid相关模块,提升视觉语义理解效率与精度。

Comments arXiv admin note: substantial text overlap with arXiv:2511.11177

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV 74%

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 73%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20157 2026-04-08 cs.CV 70%

SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models

SigLino:高效多教师蒸馏用于聚类视觉基础模型

Sofian Chaybouti, Sanath Narayan, Yasser Dahou, Phúc H. Lê Khac, Ankit Singh, Ngoc Dung Huynh, Wamiq Reyaz Para, Hilde Kuehne, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出SigLino,一种高效的聚类视觉基础模型,通过同时蒸馏SigLIP2和DINOv3的知识到密集和专家混合学生中,提升了多教师蒸馏的效率与效果。

Comments 17 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18336 2026-04-08 cs.CV cs.GR 57%

PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstruction

PPISP: 光度变化在辐射场重建中的物理合理补偿与控制

Isaac Deutsch, Nicolas Moënne-Loccoz, Gavriel State, Zan Gojcic

机构 * NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出PPISP模块,通过物理基础和可解释的转换分离相机固有和拍摄依赖效应,实现对多视角3D重建中光度不一致的合理补偿与控制,提升重建效果和评估公平性。

Comments For more details and updates, please visit our project website: https://research.nvidia.com/labs/sil/projects/ppisp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05623 2026-04-08 cs.CV cs.CL cs.MM 57%

DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions

DetailVerifyBench:长图像描述中密集 hallucination 定位的基准

Xinran Wang, Yuxuan Zhang, Xiao Zhang, Haolong Yan, Muxi Diao, Songyu Xu, Zhonghao Yan, Hongbing Li, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出 DetailVerifyBench,通过1000张高质量图像和密集的token级注释,评估长图像描述中hallucination的精确定位能力。

Comments 8 pages, 5 figures. The dataset and code are available at https://zyx-hhnkh.github.io/DetailVerifyBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05475 2026-04-08 cs.CV 57%

A Synthetic Eye Movement Dataset for Script Reading Detection: Real Trajectory Replay on a 3D Simulator

用于脚本阅读检测的合成眼动数据集:在3D模拟器上的真实轨迹回放

Kidus Zewde, Yuchen Zhou, Dennis Ng, Neo Tiangratanakul, Tommy Duong, Ankit Raj, Yuxin Zhang, Xingyu Shen, Simiao Ren

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种生成合成眼动视频的 pipeline,通过回放真实人类虹膜轨迹生成12小时的合成数据,用于脚本阅读检测任务,验证了生成轨迹在时间动态上的有效性。

Comments Synthetic eye movement dataset generation via 3D eye simulator; iris trajectory replay; script reading detection; behavioral data augmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05467 2026-04-08 cs.IR cs.CL cs.LG 57%

CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation

CUE-R:超越检索增强生成的最终答案

Siddharth Jain, Venkat Narayan Vedam

机构 * Intuit

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 CUE-R通过干预基于证据项的检索使用痕迹,评估单次检索增强生成中每个证据项的操作效用,揭示证据项对正确性、基础忠实度和置信度误差的影响。

Comments 6 figures, 14 tables; appendix includes bootstrap CIs, metric definitions, duplicate position sensitivity, prompt template, and reproducibility details

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05278 2026-04-08 cs.SE cs.AI cs.MA 57%

Spec Kit Agents: Context-Grounded Agentic Workflows

Spec Kit Agents:基于上下文的代理工作流

Pardis Taghavi, Santosh Bhavani

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Spec Kit Agents,一种多代理的规范驱动开发流程,通过添加阶段级上下文绑定钩子,提升代码质量与测试兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09365 2026-04-08 cs.CL cs.AI 57%

Frame of Reference: Addressing the Challenges of Common Ground Representation in Situational Dialogs

参考框架:解决情境对话中共同地面表示的挑战

Biswesh Mohapatra, Théo Charlot, Giovanni Duca, Mayank Palan, Laurent Romary, Justine Cassell

机构 * Inria(法国国家信息与自动化研究所) Nantes Université(南特大学) University of Trento(特伦托大学) VJTI Mumbai(孟买维杰扬特理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究情境对话中共同地面表示的挑战,通过动态共享环境中的关系参考建立共同地面,并提出基于强化学习改进表示方法的策略。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 57%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏