arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2605.12178 2026-05-13 cs.AI cs.CL cs.LG 62%

Do Enterprise Systems Need Learned World Models? The Importance of Context to Infer Dynamics

企业系统需要学习的世界模型吗?上下文对推断动态的重要性

Jishnu Sethumadhavan Nair, Patrice Bechard, Rishabh Maheshwary, Surajit Dasgupta, Sravan Ramachandran, Aakash Bhagat, Shruthan Radhakrishna, Pulkit Pattnaik, Johan Obando-Ceron, Shiva Krishna Reddy Malay, Sagar Davasam, Seganrasan Subramanian, Vipul Mittal, Sridhar Krishna Nemala, Christopher Pal, Srinivas Sunkara, Sai Rajeswar

机构 * ServiceNow Mila

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在可配置的企业环境中,代理是否仍需学习动态规则,通过实验表明运行时发现动态比离线训练更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11551 2026-05-13 cs.LG cs.CV cs.IT math.IT 62%

VNDUQE: Information-Theoretic Novelty Detection using Deep Variational Information Bottleneck

VNDUQE:基于深度变分信息瓶颈的信息理论新颖性检测

Aryan Gondkar, Hayder Radha, Yiming Deng

机构 * 1 Nondestructive Evaluation Lab, Department of Electrical Computer Engineering Michigan State University East Lansing, MI Email 2 Department of Electrical

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出VNDUQE方法,利用深度变分信息瓶颈进行新颖性检测和不确定性量化,通过KL散度和预测熵实现对Out-of-distribution样本的检测,实验结果显示其在新颖性检测和不确定性估计方面优于基线MSP方法。

Comments 6 pages, 3 figures, Fall 2025 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09051 2026-05-13 cs.LG cs.AI 62%

Model-Level GNN Explanations via Rule-to-Graph Readout for Logit Reconstruction

通过规则到图读取实现模型级GNN解释用于logit重建

Shengyao Lu, Jiuding Yang, Aedan J. DeFrates, Keith G. Mills, Baochun Li, Di Niu

机构 * University of Victoria(维多利亚大学) University of Alberta(阿尔伯塔大学) LSU ATHENA Lab(路易斯安那州立大学ATHENA实验室) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于规则的图神经网络解释框架,通过规则级读取重建logit,实现全局解释与子图接地,提升预测一致性并加快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 62%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13896 2026-05-12 q-bio.QM cs.AI cs.CV cs.MA 62%

GenCellAgent: Generalizable, Training-Free Cellular Image Segmentation via Large Language Model Agents

GenCellAgent:基于大语言模型代理的通用、无需训练的细胞图像分割

Xi Yu, Yang Yang, Qun Liu, Yonghua Du, Sean McSweeney, Yuewei Lin

机构 * Artificial Intelligence Department, Brookhaven National Laboratory, Upton, 11973, NY, US(1 人工智能部门,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国) National Synchrotron Light Source II, Brookhaven National Laboratory, Upton, 11973, NY, US(2 国家同步辐射光源II,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国) Biology Department, Brookhaven National Laboratory, Upton, 11973, NY, US(3 生物学部门,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GenCellAgent通过规划-执行-评估循环实现无需训练的细胞图像分割,自动分配最佳工具并支持文本引导分割,优于现有方法且减少标注负担。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08043 2026-05-11 cs.CV cs.AI 62%

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

SCOPE:结构分解与条件技能协调用于复杂图像生成

Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知 MOE 实验室,中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCOPE框架,通过结构化规范和条件技能协调解决复杂图像生成中语义承诺的持续跟踪问题,通过Gen-Arena基准验证其有效性,取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07646 2026-05-11 cs.CL cs.AI cs.LG 62%

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN:具有步骤内认知审计的多智能体验证-扩展网络

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng

机构 * Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MAVEN通过显式角色解耦将LLM转化为有意识的推理者,采用对抗性Skeptic-Researcher-Judge循环,生成可验证的模块化推理轨迹,提升多任务推理质量。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07395 2026-05-11 cs.LG cs.AI cs.CL 62%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05344 2026-05-08 cs.CV cs.AI cs.IR 62%

Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery

Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索

Md Adnan Arefeen, Biplob Debnath, Ravi K. Rajendran, Murugan Sankaradas, Srimat T. Chakradhar

机构 * North South University(北南大学) NEC Laboratories America(NEC实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01144 2026-05-05 cs.CV cs.AI 62%

Semantic Context-aware mOdality fUsion Transformer (SCOUT): A Context-Aware Multimodal Transformer for Concept-Grounded Pathology Report Generation

语义上下文感知的多模态融合变换器(SCOUT):一种基于概念的多模态变换器,用于病理报告生成

Suryakant Singh, Saarthak Kapse, Joel Saltz, Prateek Prasanna

机构 * Stony Brook University(石桥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 SCOUT通过整合局部组织学模式、整张滑片上下文和专家编纂的语义描述符,实现病理报告生成的语义上下文感知,提升临床相关性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05534 2026-05-05 cs.LG cs.AI 62%

A Unified Theory of Sparse Dictionary Learning in Mechanistic Interpretability: Piecewise Biconvexity and Spurious Minima

稀疏字典学习在机制可解释性中的统一理论:分段双凸性与虚假极值

Yiming Tang, Harshvardhan Saini, Zhaoqian Yao, Zheng Lin, Yizhen Liao, Jingyi Cui, Yisen Wang, Mengnan Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Indian Institute of Technology, Dhanbad(印度德里理工学院) Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出稀疏字典学习的统一理论,揭示其分段双凸性及虚假极值问题,通过线性表示基准揭示路径学,提出特征锚定技术提升特征恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 62%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28181 2026-05-01 cs.AI cs.CL cs.LG 62%

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

大规模合成计算机用于长期生产力模拟

Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao

机构 * Microsoft(微软)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大规模合成计算机方法,通过生成真实文件夹结构和内容丰富的 artifacts,模拟长期生产力场景,验证了其在不同领域中的有效性。

Comments Preview version; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12632 2026-05-01 cs.CV cs.LG 62%

TeD-Loc: Text Distillation for Weakly Supervised Object Localization

TeD-Loc: 文本蒸馏用于弱监督目标定位

Shakeeb Murtaza, Soufiane Belharbi, Alexis Guichemerre, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔工程学院,加拿大)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 TeD-Loc通过对比对齐将CLIP文本嵌入迁移到patch嵌入,实现patch级的前景/背景定位,并引入定位引导的分类模块以提升定位与分类的联合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22477 2026-04-30 cs.CV cs.LG 62%

Contrastive Semantic Projection: Faithful Neuron Labeling with Contrastive Examples

对比语义投影:利用对比示例实现忠实的神经元标注

Oussama Bouanani, Jim Berend, Wojciech Samek, Sebastian Lapuschkin, Maximilian Dreyer

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) Technische Universität Berlin(柏林技术大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出对比语义投影(CSP),通过视觉语言模型生成候选标签并结合CLIP-like编码器进行标签分配,改进神经元标注的准确性和语义粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 62%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14135 2026-04-27 cs.LG cs.AI cs.GT cs.MA 62%

AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning

AdaFair-MARL:在多智能体强化学习中强制适应性公平性约束

Promise Ekpo, Saesha Agarwal, Felix Grimm, Lekan Molu, Angelique Taylor

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) Bala-Cynwyd, PA, USA(巴拉-辛威德, 美国宾夕法尼亚州)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AdaFair-MARL框架,通过将工作负载公平性作为显式约束,使智能体在优化团队性能的同时保持贡献平衡,实验表明其在医院协调环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15594 2026-04-24 cs.LG cs.CV 62%

Analytical Softmax Temperature Setting from Feature Dimensions for Model- and Domain-Robust Classification

基于特征维度的分析softmax温度设置用于模型和领域鲁棒分类

Tatsuhito Hasegawa, Shunsuke Sakai

机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于特征维度确定softmax温度的理论方法,通过优化温度系数和批量归一化层,实现无训练的温度设置,提升分类鲁棒性。

Comments 22 pages, 11 figures, under review

Journal ref Neural Computing and Applications 37, 27985-28016, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20368 2026-04-23 cs.CV cs.AI 62%

LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel

LaplacianFormer:重新思考线性注意力与拉普拉斯核

Zhe Feng, Sen Lian, Changwei Wang, Muyang Zhang, Tianlong Tan, Rongtao Xu, Weiliang Meng, Xiaopeng Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) China Electronics Data Corporation(中国电子数据公司) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院) The Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算能力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) Spatialtemporal AI(时空人工智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 LaplacianFormer通过引入拉普拉斯核替代softmax,解决高分辨率视觉任务中注意力机制的二次复杂度问题,提升表达能力并优化计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08620 2026-04-22 cs.AI cs.CV 62%

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

ViDoRe V3:对复杂现实场景中检索增强生成的综合评估

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

机构 * Illuin Technology(Illuin技术公司) NVIDIA CentraleSupélec, Paris-Saclay(巴黎萨克雷中央理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ViDoRe V3是一个多模态检索增强生成基准,涵盖10个专业领域数据集,通过12000小时人工标注评估先进RAG管道,发现视觉检索优于文本检索,晚期交互模型和文本重排序显著提升性能,但模型在非文本元素、开放性查询和细粒度视觉定位上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL 62%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16683 2026-04-21 cs.RO cs.AI cs.CV 62%

Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning

Rewind-IL:在线故障检测与状态重置用于模仿学习

Gehan Zheng, Sanjay Seenivasan, Matthew Johnson-Roberson, Weiming Zhi

机构 * College of Connected Computing, Vanderbilt University(范德比尔特大学连接计算学院) School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney(悉尼大学机器人研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Rewind-IL通过零样本故障检测和状态重置机制,提升模仿学习在长时域任务中的可靠性,解决执行漂移问题。

Comments 9 pages, 8 figures, 6 tables. Project page at https://sjay05.github.io/rewind-il

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16587 2026-04-21 cs.CV cs.AI 62%

Real-Time Visual Attribution Streaming in Thinking Model

多模态思维模型中的实时视觉归因流

Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang

机构 * Seil Kang Woojung Han Junhyeok Kim Jinyeong Kim Youngeun Kim Seong Jae Hwang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种用于多模态思维模型实时视觉归因流的近似框架,通过学习从注意力特征中直接估计语义区域的因果效应,实现轻量级学习而非暴力计算的高保真归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12831 2026-04-21 cs.CL cs.AI cs.DB cs.LG 62%

MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training

MTSQL-R1:通过代理训练实现长视界多轮文本到SQL

Taicheng Guo, Hai Wang, ChaoChun Liu, Mohsen Golalikhani, Xin Chen, Xiangliang Zhang, Chandan K. Reddy

机构 * University of Notre Dame(诺特丹大学) Amazon(亚马逊) Salesforce

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MTSQL-R1通过代理训练框架提升多轮文本到SQL任务的长视界表现,通过环境驱动验证和记忆引导细化提升对话连贯性。

Comments ACL 2026 Main camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15972 2026-04-20 cs.CV cs.AI 62%

When Cultures Meet: Multicultural Text-to-Image Generation

当文化相遇:多文化文本到图像生成

Parth Bhalerao, Mounika Yalamarty, Brian Trinh, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 62%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12440 2026-04-15 cs.CV cs.AI 62%

IAD-Unify: A Region-Grounded Unified Model for Industrial Anomaly Segmentation, Understanding, and Generation

IAD-Unify:一种基于区域的统一模型用于工业异常分割、理解和生成

Haoyu Zheng, Tianwei Lin, Wei Wang, Zhuonan Wang, Wenqiao Zhang, Jiaqi Zhu, Feifei Shao

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IAD-Unify模型,通过双重编码框架实现工业异常的分割、理解和生成,构建了统一的评估平台,并展示了其在跨类别泛化上的强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12237 2026-04-15 cs.LG cs.AI cs.CL 62%

MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization

MolMem:基于记忆的代理强化学习用于样本高效的分子优化

Ziqing Wang, Yibo Wen, Abhishek Pandy, Han Liu, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MolMem通过双记忆系统提升分子优化的样本效率,利用静态示例记忆和进化技能记忆,实现90%的成功率和52%的多属性任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 62%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09537 2026-04-13 cs.CL cs.AI cs.IR cs.LG 62%

Case-Grounded Evidence Verification: A Framework for Constructing Evidence-Sensitive Supervision

基于案例的证据验证:构建证据敏感监督的框架

Soroosh Tayebi Arasteh, Mehdi Joodaki, Mahshad Lotfinia, Sven Nebelung, Daniel Truhn

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出案例 grounded 的证据验证框架,通过生成支持与非支持示例,提升模型对证据依赖性的学习能力,实验显示其在医学影像领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏