arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 340 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 340 篇

2603.17576 2026-07-21 cs.CV 版本更新 83%

LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation

LoGSAM: 用于MRI分割的参数高效跨模态接地

Mohammad Robaitul Islam Bhuiyan, Sheethal Bhat, Melika Qahqaie, Andreas Maier, Tri-Thien Nguyen, Paula Andrea Pérez-Toro, Tomás Arias-Vergara

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09483 2026-07-15 cs.AI 版本更新 83%

CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?

CrochetBench:视觉语言模型能否在钩针领域从描述转向实践?

Peiyu Li, Xiaobao Huang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺特大学)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 探讨视觉语言模型在钩针领域从描述到实践的转变,采用CrochetPARADE DSL进行评估,涵盖多种任务,发现评估转变时性能下降,揭示模型局限性,为评估多模态模型过程能力提供新视角。

Comments ACL2026 main-long

Journal ref Proceedings of ACL 2026, Vol. 1, pp. 13229-13251

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25820 2026-06-11 cs.LG 版本更新 83%

Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models

基于扩散的多模态大语言模型的视觉冗余控制并行解码

Yulin Yuan, Hongshuo Zhao, Xiangming Meng

机构 * Zhejiang University(浙江大学) ZJUI-UIUC Institute(ZJUI-UIUC研究院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.LG

AI总结 针对扩散型多模态大语言模型并行解码中视觉冗余问题,提出视觉冗余指数(VRI)和无需训练的视觉冗余控制解码(VRCD)方法,通过令牌到图像的注意力优先选择视觉互补位置,在多个基准上提升准确率。

Comments 18 pages, 5 figures, preprint. Code is available at https://github.com/infiniteYuanyl/VRCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10999 2026-06-09 cs.CV 版本更新 83%

TraversalBench: Challenging Paths to Follow for Vision Language Models

TraversalBench: 为视觉语言模型设计的复杂路径挑战测试集

Clara Petrova, Zhuo Chen, Marin Soljačić

机构 * Massachusetts Institute of Technology, Department of Physics(麻省理工学院物理系) Massachusetts Institute of Technology, Institute for Data, Systems, and Society(麻省理工学院数据、系统与社会研究所) NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用AI研究所)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出TraversalBench,一个用于评估视觉语言模型复杂视觉路径跟随能力的受控基准测试集,发现自相交是主要困难来源,揭示了模型在路径感知上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05208 2026-08-10 cs.CV cs.LG 版本更新 82%

Symbolic Graphics Programming with Large Language Models

基于大语言模型的符号图形编程

Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。

Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21138 2026-08-07 cs.CV 版本更新 81%

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

SEED: 用于可解释文本伪造检测的简单ViT与演化框架

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27278 2026-08-04 cs.CV 版本更新 81%

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估

Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 81%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16300 2026-07-23 cs.AI 版本更新 81%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06210 2026-07-23 cs.CV cs.RO 版本更新 81%

VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction

VG3S:基于视觉几何的高斯散射用于语义占用预测

Xiaoyang Yan, Muleilan Pei, Shaojie Shen

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV

AI总结 VG3S 通过引入视觉基础模型的几何 grounding 能力,提升语义占用预测的准确性与泛化能力。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17343 2026-07-14 cs.CV 版本更新 81%

EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测

Chenyang Zhu, Maorong Wang, Jun Liu, Ching-Chun Chang, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。

Comments Template changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11197 2026-06-24 cs.CV 版本更新 81%

MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration

MedP-CLIP:具有区域感知提示集成的医学CLIP

Jiahui Peng, He Yao, Jingwen Li, Yanzhou Su, Sibo Ju, Yujie Lu, Jin Ye, Hongchun Lu, Xue Li, Lincheng Jiang, Min Zhu, Junlong Cheng

机构 * Sichuan University(四川大学) Xinjiang University(新疆大学) Alibaba Group(阿里巴巴集团) Fuzhou University(福州大学) Shanghai AI Laboratory(上海人工智能实验室) Southwest Jiaotong University(西南交通大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出MedP-CLIP,一种区域感知医学视觉语言模型,通过特征级区域提示集成机制,支持多种提示形式,在保持全局上下文的同时聚焦局部区域,在零样本识别、交互式分割等任务中显著优于基线方法。

Comments Accepted by Medical Image Analysis (MedIA)

Journal ref Medical Image Analysis, 113 (2026), 104193

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14538 2026-08-07 cs.AI cs.LG 版本更新 81%

Symbol Grounding in Neuro-Symbolic AI: A Gentle Introduction to Reasoning Shortcuts

神经符号AI中的符号接地:推理快捷方式的入门介绍

Emanuele Marconato, Samuele Bortolotti, Emile van Krieken, Paolo Morettin, Elena Umili, Antonio Vergari, Efthymia Tsamoura, Andrea Passerini, Stefano Teso

机构 * University of Trento(特伦托大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Sapienza University of Rome(罗马大学) University of Edinburgh(爱丁堡大学) Huawei Labs(华为实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨神经符号AI中推理快捷方式的问题,分析其成因与影响,并提供解决方法与策略,以提升模型的可靠性和可信度。

Comments Published on JAIR (Integration of Logical Constraints in Deep Learning special track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23876 2026-07-08 cs.CV cs.AI 版本更新 81%

Rethinking Visual Autoregressive Sampling with Information-Grounding Guidance

基于信息基础引导的视觉自回归采样再思考

Ky Dan Nguyen, Hoang Lam Tran, Anh-Dung Dinh, Daochang Liu, Weidong Cai, Xiuying Wang, Chang Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 研究基于下一尺度预测的自回归模型在图像生成中因信息不一致致引导信号分散问题,提出信息基础引导(IGG)框架,通过动态加权将引导锚定到语义重要令牌,在相关任务中生成更优图像,有效纠正基于AR的方法。

Comments Accepted to The Forty-Third International Conference on Machine Learning (ICML 2026); 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06294 2026-06-23 cs.CV cs.AI 版本更新 81%

Towards One-to-Many Temporal Grounding

面向一对多时间定位

Qi Xu, Yue Tan, Shihao Chen, Jiahao Meng, Anna Wang, Shunping Ji, Hao Fei, Jason Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 针对一对多时间定位(OMTG)任务,提出包含基准、数据集和奖励函数的系统解决方案,显著提升多段视频定位性能。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15650 2026-07-13 cs.CV 版本更新 80%

AffordanceSAM: Segment Anything Once More in Affordance Grounding

可负担性语义分割模型:在可负担性基础上再次分割任何事物

Dengyang Jiang, Zanyi Wang, Hengzhuang Li, Sizhe Dang, Teli Ma, Wei Wei, Guang Dai, Lei Zhang, Harry Yang, Mengmeng Wang

机构 * SGIT AI Lab(SGIT人工智能实验室) NWPU(西北工业大学) HKUST(香港科技大学) XJTU(西安交通大学) HUST(华中科技大学) ZJUT(浙江工业大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究聚焦全监督可负担性基础,提出AffordanceSAM,通过设计适应模块和标注数据集,以三阶段训练方式扩展SAM泛化能力,在AGD20K基准上达最优性能,展现强大泛化能力。

Comments [ACM MM 2026] SAM Meets Affordance Grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新 80%

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract_cn);VLM(abstract_cn)

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07343 2026-06-16 cs.CV cs.AI cs.LG cs.RO 版本更新 80%

Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation

通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11839 2026-08-13 cs.LG 版本更新 79%

Grounding Large Language Models as Generalizable Policies in Network Control

大语言模型作为网络优化的通用策略

Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang

机构 * Bytedance(字节跳动) Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Department of Computer Science and Technology(计算机科学与技术系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。

Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17162 2026-08-12 cs.AI q-bio.GN 版本更新 79%

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNA:通过联合嵌入预测架构夯实基因组基础模型

Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

机构 * Applied AI Architecture, NVIDIA, Israel(NVIDIA应用人工智能架构,以色列) Worldwide Field Ops, NVIDIA, Israel(NVIDIA全球现场运营,以色列) Developer Programs, NVIDIA, Israel(NVIDIA开发者计划,以色列) Cancer Research Center and Wohl Institute of Translational Medicine, Sheba Medical Center, Tel Hashomer, Israel(癌症研究中心和Wohl转化医学研究所,Sheba医疗中心,Tel Hashomer,以色列) Windreich Department of AI and Human Health, Icahn School of Medicine at Mount Sinai, New York, USA(AI与人类健康风reich部门,Mount Sinai医学中心,纽约,美国)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出JEPA-DNA框架,将联合嵌入预测架构与生成式目标结合,通过潜在空间监督全局序列嵌入,实现从令牌恢复到语义对齐的转变,在17项基因组基准任务上提升线性探测和零样本性能,达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12602 2026-08-11 cs.CV 版本更新 79%

Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT

解耦与推理:3D胸部CT中自由文本发现的解剖学引导两阶段体素级定位

Kwang-Hyun Uhm, Inhwa Son, Sung-Jea Ko

机构 * Department of Artificial Intelligence, Gachon University(韩国加图立大学人工智能系) MEDAI

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究3D胸部CT中自由文本发现的体素级定位难题,提出解耦框架,分病变分割和文本-体积推理两阶段,利用解剖学引导解决空间模糊性,在基准测试中取得领先,证明解耦是处理该复杂性的有效范式。

Comments Accepted to MICCAI 2026 (Spotlight Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04935 2026-08-10 cs.CV 版本更新 79%

Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

释放视觉-语言模型在通用人工智能生成图像检测中的潜力

Weihan Cai, Hao Tan, Zichang Tan, Jun Wan, Xinping Gao

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究针对AI生成图像检测,发现视觉-语言模型PE比DINOv3更具潜力,提出语义原型校准(SPC)方法得到PE-SPC,在多基准测试中达到新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 79%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04383 2026-07-30 cs.SD cs.AI 版本更新 79%

Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

Auto-AEG:用于开放词汇音频事件定位的可扩展数据构建

Zihan Zhang, Xize Cheng, Wenhao Yan, Tong Zhang, Dongjie Fu, Boyun Zhang, Yongbo He, Tao Jin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究开放词汇音频事件定位任务,因数据稀缺受限。提出Auto-AEG可扩展管道,通过自动数据构建和模型微调构建监督,结合合成音频与伪标签训练,提升模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24118 2026-07-28 cs.CV 版本更新 79%

An LMM for Precisely Grounding Elements in Documents

一种用于精确文档元素定位的大型多模态模型

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Ji Qi, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出PreciseDoc,一种通过合成数据与强化学习联合训练实现文档元素精确定位的大型多模态模型,显著提升文档理解与视觉定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28371 2026-07-28 cs.CY cs.AI 版本更新 79%

Coherent Without Grounding, Grounded Without Success: Observability and Epistemic Failure

无需基础的协调,协调的无需成功:可观测性与认知失败

Camilo Chacón Sartori

机构 * Institut Català de Nanociència i Nanotecnologia (ICN2)(加泰罗尼亚纳米科学与纳米技术研究所(ICN2)) Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究所(IIIA-CSIC))

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在低可观测性和高可观测性领域中协调与基础的分离现象,提出认知三角模型以评估人工智能代理的认知能力。

Comments Error found in some results. I need to correct it before re-uploading

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10230 2026-07-24 cs.LG cs.SD eess.AS 版本更新 79%

Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization

帧级内部工具使用用于音频语言模型中的时序定位

Joseph An, Phillip Keung, Jiaqi Wang, Orevaoghene Ahia, Noah A. Smith

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出帧级内部工具使用方法,通过二元分类器和IHP损失提升音频语言模型的时序定位能力,实现50倍加速和鲁棒长度泛化。

Comments To appear in COLM 2026. Refer to https://github.com/inkitori/taudio/ for the codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21744 2026-07-22 cs.SE cs.AI q-bio.BM 版本更新 79%

Agentic AI-assisted coding offers a unique opportunity to instill epistemic grounding during software development

智能AI辅助编码为软件开发过程中注入认知基础提供了独特契机

Magnus Palmblad, Jared M. Ragland, Benjamin A. Neely

机构 * Center for Proteomics and Metabolomics, Leiden University Medical Center(蛋白质组学与代谢组学中心,莱顿大学医学中心) National Institute of Standards and Technology - Charleston(国家标准与技术研究院-查尔斯顿)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究以蛋白质组学为例,提出社区管理的领域范围认知基础文档用于智能AI辅助编码。核心方法是文档编码硬约束和约定参数。主要贡献是助力非领域专家生成优质代码等,增强各方信心并让领域专家参与定制软件开发。

Comments Letter, 12 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13586 2026-07-21 cs.CV 版本更新 79%

UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets

UniPhysGen:用于可模拟3D资产的统一物理基础

Xian Li, Rong Wei, Lujie Yang, Haolin Huang, Junyuan Fang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(众核科技公司) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究针对现有3D资产缺乏统一物理语义问题,提出UniPhys框架及UniPhysGen模型,通过联合推理关节语义和固有物理属性,减轻几何捷径偏差,经实验验证其性能先进,生成资产可用于机器人模拟环境。

Comments 39 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09760 2026-07-17 cs.CV cs.RO eess.IV 版本更新 79%

PanoAffordanceNet: Towards Holistic Affordance Grounding in 360° Indoor Environments

PanoAffordanceNet:迈向360°室内环境中的整体 affordance 地标

Guoliang Zhu, Wanjun Jia, Caoyang Shao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University, China(湖南大学人工智能与机器人学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 PanoAffordanceNet通过DASM和OSDH解决360°室内环境中的整体affordance地标问题,整合多级约束抑制语义漂移,构建360-AGD数据集,提升具身智能的场景感知能力。

Comments Accepted to IEEE/RSJ IROS 2026. The source code and benchmark dataset will be made publicly available at https://github.com/GL-ZHU925/PanoAffordanceNet

详情

展开后加载摘要…

URL PDF HTML 收藏