arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2603.00055 2026-03-03 cs.LG cs.AI 62%

M3-AD: Reflection-aware Multi-modal, Multi-category, and Multi-dimensional Benchmark and Framework for Industrial Anomaly Detection

M3-AD:面向工业异常检测的反思-aware 多模态、多类别和多维基准与框架

Chao Huang, Yanhui Li, Yunkang Cao, Wei Wang, Hongxi Huang, Jie Wen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hunan University(湖南大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 M3-AD提出了一种反思-aware 的多模态框架,通过RA-Monitor提升工业异常检测的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16782 2026-02-27 cs.LG cs.AI cs.CY 62%

What Is the Point of Equality in Machine Learning Fairness? Beyond Equality of Opportunity

机器学习公平性中平等的意义:超越机会的平等

Youjin Kong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨机器学习公平性中平等的意义,提出超越机会平等的平等主义框架,以解决结构性不平等和代表性伤害问题。

Comments Presented at ACM FAccT 2025; Forthcoming in ACM Journal on Responsible Computing

Journal ref ACM J. Responsib. Comput. 3, 1, Article 4 (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22549 2026-02-27 cs.CV cs.AI 62%

DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

DrivePTS: 一种结合文本和结构增强的渐进式学习框架用于驾驶场景生成

Zhechao Wang, Yiming Zeng, Lufan Ma, Zeqing Fu, Chen Bai, Ziyao Lin, Cheng Lu

机构 * XPeng Motors

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DrivePTS通过渐进式学习、多视角文本生成和频率引导结构损失,提升驾驶场景生成的保真度和可控性,生成稀有场景并增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22345 2026-02-27 cs.LG cs.AI 62%

Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory

大语言模型的结构与冗余:通过随机矩阵理论的谱研究

Davide Ettori

机构 * Laurea Magistrale in Computer Science Engineering - Ingegneria Informatica(计算机科学工程硕士课程 - 信息工程)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过谱几何和随机矩阵理论,提出EigenTrack用于检测大语言模型幻觉和分布外行为,以及RMT-KD用于压缩深度网络,提升模型可靠性与效率。

Comments Executive Summary of Master Thesis in Computer Science Engineering, Politecnico di Milano

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21613 2026-02-26 cs.CV cs.AI 62%

Virtual Biopsy for Intracranial Tumors Diagnosis on MRI

颅内肿瘤MRI上的虚拟活检

Xinzhe Luo, Shuai Shao, Yan Wang, Jiangtao Wang, Yutong Bai, Jianguo Zhang

机构 * School of Artificial Intelligence and Data Science University of Science and Technology of China(人工智能与数据科学学院 中国科学技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出虚拟活检框架,利用MRI和视觉-语言模型实现颅内肿瘤的非侵入性病理预测,准确率超过90%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21231 2026-02-26 cs.LG cs.AI cs.CL 62%

ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces

ACAR:适应复杂度的多模型集合路由

Ramchand Kumaresan

机构 * Ramchand Kumaresan(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ACAR是一种用于多模型集合的可审计路由框架,通过自一致性方差实现任务路由,提升准确率并避免过度融合,同时揭示归因计算的挑战。

Comments 12 pages, 9 figures. Measurement framework for adaptive multi-model routing with auditable execution traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19562 2026-02-24 cs.AI cs.CV 62%

A Multimodal Framework for Aligning Human Linguistic Descriptions with Visual Perceptual Data

一种多模态框架,用于将人类语言描述与视觉感知数据对齐

Joseph Bingham

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态框架,通过结合语言和视觉信息,实现了对人类指称行为的稳健建模,并在经典认知基准上取得了优于人类的表现。

Comments 19 Pages, 6 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04568 2026-02-24 cs.AI cs.CL cs.IR cs.LG 62%

Neurosymbolic Retrievers for Retrieval-augmented Generation

用于检索增强生成的神经符号检索器

Yash Saxena, Manas Gaur

机构 * Dept. of CSEE University of Maryland Baltimore County, Maryland, USA(电子工程系大学马里兰大学巴尔的摩县) Dept. of CSEE University of Maryland Baltimore County, MD, USA(电子工程系大学马里兰大学巴尔的摩县)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经符号 RAG 框架,通过结合知识图谱与神经检索技术,提升检索过程的透明性和生成性能。

Comments 8 pages, 2 Figures, Published in IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11915 2026-02-24 cs.CL cs.AI cs.LG 62%

CORE: Measuring Multi-Agent LLM Interaction Quality under Game-Theoretic Pressures

CORE: 在博弈论压力下评估多智能体大语言模型交互质量

Punya Syon Pandey, Yongjin Yang, Jiarui Liu, Zhijing Jin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 CORE通过量化多智能体LLM在不同博弈压力下的语言使用效果,揭示社会激励对语言适应的影响,并提供评估对话鲁棒性的指标。

Comments EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18880 2026-02-24 cs.CV cs.AI 62%

FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model

FOCA:基于多模态大语言模型的频率导向跨域伪造检测、定位与解释

Zhou Liu, Tonghua Su, Hongshi Zhang, Fuxiang Yang, Donglin Di, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) DZ-Matrix Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) University of New South Wales(新南威尔士大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 FOCA通过多模态大语言模型整合空间与频域特征,实现图像伪造的高精度检测、定位及可解释性解释,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18540 2026-02-24 cs.CV cs.AI 62%

Rodent-Bench

Rodent-Bench:用于评估多模态大语言模型在啮齿动物行为标注中的性能

Thomas Heap, Laurence Aitchison, Emma Cahill, Adriana Casado Rodriguez

机构 * University of Bristol(布里斯托大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Rodent-Bench评估了多模态大语言模型在啮齿动物行为标注中的性能,发现现有模型存在时间分段、长视频处理和细微行为区分方面的挑战,为未来模型发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16173 2026-02-19 cs.AI cs.CL cs.LG 62%

Learning Personalized Agents from Human Feedback

从人类反馈中学习个性化代理

Kaiqu Liang, Julia Kruk, Shengyi Qian, Xianjun Yang, Shengjie Bi, Yuanshun Yao, Shaoliang Nie, Mingyang Zhang, Lijuan Liu, Jaime Fernández Fisac, Shuyan Zhou, Saghar Hosseini

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学) Duke University(杜克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PAHF通过整合显式记忆与双反馈通道,实现持续个性化,显著提升学习速度和适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00364 2026-02-19 cs.CV cs.LG 62%

LMSeg: Unleashing the Power of Large-Scale Models for Open-Vocabulary Semantic Segmentation

LMSeg:释放大规模模型在开放词汇语义分割中的潜力

Huadong Tang, Youpeng Zhao, Yan Huang, Min Xu, Jun Wang, Qiang Wu

机构 * Huadong Tang(华东唐) Youpeng Zhao(赵有鹏) Yan Huang(黄艳) Min Xu(徐敏) Jun Wang(王俊) Qiang Wu(吴强)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 LMSeg通过结合多个大规模模型提升开放词汇语义分割的性能,利用LLMs生成多样化视觉属性的提示并改进视觉特征提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11087 2026-02-17 cs.LG cs.AI cs.CL 62%

Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization

通过基于SVD的量化误差最小化增强LLM中的delta压缩

Boya Xiong, Shuo Wang, Weifeng Ge, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance(上海财经大学) Tsinghua University(清华大学) Fudan University(复旦大学) Southern University of Science(南方科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PrinMix通过基于SVD的量化误差最小化方法,提升LLM中delta压缩的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13419 2026-02-17 q-bio.QM cs.AI cs.CL cs.LG q-bio.BM 62%

Protect$^*$: Steerable Retrosynthesis through Neuro-Symbolic State Encoding

Protect$^*$: 通过神经符号状态编码实现可操控的逆合成

Shreyas Vinaya Sathyanarayana, Shah Rahil Kirankumar, Sharanabasava D. Hiremath, Bharath Ramsundar

机构 * Deep Forest Sciences(深林科技) Departament de Farmacologia, Toxicologia i Química Terapèutica, Universitat de Barcelona(巴塞罗那大学药理学、毒理学与治疗化学系) Institut de Nanociència i Nanotecnologia IN2UB, Universitat de Barcelona(巴塞罗那大学纳米科学与纳米技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Protect$^*$通过神经符号状态编码实现逆合成的可控生成,结合规则推理与神经模型,提升化学合成路径的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11583 2026-02-13 cs.AI cs.LG 62%

The Five Ws of Multi-Agent Communication: Who Talks to Whom, When, What, and Why -- A Survey from MARL to Emergent Language and LLMs

多智能体通信的五个W:谁与谁沟通,何时沟通,沟通什么,为何沟通——从MARL到涌现语言和LLMs的综述

Jingdi Chen, Hanqing Yang, Zongjun Liu, Carlee Joe-Wong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多智能体通信的五个W,探讨了从MARL到涌现语言和LLM的发展,分析了不同范式下的通信设计、权衡与挑战。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13779 2026-02-13 cs.CL cs.AI cs.LG 62%

NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews

NewsInterview: 一个用于通过信息性访谈评估LLM地面间隙的数据集和游乐场

Alexander Spangher, Michael Lu, Sriya Jeslyn Kalyan, Hyundong Justin Cho, Weiyan Shi, Jonathan May

机构 * University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 NewsInterview通过信息性访谈数据集和模拟环境,揭示LLMs在战略对话和多轮规划方面的能力不足,强调需提升其对话策略与说服力。

Comments Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10881 2026-02-12 cs.CL cs.AI cs.LG 62%

Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis

诊断基于大型语言模型的证据提取在元分析中的结构性故障

Zhiyin Tan, Jennifer D'Souza

机构 * L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心) TIB Leibniz Information Centre for Science(莱比锡信息中心科学与技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究发现当前LLM在元分析中存在结构性缺陷,导致关联元组提取不可靠,需改进结构性和数值基础。

Comments Accepted at the 22nd Conference on Information and Research Science Connecting to Digital and Library Science (IRCDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10863 2026-02-12 cs.LG cs.AI 62%

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体

Cong Pang, Xuyu Feng, Yujie Yi, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

机构 * Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) SenseTime Research(商汤科技研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18936 2026-02-12 cs.LG cs.CV 62%

Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts

重新审视视觉提示调优:提示专家的表达性

Minh Le, Anh Nguyen, Huy Nguyen, Chau Nguyen, Anh Tran, Nhat Ho

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出VAPT,通过增强提示专家的表达性,在保持参数效率的同时,提升了视觉任务的性能表现。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00185 2026-02-11 cs.AI cs.LG 62%

Chunking Strategies for Multimodal AI Systems

多模态AI系统中的分块策略

Shashanka B R, Mohith Charan R, Seema Banu F

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多模态系统中分块策略的分类和技术分析,探讨了不同模态的数据处理方法及挑战。

Comments 50 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09040 2026-02-11 eess.AS cs.AI cs.LG cs.SD 62%

Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures

用于联合嵌入预测架构中自监督语音表示学习的软聚类锚点

Georgios Ioannides, Adrian Kieback, Judah Goldfeder, Linsey Pang, Aman Chadha, Aaron Elkins, Yann LeCun, Ravid Shwartz-Ziv

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) James Silberrad Brown Center for AI(詹姆斯·西伯拉德·布朗人工智能中心) Columbia University(哥伦比亚大学) Northeastern University(东北大学) Stanford University(斯坦福大学) Amazon GenAI(亚马逊生成人工智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GMM-Anchored JEPA通过软聚类锚点提升语音表示学习,实现ASR、情感识别和槽填充的性能提升。

Comments 15 pages, 5 figures. Code: github.com/gioannides/clustering-anchored-jepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22441 2026-02-10 cs.CV cs.AI 62%

Can NeRFs See without Cameras?

NeRF能否在没有摄像头的情况下看到?

Chaitanya Amballa, Sattwik Basu, Yu-Lin Wei, Zhijian Yang, Mehmet Ergezer, Romit Roy Choudhury

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过重新设计NeRF来利用多路径信号推断环境,应用于从稀疏Wi-Fi测量中推断室内平面图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06592 2026-02-09 cs.CV cs.AI 62%

ProtoQuant: Quantization of Prototypical Parts For General and Fine-Grained Image Classification

ProtoQuant:用于通用和细粒度图像分类的原型部分量化

Mikołaj Janusz, Adam Wróbel, Bartosz Zieliński, Dawid Rymarczyk

机构 * Jagiellonian University, Faculty of Mathematics and Computer Science(杰洛尼莫夫大学数学与计算机科学系) Jagiellonian University, Doctoral School of Exact and Natural Sciences(杰洛尼莫夫大学精确与自然科学研究博士学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ProtoQuant通过潜在向量量化实现原型稳定性和可解释性,适用于通用和细粒度图像分类任务。

Comments Work under review. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04518 2026-02-05 cs.CY cs.AI cs.LG 62%

Learning the Value Systems of Agents with Preference-based and Inverse Reinforcement Learning

基于偏好和逆强化学习的学习代理价值系统

Andrés Holgado-Sánchez, Holger Billhardt, Alberto Fernández, Sascha Ossowski

机构 * Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好和逆强化学习的方法,用于自动从观察和人类示范中学习代理的价值系统,以解决不同用户价值系统差异带来的协议一致性问题。

Comments 42 pages, 5 figures. Published in Journal of Autonomous Agents and Multi-Agent Systems

Journal ref Holgado-Sánchez, A., Billhardt, H., Fernández, A., Ossowski, S. Learning the value systems of agents with preference-based and inverse reinforcement learning. Autonomous Agents Multi-Agent Systems 40, 4 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26275 2026-02-05 cs.SE cs.AI cs.ET cs.LG cs.MA 62%

A Research Roadmap for Augmenting Software Engineering Processes and Software Products with Generative AI

生成人工智能增强软件工程过程和软件产品的研究路线图

Domenico Amalfitano, Andreas Metzger, Marco Autili, Tommaso Fulcini, Tobias Hey, Jan Keim, Patrizio Pelliccione, Vincenzo Scotti, Anne Koziolek, Raffaela Mirandola, Andreas Vogelsang

机构 * University of Naples "Federico II" Napoli Italy Ruhr Institute for Software Technology (paluno), University of Duisburg-Essen Essen Germany Karlsruhe Institute of Technology (KIT) Karlsruhe Germany Gran Sasso Science Institute (GSSI) L'Aquila Italy University of Naples "Federico II" Ruhr Institute for Software Technology (paluno), University of Duisburg-Essen Karlsruhe Institute of Technology (KIT) Gran Sasso Science Institute (GSSI)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个生成人工智能增强软件工程的路线图,通过多轮过程整合证据,系统分析生成人工智能对软件工程过程、方法和工具的影响,并确定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01733 2026-02-05 cs.HC cs.AI cs.CV 62%

DISCOVER: Identifying Patterns of Daily Living in Human Activities from Smart Home Data

DISCOVER: 从智能家庭数据中识别日常生活的活动模式

Alexander Karpekov, Archith Iyer, Sourish Gunesh Dhekane, Sonia Chernova, Thomas Plötz

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 DISCOVER通过自监督学习和可视化接口,从智能家庭数据中发现日常活动模式,以更细粒度和个性化的方式识别居民行为,为健康监测和认知退化研究提供新方法。

Comments v2: Re-submission. Under review at IMWUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15540 2026-02-04 cs.LG cs.AI cs.CL physics.data-an 62%

PRISM: Deriving a White-Box Transformer as a Signal-Noise Decomposition Operator via Maximum Coding Rate Reduction

PRISM:通过最大编码率减少原理推导出白盒变换器作为信号-噪声分解算子

Dongchen Huang

机构 * Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Prism通过几何构造实现白盒变换器,通过信号-噪声分解提升模型可解释性与性能

Comments 12 pages, 6 figures. Derives Transformer as a signal-noise decomposition operator via Maximizing Coding Rate Reduction. Identifies 'Attention Sink' as spectral resonance (Arnold Tongues) and proposes $π$-RoPE for dynamical stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20835 2026-02-02 cs.CV cs.AI 62%

Open-Vocabulary Functional 3D Human-Scene Interaction Generation

开放词汇功能3D人类-场景交互生成

Jie Liu, Yu Sun, Alpar Cseke, Yao Feng, Nicolas Heron, Michael J. Black, Yan Zhang

机构 * Meshcapade University of Amsterdam(阿姆斯特丹大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FunHSI通过功能驱动框架生成开放词汇任务下的功能正确3D人类-场景交互。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01706 2026-02-02 cs.CL cs.AI cs.LG 62%

Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement

通过秩-2子空间解耦进行多步知识交互分析

Sekh Mainul Islam, Pepa Atanasova, Isabelle Augenstein

机构 * Department of Computer Science, University of Copenhagen, Copenhagen, Denmark(计算机科学系,哥本哈根大学,哥本哈根,丹麦)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种秩-2子空间方法,用于多步分析NLE中的知识交互,揭示PK和CK在不同生成中的对齐特性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏