arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

共收录 1073
2606.05107 2026-06-04 cs.CV cs.AI

Who Needs Labels? Adapting Vision Foundation Models With the Metadata You Already Have

谁需要标签?利用已有的元数据适应视觉基础模型

Elouan Gardès, Seung Eun Yi, Kartik Ahuja, Théo Moutakanni, Huy V. Vo, Piotr Bojanowski, Wolfgang M. Pernice, Loïc Landrieu, Camille Couprie

机构 * Meta FAIR, Paris(Meta FAIR,巴黎) LIGM, CNRS, Gustave Eiffel, ENPC, IP Paris(LIGM,CNRS,居斯塔夫·艾菲尔,ENPC,IP巴黎) Columbia University, New York(哥伦比亚大学,纽约)

AI总结 提出一种无标签方法FINO,利用元数据通过自监督学习将通用视觉基础模型适应到专业科学领域,无需任务标签且仅用轻量探针进行监督,在多个领域超越标准无监督和全监督适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04442 2026-06-04 cs.CL cs.AI

MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning

MemoryDocDataSet: 联合对话记忆与长文档推理的基准测试

Qiyang Xie, Jialun Wu, Xinjie He, Su Liu, Shuai Xiao, Zhiyuan Lin, Weikai Zhou

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) Columbia University(哥伦比亚大学) Independent Researcher(独立研究者)

AI总结 提出MemoryDocDataSet合成基准,包含50个微世界和1000个QA对,评估系统同时处理多轮对话历史和长文档阅读理解的能力,其中75.1%的问题需要混合推理(先导航对话历史再提取文档答案),实验显示联合检索存在明显差距。

Comments 17 pages, 2 figures, 8 tables. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04423 2026-06-04 cs.LG stat.ML

The price of multi-group transductive learning

多组转导学习的代价

Noah Bergam, Samuel Deng, Daniel Hsu

机构 * Columbia University(哥伦比亚大学)

AI总结 本文证明在转导学习设置中,多组学习器在某些组上的错误率可能相对于单组设置产生乘法惩罚,且惩罚随组数线性增长至样本量的平方根,这与统计设置中惩罚至多对数增长且与组数无关形成鲜明对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00356 2026-06-04 cs.CL

How Far Do Auto-Interpretation Labels Generalize: A Controlled Study Across Languages, Scripts, and Rewordings

自动解释标签的泛化程度:跨语言、文字和改写的受控研究

Sripad Karne

机构 * Columbia University(哥伦比亚大学)

AI总结 通过塞尔维亚双文字系统控制实验,研究稀疏自编码器特征的自然语言标签是否真正泛化到不同语言和文字,发现标签在语义内容匹配上存在显著偏差,且随网络深度增加而加剧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00416 2026-06-04 cs.RO

Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies

在部署中学习:面向通用机器人策略的机群规模强化学习

Yi Wang, Xinchen Li, Pengwei Xie, Pu Yang, Buqing Nie, Yunuo Cai, Qinglin Zhang, Chendi Qu, Jeffrey Wu, Jianheng Song, Xinlin Ren, Jingshun Huang, Mingjie Pan, Siyuan Feng, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch Columbia University(哥伦比亚大学)

AI总结 提出LWD框架,通过机群规模的离线到在线强化学习,结合分布式隐式价值学习与伴随匹配Q学习,持续后训练通用视觉-语言-动作策略,在16台双臂机器人上实现95%平均成功率。

Comments No

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00862 2026-06-04 cs.CV cs.CL

UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding

UniFine: 一种统一且细粒度的零样本视觉-语言理解方法

Rui Sun, Zhecan Wang, Haoxuan You, Noel Codella, Kai-Wei Chang, Shih-Fu Chang

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出UniFine框架,通过利用句子关键词和图像对象等细粒度信息进行图像-文本匹配,在零样本设置下统一处理VQA、SNLI-VE和VCR等视觉-语言任务,并在多个数据集上取得显著改进。

Comments 14 pages, 4 figures, ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.10846 2026-06-04 cs.CY cs.LG

Reducing the Filtering Effect in Public School Admissions: A Bias-aware Analysis for Targeted Interventions

减少公立学校招生中的过滤效应:面向针对性干预的偏差感知分析

Yuri Faenza, Swati Gupta, Aapeli Vuorinen, Xuan Zhang

机构 * Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本研究采用运筹学方法,通过分析纽约市教育部数据,将弱势学生分数分布偏移建模为偏差,并证明针对中等成绩弱势学生的集中干预(如奖学金或培训)可显著降低偏差影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03956 2026-06-04 cs.MA cs.CL

Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems

使用约束引导的多智能体系统解决斑马谜题

Shmuel Berman, Kathleen McKeown, Baishakhi Ray

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学)

AI总结 提出一种多智能体系统ZPS,结合大语言模型与定理证明器,通过分解问题、生成SMT代码和智能体间反馈,显著提升复杂逻辑谜题的解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.01597 2026-06-04 math.NA cs.IT cs.LG cs.NA math.IT

Deterministic and Probabilistic Conditions for Finite Completability of Low-Tucker-Rank Tensor

低 Tucker 等秩张量有限可补全的确定性和概率条件

Morteza Ashraphijuo, Vaneet Aggarwal, Xiaodong Wang

机构 * Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系) School of IE, Purdue University(普渡大学工业工程学院)

AI总结 本文研究了在给定某些 Tucker 等秩组件的情况下,张量有限可补全的采样模式的基本条件。通过在 Tucker 流形上进行代数几何分析,提出了确定性必要和充分条件,同时研究了概率条件并给出了采样概率的下界,以确保所提出的确定性条件在高概率下成立。此外,利用所提出的几何方法,提出了一个保证采样张量有唯一补全的采样模式充分条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.04574 2026-06-04 cs.HC cs.AI cs.SY eess.SY stat.ML

Towards personalized human AI interaction - adapting the behavior of AI agents using neural signatures of subjective interest

迈向个性化的人工智能交互 - 利用主观兴趣的神经签名来适应AI代理的行为

Victor Shih, David C Jangraw, Paul Sajda, Sameer Saproo

机构 * Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学) Data Science Institute, Columbia University(数据科学研究所,哥伦比亚大学) National Institutes of Health(国家卫生研究院)

AI总结 本文提出通过神经签名检测用户兴趣,使深度强化学习AI代理适应个性化人类偏好,首次展示hBCI在虚拟环境中隐式强化AI控制系统的应用。

Comments 11 pages, 9 figures, 1 table, Submitted to IEEE Trans. on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02937 2026-06-03 q-bio.NC cs.CV

BEAST3D: Animal behavioral analysis and neural encoding from multi-view video via Gaussian splatting

BEAST3D: 通过高斯泼溅从多视角视频进行动物行为分析与神经编码

Yanchen Wang, Lenny Aharon, Wangshu Zhu, Kyle Daruwalla, Linghua Zhang, Jiaru Zou, Selmaan Chettih, Helen Hou, Liam Paninski, Matthew R Whiteway

机构 * Columbia University(哥伦比亚大学) Cold Spring Harbor(冷泉港) Stanford University(斯坦福大学)

AI总结 提出BEAST3D自监督预训练框架,利用未标注的多视角视频通过3D高斯泼溅重建和动物分割,学习3D视觉表征,有效应用于新视角合成、多视角姿态估计和神经编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03148 2026-06-03 cs.CV

$A^2$: Smaller Self-Supervised ViTs Localize Better than Larger Ones

$A^2$: 较小的自监督ViT比更大的ViT定位更优

Sreehari Rammohan, Huy Ha, Carl Vondrick

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

AI总结 针对视觉分类中前景定位与丰富表征的矛盾,提出$A^2$方法,通过解耦小模型定位与大模型嵌入,利用预训练特征实现无需额外训练的竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03093 2026-06-03 cs.AI

Decomposing how prompting steers behavior

分解提示如何引导行为

Fan L. Cheng, Nikolaus Kriegeskorte

机构 * Columbia University(哥伦比亚大学)

AI总结 提出嵌套几何分解框架,通过刺激不变映射分析提示如何重塑表示几何,揭示跨维度线性混合是提示引导行为的关键机制。

Comments 59 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01849 2026-06-03 cs.LG cs.CL cs.CR

ContinuousBench: Can Differentially Private Synthetic Text Improve Capabilities?

ContinuousBench: 差分隐私合成文本能否提升能力?

Peihan Liu, Lucas Rosenblatt, Weiwei Kong, Natalia Ponomareva, Gautam Kamath, Rachel Cummings, Roxana Geambasu, Yu Gan, Lillian Tsai, Alex Bie

机构 * Columbia University(哥伦比亚大学) NYU(纽约大学) Google Research(谷歌研究) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Google(谷歌)

AI总结 提出ContinuousBench基准,通过持续更新的数据集评估差分隐私合成文本能否传递原始语料库中的新知识,实验表明非隐私合成能有效转移知识,而最先进的DP合成方法即使在高隐私预算下也基本失败。

Comments For datasets, see https://huggingface.co/ContinuousBench; for the evaluation harness, see https://github.com/plau666/ContinuousBenchEval; for an accompanying blog post, see https://peihanliu.com/posts/continuousbench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30952 2026-06-03 cs.LG

Spectral Anatomy of Quantum Gaussian Process Kernels

量子高斯过程核的谱解剖

Jian Xu, Chao Li, Guang Lin, Yuning Qiu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

AI总结 通过归一化谱熵S(K)/log n统一解释了量子高斯过程回归中指数加速失效与后验病理现象,并证明该诊断量在多种量子与经典核上具有普适性,且在IBM Heron硬件上实现了低误差迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28910 2026-06-03 cs.CL cs.AI

Hallucination Detection-Guided Preference Optimization for Clinical Summarization

基于幻觉检测的偏好优化用于临床摘要生成

Shamanth Kuthpadi Seethakantha, Dung Ngoc Thai, Vara Prasad Gudi, Simran Tiwari, Rami Matar, Avijit Mitra, Wenlong Zhao, Andrew McCallum, Wael Salloum

机构 * Manning College of Information and Computer Sciences(Manning信息与计算机科学学院) Ensemble HP Columbia University(哥伦比亚大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 提出利用幻觉检测器指导迭代修正的推理时方法及偏好学习微调,显著减少临床摘要中的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14279 2026-06-03 cs.LG cs.AI cs.CL cs.SI

Whom to Query for What: Adaptive Group Elicitation via Multi-Turn LLM Interactions

为谁查询什么:通过多轮LLM交互的自适应群体征询

Ruomeng Ding, Tianwei Gao, Thomas P. Zollo, Eitan Bachmat, Richard Zemel, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Columbia University(哥伦比亚大学) Ben-Gurion University of the Negev(贝内-约尔大学内盖夫分校)

AI总结 针对有限预算下群体属性不确定性降低问题,提出结合LLM期望信息增益与异构图神经网络传播的自适应群体征询框架,实现问题与受访者联合选择,在三个真实数据集上显著提升群体响应预测。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01873 2026-06-02 cs.LG

G2LoRA: Gradient Orthogonal Low-Rank Adaptation Framework for Graph Continual Learning on Text-Attributed Graphs

G2LoRA: 面向文本属性图的梯度正交低秩自适应框架用于图持续学习

Yuhan Wang, Yibo Ding, Yutong Ye, Mufan Zhao, Wenbo Zhang, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Statistics, Columbia University(哥伦比亚大学统计系) College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

AI总结 针对LLM-as-Aligner模型在文本属性图持续学习中的灾难性遗忘问题,提出G2LoRA框架,通过统一图-文本对齐目标、类别感知梯度投影和梯度幅度调制,实现任务间正向迁移并缓解模态漂移。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01708 2026-06-02 cs.LG cs.AI

Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

随机极小极大树的双保真度最优动作识别

Peter Chen, Xi Chen

机构 * Department of Mathematics, Columbia University(哥伦比亚大学数学系) Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 针对随机极小极大树中的固定置信度最优动作识别问题,提出双保真度树搜索算法2FFS,结合极小极大快速扩展与MCTS随机采样,自适应选择廉价有偏评估或昂贵精确评估,理论证明固定置信度正确性、有限停止及多项式深度成本上界,实验表明比现有BAI-MCTS基线显著减少样本和计算。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01655 2026-06-02 math.OC cs.AI cs.LG stat.ML

MINTS: Minimalist Thompson Sampling

MINTS: 极简汤普森采样

Kaizheng Wang

机构 * Department of IEOR and Data Science Institute, Columbia University(工业工程与数据科学学院,哥伦比亚大学)

AI总结 针对贝叶斯方法在复杂结构约束下的局限性,提出一种仅对最优位置设置先验、通过轮廓似然消除冗余参数的极简贝叶斯框架,并实例化为MINTS算法,在均值约束多臂老虎机中实现近最优非渐近遗憾保证和精确几乎必然渐近遗憾刻画。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01382 2026-06-02 cs.LG cs.AI

Efficient Exploration for Iterative Nash Preference Optimization

迭代纳什偏好优化的高效探索

Tianlong Nan, Xiaopeng Li, Christian Kroer, Tianyi Lin

机构 * Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 针对通用偏好模型下的迭代NLHF,提出显式探索算法,结合SFT正则化与对抗性策略探索,实现O(√T)遗憾界,避免对KL正则化参数的指数依赖。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01039 2026-06-02 cs.LG cs.AI

OPD+: Rethinking the Advantage Design for On-Policy Distillation

OPD+: 重新思考在线策略蒸馏中的优势设计

Hanyang Zhao, Haoxian Chen, Han Lin, Genta Indra Winata, David Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Meta Capital One

AI总结 本文提出OPD+,通过修正在线策略蒸馏中因停止梯度操作导致的奖励目标偏差,并支持多种f-散度,在数学推理和工具使用基准上提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00851 2026-06-02 cs.SD cs.CL cs.HC cs.LG eess.AS

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

Sympatheia: 具有连续情感调节的情感自适应语音助手

Sukru Samet Dindar, Riki Shimizu, Xilin Jiang, Nima Mesgarani

机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)

AI总结 提出Sympatheia语音对话框架,通过从用户语音推断情感并结合连续效价-唤醒度控制信号,实现情感自适应响应,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00327 2026-06-02 stat.ME cs.LG stat.AP stat.ML

Cluster Analysis with Resampling for Validation and Exploration (CARVE)

基于重采样的聚类验证与探索分析(CARVE)

Kai R. Wycik, Tiffany M. Tang, Tarek M. Zikry, Genevera I. Allen

机构 * Department of Statistics, Columbia University, New York, NY, USA(哥伦比亚大学统计学系) Center for Theoretical Neuroscience, Zuckerman Mind Brain Behavior Institute, Columbia University, New York, NY, USA(哥伦比亚大学理论神经科学中心、Zuckerman思维-大脑-行为研究所) Department of Applied and Computational Mathematics and Statistics, University of Notre Dame, Notre Dame, IN, USA(诺丁汉大学应用与计算数学与统计学系) School of Data and Information Sciences, University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(北卡罗来纳大学夏洛特分校数据与信息科学学院) Irving Institute for Cancer Dynamics, Columbia University, New York, NY, USA(哥伦比亚大学癌症动力学伊万·里弗斯研究所)

AI总结 提出CARVE开源软件包,通过重采样评估聚类稳定性和泛化性,在全局、簇和样本级别提供诊断,优于传统聚类验证指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07944 2026-06-02 cs.LG math.OC q-fin.CP q-fin.PM q-fin.ST

Variable Clustering via Distributionally Robust Nodewise Regression

基于分布鲁棒节点回归的变量聚类

Kaizheng Wang, Xiao Xu, Xun Yu Zhou

机构 * Department of Industrial Engineering and Operations Research & The Data Science Institute, Columbia University(工业工程与运筹学系及数据科学研究院,哥伦比亚大学)

AI总结 本文提出一种分布鲁棒节点回归方法,通过凸松弛、数据驱动鲁棒区域选择和ADMM算法,实现多因子块模型下的变量聚类,并在数值实验中展示其优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14355 2026-06-02 cs.AI cs.CL

Herculean: An Agentic Benchmark for Financial Intelligence

Herculean: 面向金融智能的智能体基准测试

Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yilun Zhao, Youzhong Dong, Xiaoyu Wang, Yankai Chen, Ye Yuan, Qiyuan Zhang, Fuyuan Lyu, Haolun Wu, Yonghan Yang, Zichen Zhao, Yuyang Dai, Fan Zhang, Rania Elbadry, Ayesha Gull, Muhammad Usman Safder, Nuo Chen, Fengbin Zhu, Tianshi Cai, Zimu Wang, Polydoros Giannouris, Yuechen Jiang, Zhiwei Liu, Mohsinul Kabir, Yuyan Wang, Yixiang Zheng, Yangyang Yu, Weijin Liu, Wenbo Cao, Anke Xu, Peng Lu, Jerry Huang, Mingquan Lin, Prayag Tiwari, Yijia Zhao, Víctor Gutiérrez-Basulto, Xiao-Yang Liu, Kaleb E Smith, Jiahuan Pei, Arman Cohan, Jimin Huang, Yuehua Tang, Alejandro Lopez-Lira, Xi Chen, Xue Liu, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou

机构 * The Fin AI Yale University(耶鲁大学) Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) NVIDIA(英伟达) New York University(纽约大学) Georgia Institute of Technology(佐治亚理工学院) University of Florida(佛罗里达大学) MBZUAI Université de Montréal(蒙特利尔大学) University of Minnesota(明尼苏达大学) University of Massachusetts Boston(马萨诸塞大学波士顿分校) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) University of Liverpool(利物浦大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) National University of Singapore(新加坡国立大学) Halmstad University(哈尔姆斯塔德大学) University of Manchester(曼彻斯特大学) Cardiff University(卡迪夫大学) McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

AI总结 本文提出Herculean,首个覆盖交易、对冲、市场洞察和审计四个代表性工作流的智能体金融智能基准测试,通过标准化MCP技能环境评估异构智能体系统,发现智能体在交易和市场洞察上表现较好,但在对冲和审计等需要长期协调、状态一致性和结构化验证的任务上存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00696 2026-06-02 stat.ML cs.CL cs.LG

Adaptive Querying with AI Persona Priors

基于AI人格先验的自适应查询

Kaizheng Wang, Yuhang Wu, Assaf Zeevi

机构 * Department of Industrial Engineering and Operations Research and Data Science Institute, Columbia University(工业工程与运筹学系及数据科学研究所,哥伦比亚大学) Decision, Risk, and Operations Division, Columbia Business School(决策、风险与运营部门,哥伦比亚商学院)

AI总结 提出一种基于AI人格诱导的潜变量模型,利用大语言模型生成响应分布,实现高效贝叶斯设计,用于在有限查询预算下学习用户相关量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05412 2026-06-02 cs.CV cs.CL

Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues

视觉-语言模型将头部方向误认为注视方向:非语言对话线索

Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Emory University(埃默里大学) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC San Diego(圣地亚哥大学)

AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。

Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00906 2026-06-02 cs.LG cs.AI cs.CL cs.DS cs.IT math.IT

Hallucination is a Consequence of Space-Optimality: A Rate-Distortion Theorem for Membership Testing

幻觉是空间最优性的结果:成员测试的率失真定理

Anxin Guo, Jingwei Li

机构 * Computer Science Department, Northwestern University(西北大学计算机科学系) Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系)

AI总结 通过将幻觉形式化为成员测试问题,建立率失真定理,证明在有限容量下信息论最优策略必然导致对某些非事实的高置信度,从而产生幻觉。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09456 2026-06-02 cs.CV cs.CL cs.CR

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

IAG: 基于输入感知的后门攻击针对VLM视觉定位

Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 提出IAG方法,通过文本条件UNet动态生成输入感知的触发器,实现首个多目标后门攻击VLM视觉定位,在多个模型和基准上达到最佳攻击成功率且不影响正常性能。

Comments Accepted by CVPR 2026; Code is at https://github.com/lijunxian111/IAG

Journal ref https://openaccess.thecvf.com/content/CVPR2026/papers/Li_IAG_Input-aware_Backdoor_Attack_on_VLM-based_Visual_Grounding_CVPR_2026_paper.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏