arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

2026-04-20 至 2026-04-20 共收录 8
2604.16220 2026-04-20 cs.LG

OT on the Map: Quantifying Domain Shifts in Geographic Space

在地图上进行最优传输:量化地理空间中的领域偏移

Haoran Zhang, Livia Betti, Konstantin Klemmer, Esther Rolf, David Alvarez-Melis

机构 * Harvard University(哈佛大学) Kempner Institute(Kempner研究所) Microsoft Research(微软研究院) University of Colorado Boulder(科罗拉多大学博尔德分校) LGND AI, Inc.(LGND AI公司) University College London(伦敦大学学院)

AI总结 本文提出GeoSpOT方法,利用地理信息与最优传输量化地理领域偏移,有效预测跨领域迁移难度,并指导数据选择与性能预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16083 2026-04-20 cs.CV

DINOv3 Beats Specialized Detectors: A Simple Foundation Model Baseline for Image Forensics

DINOv3超越专用检测器:一种简单的基础模型基准用于图像取证

Jieming Yu, Qiuxiao Feng, Zhuohan Wang, Xiaochen Ma

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harvard University(哈佛大学)

AI总结 本文提出基于DINOv3的简单但强大的基础模型基准,通过LoRA适配和轻量卷积解码器,在四个标准基准上提升像素级F1得分17.0点,且在数据稀缺情况下表现优于现有方法。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05201 2026-04-20 cs.CV cs.AI cs.CL

Mechanisms of Prompt-Induced Hallucination in Vision-Language Models

视觉-语言模型中提示诱导幻觉的机制

William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学) Technion(技术学院) University of Tübingen(图宾根大学) Harvard University(哈佛大学)

AI总结 研究揭示了视觉-语言模型在提示诱导幻觉中的机制,通过分析三种模型发现特定注意力头可显著减少幻觉现象,揭示了模型对提示的响应差异。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04497 2026-04-20 cs.CL cs.AI

Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research

大型语言模型在人文学科研究中低资源语言的机会与挑战

Tianyang Zhong, Zhenyuan Yang, Zhengliang Liu, Ruidong Zhang, Weihang You, Yiheng Liu, Haiyang Sun, Yi Pan, Yiwei Li, Yifan Zhou, Hanqi Jiang, Junhao Chen, Xiang Li, Tianming Liu

机构 * School of Computing, The University of Georgia(佐治亚大学计算机学院) Department of Mathematical and Statistical Sciences, University of Alberta(阿尔伯塔大学数学与统计科学系) University of California, Los Angeles(加州大学洛杉矶分校) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院放射科和哈佛医学院)

AI总结 本文探讨了大型语言模型在低资源语言研究中的应用,分析了数据获取、模型适应性和文化敏感性等挑战,并强调了跨学科合作与定制模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15808 2026-04-20 cs.CV cs.AI

Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

超越单帧:跨体积MRI的多帧空间接地推理

Lama Moukheiber, Caleb M. Yeung, Haotian Xue, Alec Helbling, Zelin Zhao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学) Georgetown University(乔治城大学)

AI总结 本文提出SGMRI-VQA基准,通过多帧空间接地推理提升医学VLMs性能,展示监督微调提升接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07043 2026-04-20 cs.LG

COMPASS: Benchmarking Constrained Optimization in LLM Agents

COMPASS:评估LLM代理在约束优化中的表现

Tian Qin, Felix Bai, Ting-Yao Hu, Raviteja Vemulapalli, Hema Swetha Koppula, Zhiyang Xu, Bowen Jin, Mert Cemri, Jiarui Lu, Zirui Wang, Meng Cao

机构 * Harvard University(哈佛大学) Apple(苹果公司) Virginia Tech(弗吉尼亚理工学院) UIUC(伊利诺伊大学香槟分校) UC Berkeley(加州大学伯克利分校)

AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01137 2026-04-20 cs.CL

Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models

跟随流动:文本到图像模型中文本令牌间信息流动的研究

Guy Kaplan, Michael Toker, Yuval Reif, Yonatan Belinkov, Roy Schwartz

机构 * Hebrew University of Jerusalem(海法大学) Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) Kempner Institute, Harvard University(哈佛大学凯普纳研究所)

AI总结 本文研究文本到图像模型中令牌表示间的信息分布,发现信息常集中于少数几个令牌,且令牌间存在孤立与交互影响,改进编码可提升生成质量。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏