arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

共收录 1302
2604.10916 2026-04-20 cs.CV cs.AI

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07043 2026-04-20 cs.LG

COMPASS: Benchmarking Constrained Optimization in LLM Agents

COMPASS:评估LLM代理在约束优化中的表现

Tian Qin, Felix Bai, Ting-Yao Hu, Raviteja Vemulapalli, Hema Swetha Koppula, Zhiyang Xu, Bowen Jin, Mert Cemri, Jiarui Lu, Zirui Wang, Meng Cao

机构 * Harvard University(哈佛大学) Apple(苹果公司) Virginia Tech(弗吉尼亚理工学院) UIUC(伊利诺伊大学香槟分校) UC Berkeley(加州大学伯克利分校)

AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01137 2026-04-20 cs.CL

Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models

跟随流动:文本到图像模型中文本令牌间信息流动的研究

Guy Kaplan, Michael Toker, Yuval Reif, Yonatan Belinkov, Roy Schwartz

机构 * Hebrew University of Jerusalem(海法大学) Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) Kempner Institute, Harvard University(哈佛大学凯普纳研究所)

AI总结 本文研究文本到图像模型中令牌表示间的信息分布,发现信息常集中于少数几个令牌,且令牌间存在孤立与交互影响,改进编码可提升生成质量。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22185 2026-04-17 cs.CV

Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening

超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查

Antara Titikhsha, Divyanshu Tak

机构 * Carnegie Mellon University(卡内基梅隆大学) Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) Mass General Brigham(马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology(放射肿瘤科) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital(布里洛妇产科医院)

AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。

Comments We had major improvements in this second draft. Please refer to this version only

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14738 2026-04-17 cs.AI

Personalized and Context-Aware Transformer Models for Predicting Post-Intervention Physiological Responses from Wearable Sensor Data

面向个性化和情境感知的Transformer模型:用于预测可穿戴传感器数据后干预的生理反应

Esther Brown, Victoria Dean, Finale Doshi-Velez

机构 * Harvard University(哈佛大学) Princeton University(普林斯顿大学)

AI总结 本文提出基于Transformer的模型,用于预测干预后生理指标的时间轨迹及变化方向,通过结合多时间窗百分比变化和用户标记事件,验证个性化预测的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23468 2026-04-17 cs.RO cs.AI cs.LG

Multi-Modal Manipulation via Multi-Modal Policy Consensus

多模态操控 via 多模态策略共识

Haonan Chen, Jiaming Xu, Hongyu Chen, Kaiwen Hong, Binghao Huang, Chaoqi Liu, Jiayuan Mao, Yunzhu Li, Yilun Du, Katherine Driggs-Campbell

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

AI总结 本文提出通过多模态策略共识实现多模态操控,采用扩散模型分解策略并利用路由网络动态组合模态贡献,提升机器人操控任务中多模态推理能力。

Comments 8 pages, 7 figures. Project website: https://policyconsensus.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13305 2026-04-16 cs.CV

Bias at the End of the Score

评分末尾的偏见

Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 研究揭示奖励模型在文本到图像生成中因编码人口偏见导致性别和种族刻板印象强化及多样性崩溃的问题。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13186 2026-04-16 cs.CV

Towards Patient-Specific Deformable Registration in Laparoscopic Surgery

迈向腹腔镜手术中的患者特异性变形配准

Alberto Neri, Veronica Penza, Nazim Haouchine, Leonardo S. Mattos

机构 * Biomedical Robotics Lab, Istituto Italiano di Tecnologia, Genoa, Italy(生物医学机器人实验室,意大利理工学院,热那亚) Department of Computer Science, Bioengineering, Robotics and Systems Engineering (DIBRIS), University of Genoa, Italy(计算机科学、生物工程、机器人与系统工程系(DIBRIS),热那亚大学,意大利) Harvard Medical School, Brigham and Women’s Hospital, Boston, USA(哈佛医学院,布里洛妇女医院,美国波士顿)

AI总结 本文提出一种患者特异性非刚性点云配准方法,结合Transformer架构与物理模拟算法,在合成和真实数据上均优于传统方法,显著提升手术安全性。

Journal ref Medical Image Computing and Computer Assisted Intervention - MICCAI 2025. MICCAI 2025. Lecture Notes in Computer Science, vol 15968. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06168 2026-04-16 cs.CV cs.RO

Action Images: End-to-End Policy Learning via Multiview Video Generation

动作图像:通过多视图视频生成实现端到端策略学习

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) NVIDIA(英伟达) Harvard University(哈佛大学) Genesis AI

AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。

Comments Project Page: https://actionimages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24119 2026-04-16 cs.CL cs.AI

Evaluating LLM-Based Translation of a Low-Resource Technical Language: The Medical and Philosophical Greek of Galen

评估基于大语言模型的低资源技术语言翻译:加伦的医学与哲学希腊语

James L. Zainaldin, Cameron Pattison, Manuela Marai, Jacob Wu, Mark J. Schiefsky

机构 * Department of Classical and Mediterranean Studies, Vanderbilt University(维斯尼尔大学古典与地中海研究系) Center for Hellenic Studies, Harvard University(哈佛大学希腊研究中心) Department of Philosophy, Vanderbilt University(维斯尼尔大学哲学系) Machine Intelligence and Normative Theory (MINT) Lab, Australian National University(澳大利亚国立大学机器智能与规范理论实验室) Department of the Classics, Harvard University(哈佛大学古典学系)

AI总结 本文评估了商业大语言模型在古希腊技术文本中的机器翻译质量,并将自动化评估指标与专家判断对比,发现术语稀有性是翻译失败的主要预测因素。

Comments Article + supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10877 2026-04-16 cs.LG

Guided Transfer Learning for Discrete Diffusion Models

指导式迁移学习用于离散扩散模型

Julian Kleutgens, Claudio Battiloro, Lingkai Kong, Benjamin Grewe, Francesca Dominici, Mauricio Tec

机构 * Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出GTL方法,通过比率引导实现离散扩散模型的迁移学习,解决小数据下模型性能问题,展示在序列数据中效果显著,但存在源分布与目标分布重叠不足时的失效模式。

Comments Accepted at ICLR 2026 ReALM-GEN Workshop 9 pages (main text) + appendix

Journal ref ICLR 2026 ReALM-GEN Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10946 2026-04-16 cs.CV

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

抽象3D感知用于视觉-语言模型中的空间智能

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07717 2026-04-16 cs.RO cs.CV

RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph

RoboTAG: 通过拓扑对齐图实现端到端的机器人配置估计

Yifan Liu, Fangneng Zhan, Wanhua Li, Haowen Sun, Katerina Fragkiadaki, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RoboTAG,通过结合3D和2D分支,利用拓扑对齐图缓解对标签的依赖,提升机器人姿态估计的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16662 2026-04-16 cs.HC cs.AI cs.IR cs.LG

Safire: Similarity Framework for Visualization Retrieval

Safire:可视化检索的相似性框架

Huyen N. Nguyen, Nils Gehlenborg

机构 * Harvard Medical School(哈佛医学院)

AI总结 本文提出Safire框架,通过比较标准和表示模态两个维度,系统化分析可视化相似性,揭示不同应用场景中相似性标准与表示模态的关联,并探讨其对多模态学习、AI应用和可视化可重复性的影响。

Comments To appear in IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09784 2026-04-15 stat.ML cs.LG

Discrete Flow Maps

离散流映射

Peter Potaptchik, Jason Yim, Adhi Saravanan, Peter Holderrieth, Eric Vanden-Eijnden, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) MIT(麻省理工学院) Kempner Institute(凯普纳研究所)

AI总结 本文提出离散流映射,通过在概率单纯形几何上实现轨迹压缩,解决离散数据生成中的几何不匹配问题,提升离散流模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11801 2026-04-14 cs.CL

CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation

CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架

WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院) Loyola University Chicago(芝加哥洛约拉大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

AI总结 CLSGen 提出了一种双头微调框架,通过新的架构和方法实现概率估计与解释生成的平衡,实验表明其在分类和解释质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11662 2026-04-14 cs.CL

Hidden Failures in Robustness: Why Supervised Uncertainty Quantification Needs Better Evaluation

鲁棒性中的隐藏故障:为什么监督不确定性量化需要更好的评估

Joe Stacey, Hadas Orgad, Kentaro Inui, Benjamin Heinzerling, Nafise Sadat Moosavi

机构 * University of Sheffield(谢菲尔德大学) Kempner Institute at Harvard University(哈佛大学肯普纳研究所) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Tohoku University(东北大学) RIKEN(理化学研究所)

AI总结 本文研究了监督不确定性探针的鲁棒性,发现现有方法在长文本生成中表现不佳,探针输入比架构更影响鲁棒性,提出混合回退策略提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11609 2026-04-14 cs.AI cs.HC

Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models

交叉性趋炎附势:感知的用户人口统计如何影响大语言模型中的虚假验证

Benjamin Maltbie, Shivam Raval

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

AI总结 研究探讨用户人口统计如何影响大语言模型的虚假验证行为,发现GPT-5-nano在哲学领域比数学领域更趋炎附势,而拉丁裔人群接受度最高,而自信的拉丁裔女性得分最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11386 2026-04-14 cs.RO cs.CV

ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation

ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成

Yiran Qin, Jiahua Ma, Li Kang, Wenzhan Li, Yihang Jiao, Xin Wen, Xiufeng Song, Heng Zhou, Jiwen Yu, Zhenfei Yin, Xihui Liu, Philip Torr, Yilun Du, Ruimao Zhang

机构 * CUHK-Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) USTC(中国科学技术大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Harvard University(哈佛大学)

AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。

Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10904 2026-04-14 cs.CV cs.AI

Evaluating the Impact of Medical Image Reconstruction on Downstream AI Fairness and Performance

评估医学图像重建对下游AI公平性和性能的影响

Matteo Wohlrapp, Niklas Bubeck, Daniel Rueckert, William Lotter

机构 * Department of Data Science, Dana-Farber Cancer Institute(丹娜-法伯癌症研究所数据科学系) AI in Medicine, Technical University of Munich(慕尼黑工业大学医学人工智能) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Harvard Medical School(哈佛医学院)

AI总结 研究通过结合重建与诊断AI模型,评估不同重建方法对下游任务性能和公平性的影响,发现传统指标无法准确反映任务表现,且重建可能放大性别偏见,但整体偏移量较小。

Comments Proceedings of the Medical Imaging with Deep Learning (MIDL) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10819 2026-04-14 cs.DS cs.CC cs.LG

Differentially Private Verification of Distribution Properties

差分隐私分布属性验证

Elbert Du, Cynthia Dwork, Pranay Tankala, Linjun Zhang

机构 * Harvard University(哈佛大学) Rutgers University(罗格斯大学)

AI总结 本文研究差分隐私分布属性测试,探讨在不可信证明者帮助下验证分布属性的样本和通信复杂性,提出在不同隐私模型下优化协议的方法,并证明产品分布私有测试的样本复杂性最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10673 2026-04-14 cs.AI cs.HC

Principles Do Not Apply Themselves: A Hermeneutic Perspective on AI Alignment

原则不自行应用:一种诠释学视角下的人工智能对齐

Behrooz Razeghi

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

AI总结 本文从诠释学角度探讨AI对齐问题,指出原则应用需依赖情境判断,强调对齐过程中的解释性成分,并指出部署响应分布与语料库分布差异可能导致审计失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10539 2026-04-14 cs.LG cs.AI

IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs

IceCache: 用于长序列LLM的内存高效KV缓存管理

Yuzhen Mao, Qitong Wang, Martin Ester, Ke Li

机构 * Simon Fraser University(西蒙菲莎大学) Harvard University(哈佛大学)

AI总结 本文提出IceCache,通过语义令牌聚类与PagedAttention结合,提升长序列LLM的内存效率与性能,实验表明其在256个令牌预算下保持99%的准确性,且在延迟和精度上优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10392 2026-04-14 cs.LG cs.AI cs.LO cs.PL cs.SE

Intent-aligned Formal Specification Synthesis via Traceable Refinement

通过可追溯的细化实现意图对齐的正式规范合成

Zhe Ye, Aidan Z. H. Yang, Huangyuan Su, Zhenyu Liao, Samuel Tenka, Zhizhen Qin, Udaya Ghai, Dawn Song, Soonho Kong

机构 * Amazon Web Services(亚马逊云服务) Harvard University(哈佛大学)

AI总结 本文提出VeriSpecGen框架,通过需求级归因和局部修复生成意图对齐的规范,提升规范合成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08749 2026-04-14 cs.LG cs.NE

A Little Rank Goes a Long Way: Random Scaffolds with LoRA Adapters Are All You Need

秩小亦可远:随机骨架配合LoRA适配器足矣

Hananel Hazan, Yanbo Zhang, Benedikt Hartl, Michael Levin

机构 * Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) Institute for Theoretical Physics, TU Wien(维也纳工业大学理论物理研究所) Wyss Institute for Biologically Inspired Engineering, Harvard University(哈佛大学威斯生物启发工程研究所)

AI总结 通过LottaLoRA方法,研究神经网络参数中实际编码任务信息的占比,发现低秩LoRA适配器在冻结随机骨架上能恢复96-100%的性能,仅训练0.5-40%的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07382 2026-04-14 cs.LG cs.AI

Latent Structure of Affective Representations in Large Language Models

大型语言模型中情感表征的潜在结构

Benjamin J. Choi, Melanie Weber

机构 * Harvard University(哈佛大学)

AI总结 研究大型语言模型中情感表征的潜在几何结构,发现其与心理学中的valence-arousal模型一致,并展示了其在不确定性量化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14884 2026-04-14 cs.LG cs.AI

Learning When Not to Learn: Risk-Sensitive Abstention in Bandits with Unbounded Rewards

学习何时不学习:具有无界奖励的老虎机中风险敏感的退避策略

Sarah Liaw, Benjamin Plaut

机构 * Harvard University(哈佛大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出一种风险敏感的退避算法,在无导师的情况下处理无界奖励的老虎机问题,通过确定性区域减少不可逆损害,理论证明了谨慎探索在高风险环境中的有效性。

Comments 19 pages, 3 figures; accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05342 2026-04-14 cs.CV cs.LG

Delta Rectified Flow Sampling for Text-to-Image Editing

Delta Rectified Flow Sampling 用于文本到图像编辑

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) Computer Science Department, Harvard University(哈佛大学计算机科学系) Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04955 2026-04-14 cs.CV cs.AI

AdvDINO: Domain-Adversarial Self-Supervised Representation Learning for Spatial Proteomics

AdvDINO:用于空间蛋白质组学的领域对抗自监督表示学习

Stella Su, Marc Harary, Scott J. Rodig, William Lotter

机构 * Dana-Farber Cancer Institute(丹娜-法伯癌症研究所) Brigham and Women’s Hospital(布里格姆妇女医院) Harvard Medical School(哈佛医学院)

AI总结 AdvDINO通过整合梯度反转层提升DINOv2架构,以对抗领域偏移,从而在空间蛋白质组学中获得更稳健的表示。

Comments Proceedings of the Medical Imaging with Deep Learning (MIDL) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13331 2026-04-14 cs.LG

Mixture of Cognitive Reasoners: Modular Reasoning with Brain-Like Specialization

认知推理的混合:类脑的专业化模块推理

Badr AlKhamissi, C. Nicolò De Sabbata, Greta Tuckute, Zeming Chen, Martin Schrimpf, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院洛桑) Brain and Cognitive Sciences at MIT(麻省理工学院脑与认知科学系) Kempner Institute at Harvard University(哈佛大学肯普纳研究所)

AI总结 本文提出MiCRo模型,通过类脑专业化模块实现认知行为,提供可解释的推理模块,支持动态路由并优于基线模型。

Comments ICLR 2026. Project Page at https://cognitive-reasoners.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏