arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

2026-04-16 至 2026-04-16 共收录 8
2604.13305 2026-04-16 cs.CV

Bias at the End of the Score

评分末尾的偏见

Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 研究揭示奖励模型在文本到图像生成中因编码人口偏见导致性别和种族刻板印象强化及多样性崩溃的问题。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13186 2026-04-16 cs.CV

Towards Patient-Specific Deformable Registration in Laparoscopic Surgery

迈向腹腔镜手术中的患者特异性变形配准

Alberto Neri, Veronica Penza, Nazim Haouchine, Leonardo S. Mattos

机构 * Biomedical Robotics Lab, Istituto Italiano di Tecnologia, Genoa, Italy(生物医学机器人实验室,意大利理工学院,热那亚) Department of Computer Science, Bioengineering, Robotics and Systems Engineering (DIBRIS), University of Genoa, Italy(计算机科学、生物工程、机器人与系统工程系(DIBRIS),热那亚大学,意大利) Harvard Medical School, Brigham and Women’s Hospital, Boston, USA(哈佛医学院,布里洛妇女医院,美国波士顿)

AI总结 本文提出一种患者特异性非刚性点云配准方法,结合Transformer架构与物理模拟算法,在合成和真实数据上均优于传统方法,显著提升手术安全性。

Journal ref Medical Image Computing and Computer Assisted Intervention - MICCAI 2025. MICCAI 2025. Lecture Notes in Computer Science, vol 15968. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06168 2026-04-16 cs.CV cs.RO

Action Images: End-to-End Policy Learning via Multiview Video Generation

动作图像:通过多视图视频生成实现端到端策略学习

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) NVIDIA(英伟达) Harvard University(哈佛大学) Genesis AI

AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。

Comments Project Page: https://actionimages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24119 2026-04-16 cs.CL cs.AI

Evaluating LLM-Based Translation of a Low-Resource Technical Language: The Medical and Philosophical Greek of Galen

评估基于大语言模型的低资源技术语言翻译:加伦的医学与哲学希腊语

James L. Zainaldin, Cameron Pattison, Manuela Marai, Jacob Wu, Mark J. Schiefsky

机构 * Department of Classical and Mediterranean Studies, Vanderbilt University(维斯尼尔大学古典与地中海研究系) Center for Hellenic Studies, Harvard University(哈佛大学希腊研究中心) Department of Philosophy, Vanderbilt University(维斯尼尔大学哲学系) Machine Intelligence and Normative Theory (MINT) Lab, Australian National University(澳大利亚国立大学机器智能与规范理论实验室) Department of the Classics, Harvard University(哈佛大学古典学系)

AI总结 本文评估了商业大语言模型在古希腊技术文本中的机器翻译质量,并将自动化评估指标与专家判断对比,发现术语稀有性是翻译失败的主要预测因素。

Comments Article + supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10877 2026-04-16 cs.LG

Guided Transfer Learning for Discrete Diffusion Models

指导式迁移学习用于离散扩散模型

Julian Kleutgens, Claudio Battiloro, Lingkai Kong, Benjamin Grewe, Francesca Dominici, Mauricio Tec

机构 * Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出GTL方法,通过比率引导实现离散扩散模型的迁移学习,解决小数据下模型性能问题,展示在序列数据中效果显著,但存在源分布与目标分布重叠不足时的失效模式。

Comments Accepted at ICLR 2026 ReALM-GEN Workshop 9 pages (main text) + appendix

Journal ref ICLR 2026 ReALM-GEN Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10946 2026-04-16 cs.CV

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

抽象3D感知用于视觉-语言模型中的空间智能

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07717 2026-04-16 cs.RO cs.CV

RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph

RoboTAG: 通过拓扑对齐图实现端到端的机器人配置估计

Yifan Liu, Fangneng Zhan, Wanhua Li, Haowen Sun, Katerina Fragkiadaki, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RoboTAG,通过结合3D和2D分支,利用拓扑对齐图缓解对标签的依赖,提升机器人姿态估计的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16662 2026-04-16 cs.HC cs.AI cs.IR cs.LG

Safire: Similarity Framework for Visualization Retrieval

Safire:可视化检索的相似性框架

Huyen N. Nguyen, Nils Gehlenborg

机构 * Harvard Medical School(哈佛医学院)

AI总结 本文提出Safire框架,通过比较标准和表示模态两个维度,系统化分析可视化相似性,揭示不同应用场景中相似性标准与表示模态的关联,并探讨其对多模态学习、AI应用和可视化可重复性的影响。

Comments To appear in IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏