ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding
ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准
机构 * Harvard Medical School(哈佛医学院)
AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。
高校专区
ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准
机构 * Harvard Medical School(哈佛医学院)
AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。
COMPASS:评估LLM代理在约束优化中的表现
机构 * Harvard University(哈佛大学) ; Apple(苹果公司) ; Virginia Tech(弗吉尼亚理工学院) ; UIUC(伊利诺伊大学香槟分校) ; UC Berkeley(加州大学伯克利分校)
AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。
跟随流动:文本到图像模型中文本令牌间信息流动的研究
机构 * Hebrew University of Jerusalem(海法大学) ; Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) ; Kempner Institute, Harvard University(哈佛大学凯普纳研究所)
AI总结 本文研究文本到图像模型中令牌表示间的信息分布,发现信息常集中于少数几个令牌,且令牌间存在孤立与交互影响,改进编码可提升生成质量。
Comments Accepted to ACL 2026
超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) ; Mass General Brigham(马萨诸塞总医院) ; Harvard Medical School(哈佛医学院) ; Department of Radiation Oncology(放射肿瘤科) ; Dana-Farber Cancer Institute(达纳-法伯癌症研究所) ; Brigham and Women’s Hospital(布里洛妇产科医院)
AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。
Comments We had major improvements in this second draft. Please refer to this version only
面向个性化和情境感知的Transformer模型:用于预测可穿戴传感器数据后干预的生理反应
机构 * Harvard University(哈佛大学) ; Princeton University(普林斯顿大学)
AI总结 本文提出基于Transformer的模型,用于预测干预后生理指标的时间轨迹及变化方向,通过结合多时间窗百分比变化和用户标记事件,验证个性化预测的可行性。
多模态操控 via 多模态策略共识
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Columbia University(哥伦比亚大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学)
AI总结 本文提出通过多模态策略共识实现多模态操控,采用扩散模型分解策略并利用路由网络动态组合模态贡献,提升机器人操控任务中多模态推理能力。
Comments 8 pages, 7 figures. Project website: https://policyconsensus.github.io
评分末尾的偏见
机构 * Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
AI总结 研究揭示奖励模型在文本到图像生成中因编码人口偏见导致性别和种族刻板印象强化及多样性崩溃的问题。
Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
迈向腹腔镜手术中的患者特异性变形配准
机构 * Biomedical Robotics Lab, Istituto Italiano di Tecnologia, Genoa, Italy(生物医学机器人实验室,意大利理工学院,热那亚) ; Department of Computer Science, Bioengineering, Robotics and Systems Engineering (DIBRIS), University of Genoa, Italy(计算机科学、生物工程、机器人与系统工程系(DIBRIS),热那亚大学,意大利) ; Harvard Medical School, Brigham and Women’s Hospital, Boston, USA(哈佛医学院,布里洛妇女医院,美国波士顿)
AI总结 本文提出一种患者特异性非刚性点云配准方法,结合Transformer架构与物理模拟算法,在合成和真实数据上均优于传统方法,显著提升手术安全性。
Journal ref Medical Image Computing and Computer Assisted Intervention - MICCAI 2025. MICCAI 2025. Lecture Notes in Computer Science, vol 15968. Springer
动作图像:通过多视图视频生成实现端到端策略学习
机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) ; NVIDIA(英伟达) ; Harvard University(哈佛大学) ; Genesis AI
AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。
Comments Project Page: https://actionimages.github.io/
评估基于大语言模型的低资源技术语言翻译:加伦的医学与哲学希腊语
机构 * Department of Classical and Mediterranean Studies, Vanderbilt University(维斯尼尔大学古典与地中海研究系) ; Center for Hellenic Studies, Harvard University(哈佛大学希腊研究中心) ; Department of Philosophy, Vanderbilt University(维斯尼尔大学哲学系) ; Machine Intelligence and Normative Theory (MINT) Lab, Australian National University(澳大利亚国立大学机器智能与规范理论实验室) ; Department of the Classics, Harvard University(哈佛大学古典学系)
AI总结 本文评估了商业大语言模型在古希腊技术文本中的机器翻译质量,并将自动化评估指标与专家判断对比,发现术语稀有性是翻译失败的主要预测因素。
Comments Article + supplementary information
指导式迁移学习用于离散扩散模型
机构 * Harvard University(哈佛大学) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 本文提出GTL方法,通过比率引导实现离散扩散模型的迁移学习,解决小数据下模型性能问题,展示在序列数据中效果显著,但存在源分布与目标分布重叠不足时的失效模式。
Comments Accepted at ICLR 2026 ReALM-GEN Workshop 9 pages (main text) + appendix
Journal ref ICLR 2026 ReALM-GEN Workshop
抽象3D感知用于视觉-语言模型中的空间智能
机构 * Tsinghua University(清华大学) ; Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。
RoboTAG: 通过拓扑对齐图实现端到端的机器人配置估计
机构 * Tsinghua University(清华大学) ; Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Nanyang Technological University(南洋理工大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出RoboTAG,通过结合3D和2D分支,利用拓扑对齐图缓解对标签的依赖,提升机器人姿态估计的鲁棒性。
Safire:可视化检索的相似性框架
机构 * Harvard Medical School(哈佛医学院)
AI总结 本文提出Safire框架,通过比较标准和表示模态两个维度,系统化分析可视化相似性,揭示不同应用场景中相似性标准与表示模态的关联,并探讨其对多模态学习、AI应用和可视化可重复性的影响。
Comments To appear in IEEE VIS 2025
离散流映射
机构 * Harvard University(哈佛大学) ; University of Oxford(牛津大学) ; MIT(麻省理工学院) ; Kempner Institute(凯普纳研究所)
AI总结 本文提出离散流映射,通过在概率单纯形几何上实现轨迹压缩,解决离散数据生成中的几何不匹配问题,提升离散流模型性能。
CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架
机构 * Boston Children’s Hospital(波士顿儿童医院) ; Harvard Medical School(哈佛医学院) ; University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院) ; Loyola University Chicago(芝加哥洛约拉大学) ; University of Wisconsin Madison(威斯康星大学麦迪逊分校)
AI总结 CLSGen 提出了一种双头微调框架,通过新的架构和方法实现概率估计与解释生成的平衡,实验表明其在分类和解释质量上优于现有基线。
鲁棒性中的隐藏故障:为什么监督不确定性量化需要更好的评估
机构 * University of Sheffield(谢菲尔德大学) ; Kempner Institute at Harvard University(哈佛大学肯普纳研究所) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Tohoku University(东北大学) ; RIKEN(理化学研究所)
AI总结 本文研究了监督不确定性探针的鲁棒性,发现现有方法在长文本生成中表现不佳,探针输入比架构更影响鲁棒性,提出混合回退策略提升鲁棒性。
交叉性趋炎附势:感知的用户人口统计如何影响大语言模型中的虚假验证
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学)
AI总结 研究探讨用户人口统计如何影响大语言模型的虚假验证行为,发现GPT-5-nano在哲学领域比数学领域更趋炎附势,而拉丁裔人群接受度最高,而自信的拉丁裔女性得分最低。
ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成
机构 * CUHK-Shenzhen(香港中文大学(深圳)) ; Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; USTC(中国科学技术大学) ; The University of Hong Kong(香港大学) ; University of Oxford(牛津大学) ; Harvard University(哈佛大学)
AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。
Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/
评估医学图像重建对下游AI公平性和性能的影响
机构 * Department of Data Science, Dana-Farber Cancer Institute(丹娜-法伯癌症研究所数据科学系) ; AI in Medicine, Technical University of Munich(慕尼黑工业大学医学人工智能) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算系) ; Harvard Medical School(哈佛医学院)
AI总结 研究通过结合重建与诊断AI模型,评估不同重建方法对下游任务性能和公平性的影响,发现传统指标无法准确反映任务表现,且重建可能放大性别偏见,但整体偏移量较小。
Comments Proceedings of the Medical Imaging with Deep Learning (MIDL) Conference 2026
差分隐私分布属性验证
机构 * Harvard University(哈佛大学) ; Rutgers University(罗格斯大学)
AI总结 本文研究差分隐私分布属性测试,探讨在不可信证明者帮助下验证分布属性的样本和通信复杂性,提出在不同隐私模型下优化协议的方法,并证明产品分布私有测试的样本复杂性最优。
原则不自行应用:一种诠释学视角下的人工智能对齐
机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)
AI总结 本文从诠释学角度探讨AI对齐问题,指出原则应用需依赖情境判断,强调对齐过程中的解释性成分,并指出部署响应分布与语料库分布差异可能导致审计失效。
IceCache: 用于长序列LLM的内存高效KV缓存管理
机构 * Simon Fraser University(西蒙菲莎大学) ; Harvard University(哈佛大学)
AI总结 本文提出IceCache,通过语义令牌聚类与PagedAttention结合,提升长序列LLM的内存效率与性能,实验表明其在256个令牌预算下保持99%的准确性,且在延迟和精度上优于其他方法。
通过可追溯的细化实现意图对齐的正式规范合成
机构 * Amazon Web Services(亚马逊云服务) ; Harvard University(哈佛大学)
AI总结 本文提出VeriSpecGen框架,通过需求级归因和局部修复生成意图对齐的规范,提升规范合成的准确性和效率。
秩小亦可远:随机骨架配合LoRA适配器足矣
机构 * Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) ; Institute for Theoretical Physics, TU Wien(维也纳工业大学理论物理研究所) ; Wyss Institute for Biologically Inspired Engineering, Harvard University(哈佛大学威斯生物启发工程研究所)
AI总结 通过LottaLoRA方法,研究神经网络参数中实际编码任务信息的占比,发现低秩LoRA适配器在冻结随机骨架上能恢复96-100%的性能,仅训练0.5-40%的参数。
大型语言模型中情感表征的潜在结构
机构 * Harvard University(哈佛大学)
AI总结 研究大型语言模型中情感表征的潜在几何结构,发现其与心理学中的valence-arousal模型一致,并展示了其在不确定性量化中的应用。
学习何时不学习:具有无界奖励的老虎机中风险敏感的退避策略
机构 * Harvard University(哈佛大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出一种风险敏感的退避算法,在无导师的情况下处理无界奖励的老虎机问题,通过确定性区域减少不可逆损害,理论证明了谨慎探索在高风险环境中的有效性。
Comments 19 pages, 3 figures; accepted to AISTATS 2026
Delta Rectified Flow Sampling 用于文本到图像编辑
机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) ; Computer Science Department, Harvard University(哈佛大学计算机科学系) ; Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)
AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。
AdvDINO:用于空间蛋白质组学的领域对抗自监督表示学习
机构 * Dana-Farber Cancer Institute(丹娜-法伯癌症研究所) ; Brigham and Women’s Hospital(布里格姆妇女医院) ; Harvard Medical School(哈佛医学院)
AI总结 AdvDINO通过整合梯度反转层提升DINOv2架构,以对抗领域偏移,从而在空间蛋白质组学中获得更稳健的表示。
Comments Proceedings of the Medical Imaging with Deep Learning (MIDL) Conference 2026
认知推理的混合:类脑的专业化模块推理
机构 * EPFL(瑞士联邦理工学院洛桑) ; Brain and Cognitive Sciences at MIT(麻省理工学院脑与认知科学系) ; Kempner Institute at Harvard University(哈佛大学肯普纳研究所)
AI总结 本文提出MiCRo模型,通过类脑专业化模块实现认知行为,提供可解释的推理模块,支持动态路由并优于基线模型。
Comments ICLR 2026. Project Page at https://cognitive-reasoners.epfl.ch