arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

共收录 1302
2601.05414 2026-04-27 cs.CL cs.AI stat.ML

Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions

大语言模型是糟糕的骰子玩家:LLM在生成统计分布的随机数时表现不佳

Minda Zhao, Yilun Du, Mengyu Wang

机构 * Harvard University(哈佛大学)

AI总结 研究发现大语言模型在生成随机数时存在显著缺陷,其采样能力随分布复杂度和采样范围增加而下降,导致下游任务出现系统性偏差。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21898 2026-04-27 cs.RO cs.AI

Flexible Multitask Learning with Factorized Diffusion Policy

灵活的多任务学习与因子化扩散策略

Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Norwegian University of Science and Technology(挪威科学与技术大学) Columbia University(哥伦比亚大学)

AI总结 本文提出一种因子化扩散策略框架,通过将复杂动作分布分解为多个专用扩散模型,提升多任务学习的灵活性和适应性,实验证明其在仿真和现实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21263 2026-04-24 cs.AI cs.PL cs.SE q-bio.QM

Trustworthy Clinical Decision Support Using Meta-Predicates and Domain-Specific Languages

可信的临床决策支持使用元谓词和领域特定语言

Michael Bouzinier, Sergey Trifonov, Michael Chumack, Eugenia Lvova, Dmitry Etin

机构 * Harvard University(哈佛大学) IDEXX Laboratories(IDEXX实验室) Forome Association(Forome协会) Deggendorf Institute of Technology(德格多夫技术学院)

AI总结 本文提出使用元谓词和领域特定语言来确保临床决策规则的证据适当性,通过元谓词验证在部署前约束证据使用,提升决策的可审计性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21215 2026-04-24 cs.LG

The Recurrent Transformer: Greater Effective Depth and Efficient Decoding

递归变换器:更大的有效深度和高效的解码

Costin-Andrei Oncescu, Depen Morwani, Samy Jelassi, Alexandru Meterez, Mujin Kwun, Sham Kakade

机构 * Harvard University(哈佛大学)

AI总结 递归变换器通过层间递归记忆机制,在保持标准自回归解码成本的同时,提升了有效深度并减少了内存占用,实现了比传统变换器更高效的解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21138 2026-04-24 cs.RO cs.AI

Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems

在杂乱中导航:基于路标的目标级规划用于多机器人系统

Jiabao Ji, Yongchao Chen, Yang Zhang, Ramana Rao Kompella, Chuchu Fan, Gaowen Liu, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Cisco Research(思科研究)

AI总结 本文提出了一种混合多机器人控制框架,通过引入路标和课程训练策略,解决多机器人任务和运动规划的联合优化问题,提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19774 2026-04-23 cs.CL cs.AI

Phase 1 Implementation of LLM-generated Discharge Summaries showing high Adoption in a Dutch Academic Hospital

LLM生成的出院小结在荷兰学术医院中的阶段1实施显示高采用率

Nettuno Nadalini, Tarannom Mehri, Anne H Hoekman, Katerina Kagialari, Job N Doornberg, Tom P van der Laan, Jacobien H F Oosterhoff, Rosanne C Schoonbeek, Charlotte M H H T Bootsma-Robroeks

机构 * Department of Health Information Office, Data & Digitalization, University Medical Center(健康信息办公室、数据与数字化化大学医院) Department of Trauma Surgery / Orthopedics, University Medical Center(创伤外科/骨科大学医院) Department of Orthopaedic Surgery, Massachusetts General Hospital(骨科手术科马萨诸塞总医院) Harvard Medical School Orthopaedic Trauma Initiative(哈佛医学院骨创伤倡议) Department of Orthopaedic Surgery and Sports Medicine, Amsterdam UMC location University of Amsterdam(骨科手术与运动医学部门,阿姆斯特丹UMC地点大学) Department of Orthopaedic Trauma, Flinders University Medical Centre(骨创伤部门,弗林德斯大学医疗中心) Department of Otolaryngology – Head and Neck Surgery, University Medical Center(耳鼻喉科-头颈外科大学医院) Department of Pediatrics, Pediatrics Nephrology, Beatrix Children’s Hospital, University Medical Center(儿科、儿科肾病学,比西特儿童医院,大学医院)

AI总结 本研究评估了集成到电子健康记录中的LLM生成出院小结草案的效果,结果显示高采用率和文档时间减少,支持进一步实施。

Comments The methods section is located after the discussion in this manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18570 2026-04-23 cs.LG cs.AI cs.CL

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17172 2026-04-23 cs.DC cs.AI

UCCL-Zip: Lossless Compression Supercharged GPU Communication

UCCL-Zip: 无损压缩增强的GPU通信

Shuang Ma, Chon Lam Lao, Zhiying Xu, Zhuang Wang, Ziming Mao, Delong Meng, Jia Zhen, Jun Wu, Ion Stoica, Yida Wang, Yang Zhou

机构 * UC Davis(加州大学戴维斯分校) Harvard University(哈佛大学) Amazon Web Services(亚马逊网络服务) UC Berkeley(加州大学伯克利分校)

AI总结 UCCL-Zip通过无损压缩提升GPU通信效率,支持点对点和集体通信,无需修改API且保持数值精度,实测加速强化学习权重同步达47.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03624 2026-04-23 cs.HC cs.CL

LLAMADRS: Evaluating Open-Source LLMs on Real Clinical Interviews--To Reason or Not to Reason?

LLAMADRS:在真实临床访谈中评估开源大语言模型——理性推理还是不理性推理?

Gaoussou Youssouf Kebe, Jeffrey M. Girard, Einat Liebenthal, Justin Baker, Fernando De la Torre, Louis-Philippe Morency

机构 * Carnegie Mellon University, School of Computer Science(卡内基梅隆大学计算机学院) University of Kansas, Department of Psychology(堪萨斯大学心理学系) McLean Hospital, Harvard Medical School(麦肯纳医院哈佛医学院)

AI总结 本文通过LLAMADRS基准测试,评估了25种开源大语言模型在结构化临床评估中的表现,发现理性推理模型在误差控制上并不总是更优,提示提示设计对模型性能有关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18236 2026-04-23 cs.CV

Human-like Content Analysis for Generative AI with Language-Grounded Sparse Encoders

具有语言基础的稀疏编码的生成AI内容分析

Yiming Tang, Arash Lagzian, Srinivas Anumasa, Qiran Zou, Yingtao Zhu, Ye Zhang, Trang Nguyen, Yih-Chung Tham, Ehsan Adeli, Ching-Yu Cheng, Yilun Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) Harvard University(哈佛大学)

AI总结 本文提出LanSE工具,通过自然语言描述将图像分解为可解释的视觉模式,实现了对生成AI内容的细粒度分析,提升了物理合理性评估并扩展至医学影像领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01703 2026-04-23 cs.CY cs.AI cs.LG eess.AS

Community-Informed AI Models for Police Accountability

面向警察问责的社区导向AI模型

Benjamin A. T. Graham, Lauren Brown, Georgios Chochlakis, Morteza Dehghani, Raquel Delerme, Brittany Friedman, Ellie Graeden, Preni Golazizian, Rajat Hebbar, Parsa Hejabi, Aditya Kommineni, Mayagüez Salinas, Michael Sierra-Arévalo, Jackson Trager, Nicholas Weller, Shrikanth Narayanan

机构 * Department of Political Science and International Relations, University of Southern California(美国南加州大学政治学与国际关系系) School of Public Policy, University of Southern California(美国南加州大学公共政策学院) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California(美国南加州大学信号分析与解释实验室) Department of Computer Science, University of Southern California(美国南加州大学计算机科学系) Brain and Creativity Institute, University of Southern California(美国南加州大学脑与创造力研究所) Department of Sociology, University of Southern California(美国南加州大学社会学系) Center for Global Health Science and Security, Georgetown University(乔治城大学全球健康科学与安全中心) Department of Electrical and Computer Engineering, University of Southern California(美国南加州大学电气与计算机工程系) The Lewis Registry(李氏登记处) Department of Sociology, The University of Texas at Austin(德克萨斯大学奥斯汀分校社会学系) Department of Psychology, University of Southern California(美国南加州大学心理学系) Department of Political Science, University of California Riverside(加州大学河滨分校政治学系) Harvard Law School, Harvard University(哈佛大学法学院)

AI总结 本文提出一种社区导向的多视角AI工具开发方法,通过整合多方观点提升政府问责透明度,以洛杉矶警察局交通停靠记录分析为例展示其应用。

Comments 33 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16487 2026-04-22 cs.CV cs.AI

Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering

通过局部跨模态对齐与引导实现几何感知的CLIP检索

Nirmalendu Prakash, Narmeen Fatimah Oozeer, Xin Su, Phillip Howard, Shaan Shah, Zoe Wanying He, Shuang Wu, Shivam Raval, Roy Ka-Wei Lee, Meenakshi Khosla, Amir Abdullah

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Martian Thoughtworks UCSD(加州大学圣塔莫尼卡分校) Harvard University(哈佛大学)

AI总结 本文提出通过局部跨模态对齐与引导改进CLIP检索,通过匈牙利匹配实现邻居级重排序,并利用查询条件局部引导提升属性绑定和组合检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12258 2026-04-22 cs.CL cs.AI

Coding-Free and Privacy-Preserving Agentic Framework for Data-Driven Clinical Research

无编码且隐私保护的代理框架用于数据驱动的临床研究

Taehun Kim, Hyeryun Park, Hyeonhoon Lee, Yushin Lee, Kyungsang Kim, Hyung-Chul Lee

机构 * Infmedix, Co., Ltd.(Infmedix公司) Department of Transdisciplinary Studies, Seoul National University(首尔国立大学跨学科研究系) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究所) Department of Medicine, Seoul National University College of Medicine(首尔国立大学医学院医学系) Department of Transdisciplinary Medicine, Seoul National University Hospital(首尔国立大学医院跨学科医学系) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院放射科及哈佛医学院)

AI总结 本文提出CARIS框架,通过整合大语言模型与模块化工具,实现无需编程的自然语言驱动研究,提升临床研究效率与隐私保护。

Comments 10 pages, 5 figures, 2 tables, Supplementary Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09775 2026-04-22 cs.AR cs.AI cs.DC cs.LG

MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference

MIST:一种用于异构、多阶段LLM推理的联合设计框架

Abhimanyu Rajeshkumar Bambhaniya, Hanjiang Wu, Suvinay Subramanian, Sudarshan Srinivasan, Souvik Kundu, Amir Yazdanbakhsh, Midhilesh Elavazhagan, Madhu Kumar, Minlan Yu, Arijit Raychowdhury, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Google(谷歌) Intel(英特尔) Intel Labs(英特尔实验室) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) Infravana

AI总结 MIST是一种用于异构、多阶段LLM推理的联合设计框架,通过模拟不同请求阶段和复杂硬件层次,优化硬件-软件协同设计,解决LLM推理中的配置空间导航和跨厂商PD配置问题。

Comments Inference System Design for Multi-Stage AI Inference Pipelines. 11 Pages, 10 Figues, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18459 2026-04-21 cs.CV cs.AI

Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions

渐进式在线视频理解与证据对齐的透明决策

Kecheng Zhang, Zongxin Yang, Mingfei Han, Haihong Hao, Yunzhi Zhuge, Changlin Li, Junhan Zhao, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) Harvard University(哈佛大学) Department of CV, MBZUAI(MBZUAI计算机视觉部门) Dalian University of Technology(大连理工大学) Stanford University(斯坦福大学) Chicago University(芝加哥大学)

AI总结 本文提出一种新型框架,通过分离推理控制与记忆整合,解决在线视频理解中的决策透明、时间对齐和计算预算限制问题,显著提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18258 2026-04-21 cs.CV cs.AI

Long-Text-to-Image Generation via Compositional Prompt Decomposition

通过组合提示分解实现长文本到图像生成

Jen-Yuan Huang, Tong Lin, Yilun Du

机构 * Peking University(北京大学) Harvard University(哈佛大学)

AI总结 本文提出PRISM方法,通过轻量模块提取长提示的组成部分,使预训练T2I模型能处理长序列输入,实现对复杂场景的建模,优于基线模型。

Comments Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29935 2026-04-21 cs.CY cs.AI

Rethinking AI Literacy Education in Higher Education: Bridging Risk Perception and Responsible Adoption

重新思考高等教育中的AI素养教育:弥合风险感知与负责任采用之间的鸿沟

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * School of Professional Studies, Clark University(克拉克大学专业研究学院) Cardiff School of Technologies, Cardiff Metropolitan University(卡迪夫 Metropolitan 大学技术学院) Harvard Medical School(哈佛医学院)

AI总结 研究探讨了技术学生对AI风险的认知与采用意愿的关系,发现具体风险比抽象风险更受关注,技术教育缩小了性别差异但男性更愿采用AI,提出需差异化策略弥合意识与负责任采用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06803 2026-04-21 cs.CL cs.CV

Forest Before Trees: Latent Superposition for Efficient Visual Reasoning

森林在树之前:用于高效视觉推理的潜在叠加

Yubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu

机构 * MBZUAI Fudan University(复旦大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Harvard University(哈佛大学)

AI总结 本文提出Laser方法,通过动态窗口对齐学习实现视觉推理的'森林在树之前'认知层次,提升模型在保持全局特征叠加的同时,实现高效且可解释的视觉推理。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17505 2026-04-21 cs.GT cs.AI cs.LG cs.MA

Learning Unanimously Acceptable Lotteries via Queries

通过查询学习一致可接受的彩票

Davin Choo, Paul W. Goldberg, Nicholas Teh

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学)

AI总结 研究通过查询模型确定一致可接受的彩票,提出确定性和随机性算法以找到可行彩票或证明不可行,并分析查询复杂度与下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17224 2026-04-21 cs.LG stat.ML

LASER: Low-Rank Activation SVD for Efficient Recursion

LASER:低秩激活SVD用于高效递归

Ege Çakar, Ketan Ali Raghu, Lia Zheng

机构 * Harvard University(哈佛大学)

AI总结 本文研究了递归架构中激活流形的几何结构,提出LASER框架通过动态压缩实现激活记忆节省,同时保持模型精度。

Comments Accepted to the Latent and Implicit Thinking Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22368 2026-04-21 cs.CV cs.AI

When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations

当视觉不是问题:在误导性数据可视化上评估视觉-语言模型

Harsh Nishant Lalai, Raj Sanjay Shah, Hanspeter Pfister, Sashank Varma, Grace Guo

机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度理工学院和科学学院,皮拉尼) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

AI总结 本文评估视觉-语言模型在识别误导性数据可视化中的能力,发现模型在检测可视化设计错误上更可靠,但常误判非误导性可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21257 2026-04-21 cs.CL

MoCo: A One-Stop Shop for Model Collaboration Research

MoCo:模型协作研究的一站式解决方案

Shangbin Feng, Yuyang Bai, Ziyuan Yang, Yike Wang, Zhaoxuan Tan, Jiajie Yan, Zhenyu Lei, Wenxuan Ding, Weijia Shi, Haojin Wang, Zhenting Qi, Yuru Jiang, Heng Wang, Chengsong Huang, Yu Fei, Jihan Yao, Yilun Du, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) University of Notre Dame(诺特大学) University of Virginia(弗吉尼亚大学) New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。

Comments Moco is available at https://github.com/BunsenFeng/model_collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09378 2026-04-21 cs.LG cs.AI

The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton

二阶优化在大语言模型中的潜力:基于完整高斯-牛顿方法的探讨

Natalie Abreu, Nikhil Vyas, Sham Kakade, Depen Morwani

机构 * Kempner Institute, Harvard University(哈佛大学凯普纳研究所) Department of Computer Science, Harvard University(哈佛大学计算机科学系)

AI总结 本文通过完整高斯-牛顿预处理探讨了二阶优化在大语言模型训练中的潜力,发现其在训练迭代次数上比现有优化器提升5.4倍,并表明分层Hessian结构能有效实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15815 2026-04-21 cs.CL cs.AI cs.HC

User-Assistant Bias in LLMs

大语言模型中的用户-助手偏见

Xu Pan, Jingxuan Fan, Zidi Xiong, Ely Hahami, Jorin Overwiening, Ziqian Xie

机构 * Harvard University(哈佛大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校)

AI总结 本文研究了大语言模型中因角色标签训练数据不一致导致的用户-助手偏见,通过UserAssist基准测试发现指令微调模型存在强用户偏见,而基础和推理模型接近中性,揭示了角色标签训练的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16220 2026-04-20 cs.LG

OT on the Map: Quantifying Domain Shifts in Geographic Space

在地图上进行最优传输:量化地理空间中的领域偏移

Haoran Zhang, Livia Betti, Konstantin Klemmer, Esther Rolf, David Alvarez-Melis

机构 * Harvard University(哈佛大学) Kempner Institute(Kempner研究所) Microsoft Research(微软研究院) University of Colorado Boulder(科罗拉多大学博尔德分校) LGND AI, Inc.(LGND AI公司) University College London(伦敦大学学院)

AI总结 本文提出GeoSpOT方法,利用地理信息与最优传输量化地理领域偏移,有效预测跨领域迁移难度,并指导数据选择与性能预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16083 2026-04-20 cs.CV

DINOv3 Beats Specialized Detectors: A Simple Foundation Model Baseline for Image Forensics

DINOv3超越专用检测器:一种简单的基础模型基准用于图像取证

Jieming Yu, Qiuxiao Feng, Zhuohan Wang, Xiaochen Ma

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harvard University(哈佛大学)

AI总结 本文提出基于DINOv3的简单但强大的基础模型基准,通过LoRA适配和轻量卷积解码器,在四个标准基准上提升像素级F1得分17.0点,且在数据稀缺情况下表现优于现有方法。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05201 2026-04-20 cs.CV cs.AI cs.CL

Mechanisms of Prompt-Induced Hallucination in Vision-Language Models

视觉-语言模型中提示诱导幻觉的机制

William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学) Technion(技术学院) University of Tübingen(图宾根大学) Harvard University(哈佛大学)

AI总结 研究揭示了视觉-语言模型在提示诱导幻觉中的机制,通过分析三种模型发现特定注意力头可显著减少幻觉现象,揭示了模型对提示的响应差异。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04497 2026-04-20 cs.CL cs.AI

Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research

大型语言模型在人文学科研究中低资源语言的机会与挑战

Tianyang Zhong, Zhenyuan Yang, Zhengliang Liu, Ruidong Zhang, Weihang You, Yiheng Liu, Haiyang Sun, Yi Pan, Yiwei Li, Yifan Zhou, Hanqi Jiang, Junhao Chen, Xiang Li, Tianming Liu

机构 * School of Computing, The University of Georgia(佐治亚大学计算机学院) Department of Mathematical and Statistical Sciences, University of Alberta(阿尔伯塔大学数学与统计科学系) University of California, Los Angeles(加州大学洛杉矶分校) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院放射科和哈佛医学院)

AI总结 本文探讨了大型语言模型在低资源语言研究中的应用,分析了数据获取、模型适应性和文化敏感性等挑战,并强调了跨学科合作与定制模型的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15808 2026-04-20 cs.CV cs.AI

Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

超越单帧:跨体积MRI的多帧空间接地推理

Lama Moukheiber, Caleb M. Yeung, Haotian Xue, Alec Helbling, Zelin Zhao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学) Georgetown University(乔治城大学)

AI总结 本文提出SGMRI-VQA基准,通过多帧空间接地推理提升医学VLMs性能,展示监督微调提升接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏