arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

共收录 1301
2607.22718 2026-07-28 cs.CV cs.AI 新提交

DAMamba-UNet3D: A Parameter-Efficient Mamba State Space U-Net with Dynamic Adaptive Scan for 3D Medical Image Segmentation

DAMamba-UNet3D:一种用于3D医学图像分割的参数高效的Mamba状态空间U-Net,采用动态自适应扫描

Mohammad Arafat Hussain, Ellen Grant, Yangming Ou

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院)

AI总结 该研究针对3D医学图像分割,提出DAMamba-UNet3D混合编码器-解码器,在编码器特定阶段集成三平面3D-DAS块,降低参数成本,通过实验对比展示其在分割性能上的优势,表明学习的三平面DAS在混合U-Net中有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28736 2026-07-28 cs.RO 版本更新

Imitation Learning for Robot Assistance in Open Surgery: A Multi-Policy Evaluation on Suture Following

开放手术中机器人辅助的模仿学习:针对缝合跟随的多策略评估

Xucheng Wang, Zhizhou Yang, Xiaoman Zhang, Sung Eun Kim, Romain Hardy, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

AI总结 本研究首次评估通用模仿学习在开放手术中用于外科医生-机器人协作辅助的可行性,以缝合跟随(每次缝合时助手执行的抓取-拉动-释放动作)为任务,通过比较四种策略(ACT、Diffusion Policy、SmolVLA、π₀)在28个训练模型上的表现,发现π₀在数据效率、背景鲁棒性和轨迹平滑性上最优,并在机器人缝合试验中达到92%的缝合完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14717 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新

Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling

跷跷板:通过平衡学习率和批量调度加速训练

Alexandru Meterez, Depen Morwani, Jingfeng Wu, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade

机构 * Harvard University(哈佛大学) Kempner Institute at Harvard University(哈佛大学 Kempner 机构) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究如何加速大语言模型预训练,提出Seesaw框架,通过平衡学习率和批量调度,在保留损失动态时减少串行步骤。理论上给出相关等效性证明并扩展,实验表明该框架能在相同浮点运算量下减少时钟时间,接近理论极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21973 2026-07-27 cs.CV 新提交

Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation

重新思考视觉基础模型适应中的逐层信息分配

Yuqi Li, Xi Xiao, Yunbei Zhang, Lin Zhao, Yu Li, Aiden Zhao, Tianyang Wang, Hao Xu, Yingli Tian

机构 * City College of New York, CUNY(纽约市立大学城市学院) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) Northeastern University(东北大学) George Washington University(乔治华盛顿大学) Capital One(第一资本金融公司) Harvard University(哈佛大学)

AI总结 研究视觉基础模型适应中的逐层信息分配问题,提出基于信息瓶颈原理的PIB框架,规范逐层压缩与充分性权衡,促进跨层信息连贯,实验表明该方法在多数据集上表现出色,能解释提示容量缩放行为等。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21627 2026-07-27 cs.AI cs.LG 新提交

Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems

模块各司其职吗?复合语言模型系统中的角色漂移

Xiaoyang Cao, Siddarth Srinivasan, Michiel A. Bakker

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

AI总结 研究复合语言模型系统中模块的角色漂移问题,提出角色锚定正则化方法,通过实验揭示仅准确性无法检测的角色漂移,该方法能以可调成本减轻漂移,且减少与角色漂移方向的对齐,而非简单抑制学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21716 2026-07-27 cs.LG cs.AI math.OC stat.ML 新提交

A Defense of the Quadratic Model

二次模型的辩护

Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

机构 * Kempner Institute at Harvard University(哈佛大学坎普纳研究所) MIT(麻省理工学院)

AI总结 研究对二次模型进行压力测试,通过泰勒展开预测优化动态,利用兰索斯求积法分析海森矩阵谱和局部稳定性,发现其在语言模型中能准确反映优化情况,或可作为预训练优化动态的理论易处理代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21403 2026-07-24 cs.LG stat.ME 新提交

A Diffusion-Model Subpopulation Digital Twin for Mobile Health Deployment: A Case Study on the HeartSteps Intervention

用于移动健康部署的扩散模型亚群数字孪生:以HeartSteps干预为例

Ziping Xu, Yuyi Chang, Chenshun Ni, Nithin Sugavanam, Asim H. Gazi, Pedja Klasnja, Emre Ertin, Susan A. Murphy

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The Ohio State University(俄亥俄州立大学) Harvard University(哈佛大学) University of Michigan(密歇根大学)

AI总结 研究针对移动健康干预算法设计问题,提出基于条件时间序列扩散模型开发“JITAI-Twins”数字孪生的方法,经多步更新,在HeartSteps干预部署预阶段验证,能更好再现目标亚群结构,为算法设计决策提供模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20543 2026-07-24 cs.LG cs.AI 新提交

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion

当可验证奖励的强化学习缩小推理边界时:诊断Pass@k反转

Todd Zhou

机构 * Harvard University(哈佛大学)

AI总结 研究RLVR中的Pass@k反转问题,提出双模式解释和PBA方法,通过实验表明PBA能提升\PassK{1}和覆盖率,诊断出普通GRPO丢失基础可解决提示,而PBA保留罕见阳性轨迹,强调训练后推理要兼顾优化强度与提示安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20466 2026-07-24 cs.AI 新提交

JAXBench: Benchmarking Autonomous TPU Kernel Optimization

JAXBench:自主TPU内核优化基准测试

Arya Tschand, Charles Hong, Julian Walker, Nina Cai, Shangkun Wang, Suvinay Subramanian, Sundar Dev, Vijay Janapa Reddi, Amir Yazdanbakhsh, Sethu Sankaran

机构 * Harvard University(哈佛大学) Google(谷歌公司) UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind)

AI总结 该研究针对TPU缺乏内核优化基准测试的问题,提出JAXBench套件,包含多个工作负载和算子。通过评估四种反馈驱动方法,发现特定上下文对优化更关键,条件设定和搜索结构能提升性能,最后发布相关基准测试等支持开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13904 2026-07-24 cs.AI 版本更新

Diagnosing Pathological Chain-of-Thought in Reasoning Models

诊断推理模型中的病理链式思维

Manqing Liu, David Williams-King, Ida Caspary, Linh Le, Hannes Whittingham, Puria Radmard, Cameron Tice, Edward James Young

机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) Imperial College London, London, UK(伦敦帝国学院) McGill University, Montreal, Canada(麦吉尔大学) Geodesic Research, Cambridge, UK(Geodesic研究)

AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14953 2026-07-24 cs.PL cs.LG 版本更新

Compiling to recurrent neurons

编译到循环神经元

Joey Velez-Ginorio, Nada Amin, Konrad Kording, Steve Zdancewic

机构 * University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学)

AI总结 本研究通过编译迭代为循环神经元,使离散结构在可微编程中得以有效利用,提升了神经网络的学习效率和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19943 2026-07-23 cs.CV 新提交

SIINR: Structurally Informed Implicit Neural Representations for super-resolution with uncertainty quantification of clinical quality diffusion MRI datasets

SIINR:用于临床质量扩散MRI数据集超分辨率及不确定性量化的结构信息隐式神经表示

Tom Hendriks, William Consagra, Anna Vilanova, Yogesh Rathi, Maxime Chamberland

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of South Carolina(南卡罗来纳大学) Brigham and Women’s Hospital, Harvard Medical School(布莱根妇女医院,哈佛医学院)

AI总结 针对临床dMRI数据集平面外分辨率低的问题,提出SIINR框架,利用监督3D U-net和自监督INR结合,实现超分辨率及不确定性量化,在多数据集和临床病例实验中表现优异,为临床dMRI增强及指标解释提供方法。

Comments 27 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06578 2026-07-23 math.ST cs.LG stat.ML stat.TH 版本更新

Kernel Ridge Regression Inference

核岭回归推断

Rahul Singh, Suhas Vijaykumar

机构 * Society of Fellows and Department of Economics, Harvard University(哈佛大学费尔 fellows 社会与经济学系) Department of Economics, U.C. San Diego(圣地亚哥大学经济学系)

AI总结 研究核岭回归的推断问题,构建有效精确且收缩率接近极小极大率的置信集,采用反对称乘数的自助程序,用于开发关于学生匹配效应的检验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19343 2026-07-22 cs.CV cs.RO 新提交

Masked Visual Actions for Unified World Modeling

用于统一世界建模的掩码视觉动作

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

机构 * Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学帕克分校) Harvard University(哈佛大学)

AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。

Comments Project webpage: https://masked-visual-actions.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18574 2026-07-22 cs.LG cs.NE q-bio.NC 新提交

Conditioned Direct Feedback Alignment via Activity and Error Geometry

通过活动和误差几何实现条件直接反馈对齐

Houman Safaai, Varun Reddy, Bernardo L. Sabatini

机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学坎普纳自然与人工智能研究所) Howard Hughes Medical Institute, Harvard Medical School(哈佛医学院霍华德·休斯医学研究所)

AI总结 研究直接反馈对齐(DFA)训练失败模式,通过分析各向异性进入局部权重更新的方式,提出条件DFA,经实验验证其在不同模型上有效,还介绍了归一化DFA家族及相关计算动机,强调是对局部外积规则失败的因子级研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18433 2026-07-22 cs.LG cs.AI nlin.AO 新提交

Intelligence from Learnable Novelty

可学习新奇性中的智能

Yanbo Zhang, Michael Levin

机构 * Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) Wyss Institute for Biologically Inspired Engineering at Harvard University(哈佛大学威斯生物启发工程研究所)

AI总结 研究表明可学习新奇性产生智能不同投影,基于廉价可微储层计算机给出闭式估计器。此估计器无监督可恢复复杂度分类,作目标能推动神经细胞自动机发展,作奖励可提升强化学习智能体表现,让智能相关研究有了共同定量基础。

Comments 24 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08436 2026-07-22 cs.NE cs.AI cs.MA cs.SY eess.SY q-bio.NC 版本更新

Active Electrosensing and Communication in MARL-trained Weakly Electric Fish Collectives

在多智能体强化学习训练的弱电鱼群体中的主动电感应与通信

Satpreet H. Singh, Sonja Johnson-Yu, Zhouyang Lu, Aaron Walsman, Federico Pedraja, Denis Turcu, Pratyusha Sharma, Naomi Saphra, Nathaniel B. Sawtell, Kanaka Rajan

机构 * Harvard University(哈佛大学) Brown University(布朗大学) Columbia University(哥伦比亚大学) MIT(麻省理工学院)

AI总结 研究个体互动如何产生复杂集体行为,通过多智能体强化学习训练弱电鱼样智能体集体觅食,再现真实鱼类特征,经模拟干预和神经动力学分析确定因果驱动因素,为弱电鱼等社会动物神经行为学研究提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01177 2026-07-22 cs.RO 版本更新

Scaling Cross-Embodiment World Models for Dexterous Manipulation

为灵巧操作扩展跨实体世界模型

Zihao He, Bo Ai, Tongzhou Mu, Yulin Liu, Weikang Wan, Jiawei Fu, Yilun Du, Henrik I. Christensen, Hao Su

机构 * UC San Diego(UC圣迭戈大学) Harvard University(哈佛大学) Shanghai Jiao Tong University(上海交通大学) Hillbot

AI总结 研究跨实体学习中不同形态机器人数据共享和控制转移问题,提出将人类和机器人手表示为3D粒子集,在随机交互数据上训练基于图的世界模型并与模型预测控制集成,实验表明该方法能提高泛化能力、有效结合数据并实现不同机器人手的控制。

Comments Accepted to IROS 2026, Project Page: https://alan-heoooh.github.io/dexwm.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17085 2026-07-22 cs.LG cs.GT stat.ML 版本更新

Data Reliability Scoring

数据可靠性评分

Yiling Chen, Shi Feng, Paul Kattuman, Fang-Yi Yu

机构 * Harvard University(哈佛大学) University of Cambridge(剑桥大学) George Mason University(乔治·梅森大学)

AI总结 研究在无法获取真实情况时评估数据集可靠性的问题,提出Gram行列式分数,通过衡量描述观测数据和实验结果的向量所跨体积来评估,实验表明该分数能有效捕捉不同观测过程中的数据质量,具有实验不可知论特性。

Comments 43 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06445 2026-07-22 cs.LG cs.AI cs.CL 版本更新

Can Interpretation Predict Behavior on Unseen Data?

解释能否预测未见过的数据上的行为?

Victoria R. Li, Jenny Kaufmann, Tian Qin, Martin Wattenberg, David Alvarez-Melis, Naomi Saphra

机构 * Harvard University(哈佛大学) Boston University(波士顿大学)

AI总结 研究探讨能否用模型内部预测对未见数据的响应,通过在合成任务上训练Transformer,利用注意力模式预测OOD行为,实验解耦解释的忠实性与预测价值,证明可通过理解模型内部评估分布转移下的行为和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17412 2026-07-21 cs.LG 新提交

CORAL: Learning Amyloid Fibril Ligand Docking with Cooperative Binding Rewards

CORAL:通过协同结合奖励学习淀粉样纤维配体对接

Yasheng Sun, Bohan Li, Youqi Tao, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(沙特阿卜杜拉国王科技大学生成式人工智能卓越中心) MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) Stern Laboratory, Brigham and Women’s Hospital, Harvard University(哈佛大学布莱根妇女医院斯特恩实验室)

AI总结 研究针对淀粉样纤维配体对接面临的挑战,提出CORAL强化学习框架,通过纳入协同配体 - 配体堆叠能量及蛋白质 - 配体对接亲和力训练模型,引入评估集,实验证明其在姿态质量和结合亲和力相关性上优于现有基线。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16224 2026-07-21 cs.CY cs.AI 新提交

International Agreements to Limit Frontier AI: Objectives and Exit

限制前沿人工智能的国际协议:目标与退出

Lennart Finke

机构 * ETH Zürich, Zurich, Switzerland(苏黎世联邦理工学院) Harvard University, Cambridge, United States(哈佛大学) MATS Research, Berkeley, United States(MATS研究)

AI总结 研究限制人工智能发展的国际协议,通过调查现有协议,明确适当条件属性并列出可能条件,建议设定固定时间段,由新组织规定发展条件,特殊情况可退出,以此说明相关协议的考虑因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16554 2026-07-21 cs.LG cs.AI cs.IT math.IT 新提交

Capacity and Redundancy Trade-offs in Multi-Task Learning

多任务学习中的容量与冗余权衡

Asif Khan

机构 * Harvard Medical School(哈佛医学院)

AI总结 研究多任务学习中负迁移与容量、冗余的关系,通过容量 - 冗余恒等式及相关结果,如聚类差距分解和梯度 - TC 桥梁,证明聚类 LoRA 可降低残余耦合,优于随机划分,有显著收益。

Comments Accepted in 42nd Conference on Uncertainty in Artificial Intelligence (UAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18209 2026-07-21 math.ST cs.LG stat.ME stat.ML stat.TH 新提交

Unveiling Invariant and Transferable Latent Factors Across Heterogeneous Environments via ATLAS

通过ATLAS揭示异构环境中的不变和可转移潜在因素

Yihong Gu, Katherine Liao, Tianxi Cai

机构 * Harvard University(哈佛大学)

AI总结 研究异构环境下多环境因素模型,提出ATLAS方法,利用不变性原理和辅助标签监督,分离不变与异构因素,用于潜在因素回归,在新环境中实现可转移预测,还建立了相关非渐近误差界。

Comments 47 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12111 2026-07-21 cs.AI cs.DS 版本更新

Adaptive Multi-Round Allocation with Stochastic Arrivals

自适应多轮分配与随机到达

Yuqi Pan, Davin Choo, Haichuan Wang, Milind Tambe, Alastair van Heerden, Cheryl Johnson

机构 * Harvard University(哈佛大学) University of Witwatersrand(沃特沙兰大学)

AI总结 研究了受适应性网络招募启发的序列资源分配问题,提出基于截断概率生成函数的动态规划算法,实现多项式复杂度的多轮分配方案,并分析了模型误差下的鲁棒性。

Comments Accepted into ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18613 2026-07-21 q-bio.NC cs.CL cs.CV 版本更新

The Illusion-Illusion: Vision Language Models See Illusions Where There Are None

错觉-错觉:视觉语言模型在不存在错觉的地方看到错觉

Tomer Ullman

机构 * Harvard University(哈佛大学)

AI总结 研究通过给视觉语言模型呈现不应引发处理错误的‘错觉-错觉’,发现许多模型会误将其视为错觉,揭示了模型存在基本处理错误,此失败是文献中更广泛失败的一部分。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏