arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2246
2603.29315 2026-04-01 cs.RO cs.AI

IMPASTO: Integrating Model-Based Planning with Learned Dynamics Models for Robotic Oil Painting Reproduction

IMPASTO:整合基于模型的规划与学习的动力学模型用于机器人油画复现

Yingke Wang, Hao Li, Yifeng Zhu, Hong-Xing Yu, Ken Goldberg, Li Fei-Fei, Jiajun Wu, Yunzhu Li, Ruohan Zhang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

AI总结 IMPASTO通过整合学习的动力学模型与基于模型的规划,实现机器人基于目标油画图像的复现,无需人类示范或精确模拟,提升复现精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29301 2026-04-01 cs.CV

Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

基于大语言模型的运动轨迹生成与验证的自一致性

Jiaju Ma, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

AI总结 本文提出利用自一致性技术提升大语言模型生成运动轨迹的准确性,通过聚类和几何变换实现轨迹的一致性验证,提升生成精度4-6%并验证精度11%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29240 2026-04-01 cs.RO

Long-Reach Robotic Cleaning for Lunar Solar Arrays

月球太阳能板的长距离机器人清洁

Stanley Wang, Velin Kojouharov, Long Yin Chung, Daniel Morton, Mark Cutkosky

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种小型移动机器人,配备长距离可展开臂和可更换清洁工具,用于月球太阳能板的温和清洁,减少人工干预,通过 compliant wrist 和速度基 admittance 控制器实现稳定接触。

Comments Extended abstract, 4 pages, 3 figures, accepted to and presented at the Sustainable Space Robotics Workshop at iSpaRo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29226 2026-04-01 cs.RO

Long-Reach Robotic Manipulation for Assembly and Outfitting of Lunar Structures

长距离机器人操作用于月球结构的装配与布线

Stanley Wang, Venny Kojouharov, Long Yin Chung, Daniel Morton, Mark Cutkosky

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种紧凑且长距离的机器人操作装置,用于月球结构的装配与布线任务,通过减少结构变形和振动提高操作精度。

Comments 7 pages, 6 figures, to appear in the proceedings of iSpaRo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29165 2026-04-01 cs.CV cs.AI cs.RO

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28997 2026-04-01 cs.CV

GenFusion: Feed-forward Human Performance Capture via Progressive Canonical Space Updates

GenFusion:通过渐进性规范空间更新实现前馈人体性能捕捉

Youngjoong Kwon, Yao He, Heejung Choi, Chen Geng, Zhengmao Liu, Jiajun Wu, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种前馈人体性能捕捉方法,通过单目RGB流生成表演者的新型视角。通过渐进式规范空间更新,利用时间连续性积累外观信息,实现更精确的重建与合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28804 2026-04-01 physics.ins-det cs.LG hep-ex nucl-ex

Generalizable Foundation Models for Calorimetry via Mixtures-of-Experts and Parameter Efficient Fine Tuning

通过专家混合和参数高效微调实现可推广的 calorimetry 基础模型

Carlos Cardona-Giraldo, Cristiano Fanelli, James Giroux, Cole Granger, Benjamin Nachman, Gerald Sabin

机构 * RNET Technologies Inc.(RNET技术公司) SLAC National Accelerator Laboratory(SLAC国家加速器实验室) Stanford University(斯坦福大学)

AI总结 本文提出一种基于next-token transformer的可推广calorimetry基础模型,结合专家混合预训练和参数高效微调,实现模块化适应不同材料和粒子类型,提升模拟效率和扩展性。

Comments 18 pages, 11 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28780 2026-04-01 cs.DC cs.AI

Byzantine-Robust and Communication-Efficient Distributed Training: Compressive and Cyclic Gradient Coding

具有容错性和通信效率的分布式训练:压缩和循环梯度编码

Chengxi Li, Youssef Allouah, Rachid Guerraoui, Mikael Skoglund, Ming Xiao

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Stanford University(斯坦福大学) Swiss Federal Institute of Technology in Lausanne (EPFL)(洛桑联邦理工学院)

AI总结 本文提出LAD方法,通过循环梯度编码提升分布式训练在拜占庭攻击下的鲁棒性,并引入Com-LAD进一步降低通信开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22150 2026-04-01 cs.CV

Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions

视觉语言模型是感知还是记忆?通过经典视觉错觉探测视觉感知与记忆

Xiaoxiao Sun, Mingyang Li, Kun Yuan, Min Woo Sun, Mark Endo, Shengguang Wu, Changlin Li, Yuhui Zhang, Zeyu Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑工业大学)

AI总结 本文通过经典视觉错觉研究视觉语言模型的感知与记忆机制,提出VI-Probe框架,揭示不同模型对视觉变化的响应来源,挑战单一原因观点。

Comments 26 pages, 31 figures, 13 tables. Project Page: https://sites.google.com/view/vi-probe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11780 2026-04-01 econ.EM cs.LG math.ST stat.ME stat.TH

Inference on Optimal Policy Values and Other Irregular Functionals via Softmax Smoothing

通过Softmax平滑对最优政策值及其他不规则函数进行推断

Justin Whitehouse, Qizhao Chen, Morgane Austern, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

AI总结 本文提出一种基于Softmax平滑的估计方法,用于推断最优治疗政策的价值,适用于静态和动态治疗方案,仅需拟合常数数量的 nuisance 模型,并在无治疗非响应概率时具有统计效率。

Comments 82 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21458 2026-04-01 cs.AI cs.CL cs.CV

MindCube: Spatial Mental Modeling from Limited Views

MindCube:从有限视角构建空间心理模型

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) New York University(纽约大学) University of Washington(华盛顿大学)

AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。

Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20663 2026-04-01 cs.CL

Prediction of Item Difficulty for Reading Comprehension Items by Creation of Annotated Item Repository

通过创建注释项目仓库预测阅读理解题难度

Radhika Kapoor, Sang T. Truong, Nick Haber, Maria Araceli Ruiz-Primo, Benjamin W. Domingue

机构 * Stanford University(斯坦福大学)

AI总结 本文通过创建包含阅读材料和学生成绩数据的注释仓库,利用惩罚回归模型预测项目难度,同时结合LLM嵌入进一步提升预测性能,为阅读理解题的分类和过滤提供工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13191 2026-03-31 cs.CV cs.AI cs.CL

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。

Comments Project Page: https://microsoft.github.io/CoPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28589 2026-03-31 cs.AI cs.LG

Towards a Medical AI Scientist

迈向医疗AI科学家

Hongtao Wu, Boyun Zheng, Dingjie Song, Yu Jiang, Jianfeng Gao, Lei Xing, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Lehigh University(里海大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

AI总结 本文提出医疗AI科学家框架,通过临床工程师协同推理机制生成可落地的医学研究想法,并基于结构化医学规范和伦理政策撰写论文,验证其在171案例、19临床任务和6种数据模态中的高质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28066 2026-03-31 cs.HC cs.AI

Synonymix: Unified Group Personas for Generative Simulations

Synonymix:生成模拟的统一群体人格

Huanxing Chen, Aditesh Kumar

机构 * Stanford University(斯坦福大学)

AI总结 本文提出Synonymix,通过图抽象和融合构建统一群体人格,实现群体层面的交互与模拟,验证了在社会调查中保留行为信号并保障隐私。

Comments 6 pages (excluding appendix), 3 figures, CHI'26 Extended Abstract (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27773 2026-03-31 cs.CV

RINO: Rotation-Invariant Non-Rigid Correspondences

RINO:旋转不变非刚性对应

Maolin Gao, Shao Jie Hu-Chen, Congyue Deng, Riccardo Marin, Leonidas Guibas, Daniel Cremers

机构 * TUM(慕尼黑工业大学) Stanford University(斯坦福大学) MCML(慕尼黑机器学习中心) MIT(麻省理工学院)

AI总结 本文提出RINO框架,通过旋转不变的特征提取器实现非刚性形状匹配,无需预对齐或手工特征,提升非等距变形等任务的性能。

Comments 17 pages, 36 Figures, Computer Vision and Pattern Recognition (CVPR) 2026

Journal ref Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23562 2026-03-31 cs.LG cs.AI

Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG

合成混合训练:在RAG之上扩展参数化知识获取

Seungju Han, Konwoo Kim, Chanwoo Park, Benjamin Newman, Suhas Kotha, Jaehun Jung, James Zou, Yejin Choi

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

AI总结 本文提出合成混合训练方法,结合合成问答和文档,通过互补训练信号提升模型性能,在QuaLITY基准上实现4.4%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27460 2026-03-31 cs.CV cs.AI

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

Project Imaging-X:1000多个开放访问医学影像数据集的调查

Zhongying Deng, Cheng Tang, Ziyan Huang, Jiashi Lin, Ying Chen, Junzhi Ning, Chenglong Ma, Jiyao Liu, Wei Li, Yinghao Zhu, Shujian Gao, Yanyan Huang, Sibo Ju, Yanzhou Su, Pengcheng Chen, Wenhao Tang, Tianbin Li, Haoyu Wang, Yuanfeng Ji, Hui Sun, Shaobo Min, Liang Peng, Feilong Tang, Haochen Xue, Rulin Zhou, Chaoyang Zhang, Wenjie Li, Shaohao Rui, Weijie Ma, Xingyue Zhao, Yibin Wang, Kun Yuan, Zhaohui Lu, Shujun Wang, Jinjie Wei, Lihao Liu, Dingkang Yang, Lin Wang, Yulong Li, Haolin Yang, Yiqing Shen, Lequan Yu, Xiaowei Hu, Yun Gu, Yicheng Wu, Benyou Wang, Minghui Zhang, Angelica I. Aviles-Rivero, Qi Gao, Hongming Shan, Xiaoyu Ren, Fang Yan, Hongyu Zhou, Haodong Duan, Maosong Cao, Shanshan Wang, Bin Fu, Xiaomeng Li, Zhi Hou, Chunfeng Song, Lei Bai, Yuan Cheng, Yuandong Pu, Xiang Li, Wenhai Wang, Hao Chen, Jiaxin Zhuang, Songyang Zhang, Huiguang He, Mengzhang Li, Bohan Zhuang, Zhian Bai, Rongshan Yu, Liansheng Wang, Yukun Zhou, Xiaosong Wang, Xin Guo, Guanbin Li, Xiangru Lin, Dakai Jin, Mianxin Liu, Wenlong Zhang, Qi Qin, Conghui He, Yuqiang Li, Ye Luo, Nanqing Dong, Jie Xu, Wenqi Shao, Bo Zhang, Qiujuan Yan, Yihao Liu, Jun Ma, Zhi Lu, Yuewen Cao, Zongwei Zhou, Jianming Liang, Shixiang Tang, Qi Duan, Dongzhan Zhou, Chen Jiang, Yuyin Zhou, Yanwu Xu, Jiancheng Yang, Shaoting Zhang, Xiaohong Liu, Siqi Luo, Yi Xin, Chaoyu Liu, Haochen Wen, Xin Chen, Alejandro Lozano, Min Woo Sun, Yuhui Zhang, Yue Yao, Xiaoxiao Sun, Serena Yeung-Levy, Xia Li, Jing Ke, Chunhui Zhang, Zongyuan Ge, Ming Hu, Jin Ye, Zhifeng Li, Yirong Chen, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Fudan University(复旦大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fuzhou University(福州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Incept Labs Monash University(莫纳什大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Alibaba DAMO Academy(阿里巴巴达摩院) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与产业研究院) Shanghai Academy of Artificial Intelligence for Science(上海科学智能研究院) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) School of Informatics, Xiamen University(厦门大学信息学院) University College London(伦敦大学学院) Sun Yat-sen University(中山大学) Alibaba Group, DAMO Academy, New York, NY, USA(阿里巴巴集团达摩院(纽约)) Tongji University(同济大学) University of Toronto(多伦多大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) Academy for Clinical Innovation and Translation of Shanghai(上海临床创新转化研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学) Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文调查了1000多个开放访问医学影像数据集,揭示了其规模小、任务碎片化和分布不均的问题,并提出元数据驱动融合方法和交互发现门户,为医学影像数据集的整合和基础模型发展提供路线图。

Comments 157 pages, 19 figures, 26 tables. Project repo: \url{https://github.com/uni-medical/Project-Imaging-X}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25053 2026-03-31 cs.CV

GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

GaussFusion: 通过几何引导的视频生成提升野外3D重建

Liyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft, Gordon Wetzstein, Iro Armeni

机构 * Stanford University(斯坦福大学) Zillow Group(Zillow集团)

AI总结 GaussFusion通过几何引导的视频生成技术改进3DGS重建,解决常见伪影问题,提供更鲁棒的3D重建方法,实现在新型视图合成中的最佳性能。

Comments CVPR 2026 main paper camera-ready. Project page: http://research.zhuliyuan.net/projects/GaussFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08847 2026-03-31 cs.AI cs.MA

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架

Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04618 2026-03-31 cs.LG cs.AI cs.CL

Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models

代理情境工程:为自我改进语言模型演化情境

Qizheng Zhang, Changran Hu, Shubhangi Upasani, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Jay Rainton, Chen Wu, Mengmeng Ji, Hanchen Li, Urmish Thakker, James Zou, Kunle Olukotun

机构 * Stanford University(斯坦福大学) SambaNova Systems, Inc.(SambaNova Systems公司) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出ACE框架,通过生成、反思和整理的模块化过程,使情境持续进化,提升语言模型在代理和领域推理中的性能,减少适应延迟和成本。

Comments ICLR 2026; 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19467 2026-03-31 cs.CL cs.AI

BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text

BRIDGE:用于评估大语言模型理解现实世界临床实践文本的基准测试

Jiageng Wu, Bowen Gu, Ren Zhou, Kevin Xie, Doug Snyder, Yixing Jiang, Valentina Carducci, Richard Wyss, Rishi J Desai, Emily Alsentzer, Leo Anthony Celi, Adam Rodman, Sebastian Schneeweiss, Jonathan H. Chen, Santiago Romero-Brufau, Kueiyu Joshua Lin, Jie Yang

机构 * Brigham and Women's Hospital(布莱根妇女医院) Harvard Medical School(哈佛医学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院) Mayo Clinic(梅奥诊所) Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院) Harvard University(哈佛大学) Stanford University(斯坦福大学) Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) Broad Institute of MIT and Harvard(博德研究所) Harvard Data Science Initiative(哈佛数据科学计划)

AI总结 本文提出BRIDGE基准测试,涵盖9种语言的87项任务,涵盖患者护理全过程的六个临床阶段和20种应用,评估95种LLM在不同推理策略下的性能差异,展示开源模型与专业模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26831 2026-03-31 cs.CV cs.AI

Envisioning global urban development with satellite imagery and generative AI

用卫星影像和生成式AI展望全球城市发展

Kailai Sun, Yuebing Liang, Mingyi He, Yunhan Zheng, Alok Prakash, Shenhao Wang, Jinhua Zhao, Alex "Sandy'' Pentland

机构 * Singapore–MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工学院研究与技术联盟中心) Department of Urban Planning, Tsinghua University(清华大学城市规划系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Stanford Institute for Human-Centered Artificial Intelligence, Stanford University(斯坦福大学以人为本人工智能研究所)

AI总结 本文提出一种多模态生成式AI框架,通过整合提示和地理空间控制,生成全球500个最大都会区的高保真城市卫星影像,支持可持续城市发展和场景规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26814 2026-03-31 cs.CV cs.RO

arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery

arg-VU:结合物理感知的3D几何进行视觉理解的意图推理

Nan Xiao, Yunxin Fan, Farong Wang, Fei Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Stanford University(斯坦福大学)

AI总结 arg-VU通过整合时间一致的几何跟踪与约束诱导的机械建模,提升手术场景中变形组织的意图推理能力,实现更稳定和物理一致的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26494 2026-03-30 quant-ph cs.CL

Entanglement as Memory: Mechanistic Interpretability of Quantum Language Models

纠缠作为记忆:量子语言模型的机制可解释性

Nathan Roll

机构 * Stanford University(斯坦福大学)

AI总结 研究通过因果门消融、纠缠追踪和密度矩阵交换干预,揭示量子语言模型在长程依赖任务中单量子比特与双量子比特模型的机制差异及噪声-表达性权衡。

Comments 9 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24999 2026-03-30 stat.AP cs.AI

Efficient Detection of Bad Benchmark Items with Novel Scalability Coefficients

高效检测劣质基准项目:基于新颖可扩展系数的方法

Michael Hardy, Joshua Gilbert, Benjamin Domingue

机构 * Stanford University, CA, United States(斯坦福大学,美国加利福尼亚州) Harvard University, MA, United States(哈佛大学,美国马萨诸塞州)

AI总结 本文提出基于交叉项目等比回归的非参数可扩展系数,用于高效检测全球劣质项目,通过Kendall's τ保持关联方向,实现无假设线性或参数模型的项目评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08277 2026-03-30 cs.CV cs.AI

PISCO: Precise Video Instance Insertion with Sparse Control

PISCO:具有稀疏控制的精确视频实例插入

Xiangbo Gao, Renjie Li, Xinghao Chen, Yuheng Wu, Suofei Feng, Qing Yin, Zhengzhong Tu

机构 * Stanford University(斯坦福大学)

AI总结 本文提出PISCO模型,通过稀疏关键帧控制实现精确视频实例插入,解决传统视频编辑中对空间时间定位、物理一致性及动态保持的挑战,采用变量信息引导和分布保持时间遮罩技术提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏