arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2237
2605.23262 2026-05-25 cs.AI

Design and Report Benchmarks for Knowledge Work

知识工作的设计与报告基准

Yining Hua, Hongbin Na, Cyrus Ayubcha, Levi Lian

机构 * Harvard University(哈佛大学) University of Technology Sydney(悉尼科技大学) Stanford University(斯坦福大学) Raycaster AI

AI总结 针对当前知识工作评估基准与真实部署脱节的问题,提出三步法(定义工作活动、指定测试设置、评分工作产品)来明确基准任务与工作主张的对应关系,并通过三个案例分析展示设计选择如何影响可支持的工作主张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23244 2026-05-25 cs.LG

Convex Optimization for Alignment and Preference Learning on a Single GPU

单GPU上的对齐与偏好学习的凸优化

Miria Feng, Mert Pilanci

机构 * Department of Electrical Engineering, Stanford University, California, United States(斯坦福大学电气工程系,加州,美国)

AI总结 提出COALA算法,利用凸优化重表述消除参考模型,在单GPU上高效训练,性能与DPO相当但计算量仅为其17.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23235 2026-05-25 cs.LG

Convex Low-resource Accent-Robust Language Detection in Speech Recognition

语音识别中的凸低资源口音鲁棒语言检测

Miria Feng, William Tan, Mert Pilanci

机构 * Department of Electrical Engineering(电气工程系) Department of Computer Science, Stanford University, California, United States(计算机科学系,斯坦福大学,加利福尼亚,美国)

AI总结 提出凸语言检测(CLD)框架,利用凸优化和ADMM算法,在低资源条件下实现高精度、鲁棒的口音语言检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23204 2026-05-25 cs.AI

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery

AutoResearch AI:迈向人工智能驱动的科研自动化以实现科学发现

Guiyao Tie, Jiawen Shi, Dingjie Song, Yixiao Huang, Ziji Sheng, Xueyang Zhou, Daizong Liu, Pan Zhou, Yongchao Chen, Ran Xu, Lifang He, Qingsong Wen, Manling Li, Cong Lu, Shuai Li, Pengtao Xie, Yixuan Yuan, Rui Meng, Lei Xing, Lichao Sun, Caiming Xiong, Philip S. Yu, Jianfeng Gao

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(莱斯大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Salesforce Research(Salesforce研究) Squirrel AI Learning(Squirrel AI学习) Northwestern University(西北大学) Independent(独立) Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Chinese University of Hong Kong(香港中文大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Stanford University(斯坦福大学) Google Cloud AI Research(谷歌云AI研究) Recursive Superintelligence(递归超级智能) Microsoft Research(微软研究院)

AI总结 本文综述了AI驱动的科研工作流自动化(AutoResearch)的发展,分析了从任务级AI到工作流级研究自动化的转变,并提出了五个评估维度(新颖性、有效性、影响力、可靠性和溯源),指出自主性受领域条件限制。

Comments 49 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23093 2026-05-25 cs.CL cs.CY

A Comparative Evaluation of Structural Topic Models and BERTopic for Short, Open-Ended Survey Responses

结构主题模型与BERTopic在简短开放式调查回答中的比较评估

Yan Jiang, Sihong Liu, Philip A. Fisher

机构 * Stanford Center on Early Childhood, Stanford University(斯坦福大学早期儿童研究中心)

AI总结 本文比较了概率词袋模型(STM)与嵌入模型(BERTopic)在简短开放式调查回答上的表现,发现BERTopic在主题连贯性上更优,而STM在协变量推断分析上更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01018 2026-05-25 cs.CV

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Junzhe Huang, Xiaoxiao Sun, Yan Yang, Yuxuan Hou, Ruotian Zhang, Sirui Li, Hehe Fan, Serena Yeung-Levy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Stanford University(斯坦福大学) The Australian National University(澳大利亚国立大学) Zhejiang University(浙江大学) Murdoch University(莫纳什大学) The University of Adelaide(阿德莱德大学)

AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03244 2026-05-25 cs.AI cs.CY cs.DB

AI Evaluation Should Require Standardized Item-Level Data Releases

AI评估应要求标准化的项目级数据发布

Han Jiang, Susu Zhang, Dongyao Zhu, Yuzhuo Bai, Sang T. Truong, Xiaoyuan Yi, Sanmi Koyejo, Xing Xie, Ziang Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia(微软亚洲研究院) Stanford University(斯坦福大学) North Carolina State University(北卡罗来纳州立大学) Tsinghua University(清华大学)

AI总结 本文主张AI评估应标准化发布项目级数据,以解决当前评估中项目选择不明确、构造错位和泛化能力差的问题,并通过OpenEval项目展示其可行性和价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01088 2026-05-25 cs.LG math.OC

CRONOS: Enhancing Deep Learning with Scalable GPU Accelerated Convex Neural Networks

CRONOS: 利用可扩展的GPU加速凸神经网络增强深度学习

Miria Feng, Zachary Frangella, Mert Pilanci

机构 * Stanford University(斯坦福大学)

AI总结 提出CRONOS算法用于两层神经网络的凸优化,并扩展为CRONOS-AM以训练任意架构的多层网络,在ImageNet等大规模数据集上实现与主流深度学习优化器相当或更优的验证精度。

Journal ref Advances in Neural Information Processing Systems 37 (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22785 2026-05-22 cs.CL

Evaluating Commercial AI Chatbots as News Intermediaries

评估商业AI聊天机器人作为新闻中介

Mirac Suzgun, Emily Shen, Federico Bianchi, Alexander Spangher, Thomas Icard, Daniel E. Ho, Dan Jurafsky, James Zou

机构 * Stanford University(斯坦福大学) Independent Researcher(独立研究者) Together AI

AI总结 本研究评估了AI聊天机器人在跨语言和区域处理新兴事实的准确性,发现其在多选题中表现良好,但在自由回答和复杂问题上存在显著误差,揭示了区域不平等和依赖检索基础设施的问题。

Comments https://suzgunmirac.github.io/ai-news-preview/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21811 2026-05-22 cs.RO

Safe and Steerable Geometric Motion Policies for Robotic Dexterous Manipulation

安全且可操控的几何运动策略用于机器人灵巧操作

Albert Wu, Riccardo Bonalli, Thomas Lew, C. Karen Liu

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Laboratory of Signals and Systems, University of Paris-Saclay, CNRS, CentraleSupélec(巴黎-萨克雷大学信号实验室,CNRS,CentraleSupélec) Toyota Research Institute(丰田研究院)

AI总结 本研究提出SafePBDS框架,通过几何一致的方法计算最优且可证明安全的配置流形加速度,以实现机器人灵巧操作中的目标和约束的持续协调,并在模拟和Franka Panda-Allegro手平台上验证了其在灵巧抓取和手部重定向中的高效规划和安全保障。

Comments 24 pages, 10 figures, 5 tables. Project page and demo video: https://tml.stanford.edu/safe-pbds

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21778 2026-05-22 cs.AI

What Counts as AI Sycophancy? A Taxonomy and Expert Survey of a Fragmented Construct

什么是AI阿谀奉承?对一个碎片化概念的分类和专家调查

Meryl Ye, Lujain Ibrahim, Jessica Y. Bo, Myra Cheng, Ida Mattsson, Daniel Vennemeyer, Robert Kraut, Steve Rathje

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of Toronto(多伦多大学) Stanford University(斯坦福大学) University of Cincinnati(克里夫兰医学中心大学) New York University(纽约大学)

AI总结 本文通过文献综述和专家调查,揭示了AI阿谀奉承行为的分类和测量挑战,提出了一种统一的分类体系以促进对这一问题的理解和应对。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21776 2026-05-22 cs.CL

PromptNCE: Pointwise Mutual Information Predictions Using Only LLMs and Contrastive Estimation Prompts

PromptNCE:仅使用LLM和对比估计提示进行点互信息预测

Juliette Woodrow, Chris Piech

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学)

AI总结 本文提出PromptNCE方法,通过将条件概率估计转化为对比任务,并引入显式的OTHER类别来恢复真实的条件概率,从而在低数据情况下实现零样本点互信息估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21522 2026-05-22 q-bio.QM cs.AI cs.CE cs.LG stat.ML

Protein Thoughts: Interpretable Reasoning with Tree of Thoughts and Embedding-Space Flow Matching for Protein-Protein Interaction Discovery

蛋白质思想:基于树 of 思维和嵌入空间流匹配的可解释推理用于蛋白质-蛋白质相互作用发现

Kingsley Yeon, Xuefeng Liu, Promit Ghosal

机构 * Department of Statistics and CCAM University of Chicago(统计学系和CCAM大学芝加哥分校) School of Medicine Stanford University(医学学院斯坦福大学) Department of Statistics University of Chicago(统计学系芝加哥大学)

AI总结 本文提出了一种可解释的蛋白质-蛋白质相互作用发现框架,通过显式推理将PPI发现转化为可解释的搜索问题,利用嵌入空间流匹配和树 of 思维搜索方法提升预测精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18721 2026-05-22 cs.LG cs.CL

General Preference Reinforcement Learning

通用偏好强化学习

Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal, Arslan Chaudhry, Andreas Haupt, Sanmi Koyejo, Emily Fox, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学)

AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15588 2026-05-22 cs.CL cs.LG

Calibrating LLMs with Semantic-level Reward

通过语义层面奖励校准大型语言模型

Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu

机构 * Department of Computer Science and Engineering, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校计算机科学与工程系,拉贾尔,加利福尼亚州,美国) Halıcıoğlu Data Science Institute, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校Halıcıoğlu数据科学研究所,拉贾尔,加利福尼亚州,美国) Department of Statistics, Stanford University, Stanford, California, USA(斯坦福大学统计学系,斯坦福,加利福尼亚州,美国)

AI总结 本文提出了一种新的校准框架CSR,通过在语义空间中直接校准语言模型,避免了传统方法中因词汇化置信度导致的不一致问题,实验显示CSR在多个数据集上均能有效降低ECE并提高AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21743 2026-05-22 cs.LG q-bio.QM

CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning

CellFluxRL: 通过强化学习实现生物约束的虚拟细胞建模

Dongxia Wu, Shiye Su, Yuhui Zhang, Elaine Sui, Emma Lundberg, Emily B. Fox, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

AI总结 本文提出CellFluxRL,通过强化学习约束虚拟细胞模型,使其在生物功能、结构有效性及形态正确性方面更符合生物学规律,从而提升虚拟细胞建模的生物意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21717 2026-05-22 cs.LG

Uncertainty-Aware Distribution-to-Distribution Flow Matching for Scientific Imaging

面向科学成像的不确定性感知分布到分布流匹配

Dongxia Wu, Yuhui Zhang, Serena Yeung-Levy, Emma Lundberg, Emily B. Fox

机构 * Stanford University(斯坦福大学)

AI总结 本文提出了一种面向科学成像的不确定性感知分布到分布流匹配方法,通过引入贝叶斯随机流匹配和抗变异不确定性量化技术,提升模型在分布偏移下的泛化能力,并有效估计epistemic和aleatoric不确定性,从而检测不可靠的生成结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15338 2026-05-22 cs.LG cs.CL

Discovering Implicit Large Language Model Alignment Objectives

发现隐式大语言模型对齐目标

Edward Chen, Sanmi Koyejo, Carlos Guestrin

机构 * Stanford University(斯坦福大学)

AI总结 本文提出Obj-Disco框架,通过自动分解对齐奖励信号为可解释的目标,解决现有方法的不足,验证了框架在多种任务和模型上的鲁棒性,并发现潜在的对齐偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09593 2026-05-21 eess.IV cs.AI cs.CV

SMILE-UHURA Challenge -- Small Vessel Segmentation at Mesoscopic Scale from Ultra-High Resolution 7T Magnetic Resonance Angiograms

SMILE-UHURA挑战 -- 从超高分辨率7T磁共振血管造影中进行微血管分割

Soumick Chatterjee, Hendrik Mattern, Marc Dörner, Alessandro Sciarra, Florian Dubost, Hannes Schnurre, Rupali Khatun, Chun-Chih Yu, Tsung-Lin Hsieh, Yi-Shan Tsai, Yi-Zeng Fang, Yung-Ching Yang, Juinn-Dar Huang, Marshall Xu, Siyu Liu, Fernanda L. Ribeiro, Saskia Bollmann, Karthikesh Varma Chintalapati, Chethan Mysuru Radhakrishna, Sri Chandana Hudukula Ram Kumara, Raviteja Sutrave, Abdul Qayyum, Moona Mazher, Imran Razzak, Cristobal Rodero, Steven Niederren, Fengming Lin, Yan Xia, Jiacheng Wang, Riyu Qiu, Liansheng Wang, Arya Yazdan Panah, Rosana El Jurdi, Guanghui Fu, Janan Arslan, Ghislain Vaillant, Romain Valabregue, Didier Dormont, Bruno Stankoff, Olivier Colliot, Luisa Vargas, Isai Daniel Chacón, Ioannis Pitsiorlas, Pablo Arbeláez, Maria A. Zuluaga, Stefanie Schreiber, Oliver Speck, Andreas Nürnberger

机构 * Faculty of Computer Science, Otto von Guericke University Magdeburg(奥托·冯·格里克大学马格德堡分校计算机科学学院) Data and Knowledge Engineering Group, Otto von Guericke University Magdeburg(奥托·冯·格里克大学马格德堡分校数据与知识工程小组) Human Technopole(人类技术极地) Biomedical Magnetic Resonance, Otto von Guericke University Magdeburg(生物医学磁共振,奥托·冯·格里克大学马格德堡分校) Department of Neurology, Medical Faculty, University Hospital of Magdeburg(马格德堡大学医院医学系神经科) German Centre for Neurodegenerative Diseases(德国神经退行性疾病研究中心) Centre for Behavioural Brain Sciences, Magdeburg(行为脑科学中心,马格德堡) Department of Neurology, University Hospital Zurich(苏黎世大学医院神经科) Department of Consultation-Liaison-Psychiatry and Psychosomatic Medicine, University Hospital Zurich(苏黎世大学医院咨询-联络精神病学与心身医学科) Stanford University(斯坦福大学) Translational Radiobiology, Department of Radiation Oncology, Universitätsklinikum Erlangen, Friedrich-Alexander-Universität Erlangen-Nürnberg(转化放射生物学,放射肿瘤学部,埃尔兰根大学医院,埃尔兰根-纽伦堡弗里德里希-亚历山大大学) National Yang Ming Chiao Tung University(阳明交通大学) School of Electrical Engineering and Computer Science, University of Queensland(昆士兰大学电气工程与计算机科学学院) Australian eHealth Research Centre, CSIRO(澳大利亚eHealth研究中心,CSIRO) National Heart and Lung Institute, Faculty of Medicine, Imperial College London(英国伦敦帝国理工学院医学系国家心脏和肺研究所) Hawkes Institute, Department of Computer Science, University College London(霍克斯研究所,伦敦大学学院计算机科学系) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(阿布扎克穆罕默德·本·扎耶德人工智能大学) The Alan Turing Institute, London, UK(艾伦·图灵研究所,伦敦,英国) School of Computing, University of Leeds(利兹大学计算学院) Department of Computer Science at School of Informatics, Xiamen University(厦门大学信息学院计算机科学系) Manteia Technologies Co., Ltd, Xiamen, China(厦门Manteia技术有限公司) Leicester International Institute, Dalian University of Technology(大连理工大学利兹国际学院) Sorbonne Université, Institut du Cerveau - Paris Brain Institute(索邦大学,巴黎脑研究所) Centre of Formation and Research in Artificial Intelligence, Universidad de Los Andes, Colombia(智利洛斯安德斯大学人工智能培训与研究中心) Data Science Department, EURECOM, Sophia Antipolis, France(EURECOM数据科学系,法国索菲亚安蒂波利斯)

AI总结 该研究旨在解决公共标注数据集不足的问题,通过提供一个包含时间飞行血管造影的7T MRI标注数据集,评估了多种深度学习方法在微血管分割任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20942 2026-05-21 cs.CV

Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding

连接结构与语言:基于图的视觉推理用于自动驾驶道路理解

Lena Wild, Katie Z Luo, Marco Pavone

机构 * KTH Royal Institute of Technology(皇家理工学院) TRATON Stanford University(斯坦福大学) NVIDIA(英伟达)

AI总结 本文提出结合道路子基质(CRS)框架,通过图结构和开放词汇语义的联合执行,解决自动驾驶中道路结构理解的精度与语义灵活性之间的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20693 2026-05-21 cs.CL cs.AI stat.ML

Interpretable Discriminative Text Representations via Agreement and Label Disentanglement

通过共识和标签解缠获得可解释的判别文本表示

Tong Wang, Yiqing Xu, Leo Yang Yang

机构 * Yale University(耶鲁大学) Stanford University(斯坦福大学) Hong Kong Baptist University(香港 Baptist 大学)

AI总结 本文提出了一种可解释的判别文本表示方法,通过共识和标签解缠来确保特征的可解释性和可重复性,实验表明该方法在多个文本分类任务中表现优异,产生了更清晰且更少标签纠缠的特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20687 2026-05-21 eess.IV cs.LG

Motion-Robust Deep Reconstruction for Free-Breathing Cardiac Cine MRI

运动鲁棒深度重建用于自由呼吸心脏 cine MRI

Mahmut Yurt, Kanghyun Ryu, Zhitao Li, Xucheng Zhu, Xianglun Mao, Martin Janich, Marcus Alley, Kawin Setsompop, John Pauly, Shreyas Vasanawala, Ali Syed

机构 * Stanford University(斯坦福大学) KIST GE Healthcare(通用电气医疗)

AI总结 本文提出Cine-DL框架,通过结合目标k空间预处理和快速模型基于深度重建,解决自由呼吸径向采集在高加速下的运动伪影问题,提升临床应用可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20682 2026-05-21 cs.CV

IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

IndusAgent: 通过智能工具增强开放词汇工业异常检测

Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang, Yi Wang, Zijian Song, Zhiyuan Wang, Jiyuan Wang, Yue Wang, Shuhan Song§, Huawei Cao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Santa Clara University(圣克拉拉大学) LongCat Team(LongCat团队) Independent Researcher(独立研究者) New York University(纽约大学) Sun Yat-sen University(孙中山大学) Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20676 2026-05-21 cs.CV

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

VISTAQA: 评估联合视觉问答与像素级证据

Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20607 2026-05-21 cs.LG cs.CV cs.RO

Mechanistic Interpretability for Learning Assurance of a Vision-Based Landing System

基于视觉着陆系统的学习保证机制解释

Romeo Valentin, Olivia Beyer Bruvik, Marc R. Schlichting, Mykel J. Kochenderfer

机构 * Stanford Intelligent Systems Laboratory, Stanford University, Stanford, CA, USA(斯坦福智能系统实验室,斯坦福大学,斯坦福,CA,美国)

AI总结 本文提出了一种基于视觉着陆系统的学习保证机制,通过分离内容与风格来构建可解释的模型,从而提供可靠的证据支持,同时引入了新的运行时保证方法来监控模型的情境表示。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18736 2026-05-21 cs.CV

Spectral Progressive Diffusion for Efficient Image and Video Generation

频域渐进扩散用于高效图像和视频生成

Howard Xiao, Brian Chao, Lior Yariv, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

AI总结 本文提出了一种频域渐进扩散框架,通过在预训练扩散模型的去噪轨迹中逐步提高分辨率,实现高效的图像和视频生成,同时改进了效率和质量。

Comments Project website at https://howardxiao.ca/speed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11675 2026-05-21 cs.AI

Epistemic Regret Minimization: Label-Free Causal Critique Beyond Outcome Reward

知识悔恨最小化:超越结果奖励的无标签因果批评

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学)

AI总结 本文提出了一种名为知识悔恨最小化(ERM)的框架,通过评估模型推理轨迹的因果结构而非答案本身,来改进因果批评,从而在没有正确答案的情况下进行无标签操作,并在多个前沿LLM上实验表明,ERM在因果批评任务中表现优于传统方法。

Comments 43 pages, 22 tables, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11499 2026-05-21 cs.CV

What if Agents Could Imagine? Reinforcing Open-Vocabulary HOI Comprehension through Generation

如果智能体能够想象?通过生成强化开放词汇人-物交互理解

Zhenlong Yuan, Yue Wang, Dapeng Zhang, Kejin Cui, Rui Chen, Jing Tang, Lei Sun, Hongwei Yu, Chengxuan Qian, Xiangxiang Chu, Shuo Li, Yuyin Zhou

机构 * Dream-X Team(Dream-X团队) Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者) Case Western Reserve University(凯斯西储大学) UC Santa Cruz(加州大学圣克鲁兹分校)

AI总结 本文提出ImagineAgent框架,通过生成式世界建模和工具增强强化学习,解决开放词汇人-物交互理解中的跨模态幻觉和视角限制问题,实现了高效且鲁棒的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04876 2026-05-21 cs.CV

PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation

PerpetualWonder: 长时间地平线动作条件4D场景生成

Jiahao Zhan, Zizhang Li, Hong-Xing Yu, Jiajun Wu

机构 * Stanford University(斯坦福大学)

AI总结 本文提出PerpetualWonder,一种混合生成模拟器,能够从单张图像生成长时间地平线动作条件的4D场景。该方法通过引入真正的闭环系统,解决了现有方法因物理状态与视觉表示解耦导致的生成问题,实现了物理动态和外观的双向修正。

Comments Project website: https://johnzhan2023.github.io/PerpetualWonder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17269 2026-05-21 cs.CV cs.AI

FineVision: Open Data Is All You Need

FineVision: 你只需要开放数据

Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, Andrés Marafioti

机构 * Hugging Face Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学)

AI总结 本文提出FineVision,一个包含2400万样本的高质量数据集,通过半自动化流程整合了200多个来源,通过严格的数据清洗和人工审核确保数据质量,训练基于该数据集的模型在广泛评估中表现更优,推动数据驱动的视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏