arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Princeton University(普林斯顿大学)

共收录 737
2605.06915 2026-05-28 cs.LG

LLMs are not (consistently) Bayesian: Quantifying internal (in)consistencies of LLMs' probabilistic beliefs

LLMs 并非(一致地)贝叶斯:量化 LLMs 概率信念的内部(不)一致性

Chacha Chen, Matthew Jörke, Adam Goliński, Masha Fedzechkina, Guillermo Sapiro, Sinead Williamson, Nicholas Foti

机构 * Apple(苹果公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

AI总结 本文引入信息处理差距来研究 LLMs 在更新概率信念时的内部不一致性,发现非贝叶斯启发式更新在下游任务中常优于精确贝叶斯计算,表明 LLMs 的世界概率模型存在错误设定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01970 2026-05-28 cs.AI cs.CL

Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies

原子技能是前提:当强化学习合成组合推理时,以及当它仅放大时

Sitao Cheng, Xunjian Yin, Ruiwen Zhou, Yuxuan Li, Xinyi Wang, Liangming Pan, William Yang Wang, Victor Zhong

机构 * University of Waterloo(滑铁卢大学) Duke University(杜克大学) National University of Singapore(新加坡国立大学) Princeton University(普林斯顿大学) Peking University(北京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 通过互补推理任务,研究强化学习是合成新技能还是仅放大已有技能,发现强化学习在基础模型通过监督微调掌握独立原子技能后才能合成新组合策略。

Comments Work in Progress. Code and data are available at https://github.com/sitaocheng/from_atomic_to_composite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26353 2026-05-27 cs.CV cs.AI cs.LG

Personalized Generative Models for Contextual Debiasing

用于上下文去偏的个性化生成模型

Xinran Liang, Esin Tureci, Prachi Sinha, Ye Zhu, Vikram V. Ramaswamy, Olga Russakovsky

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) LIX, CNRS, École Polytechnique(巴黎政治学院LIX研究所,法国国家科学研究中心)

AI总结 提出DecoupleGen方法,利用个性化文本到图像扩散模型生成罕见上下文图像,作为训练增强以缓解视觉识别中的上下文偏差。

Comments CVPR 2026 Workshop on Synthetic Data for Computer Vision and Generative Models for Computer Vision. Code available at https://github.com/princetonvisualai/DecoupleGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26163 2026-05-27 cs.IT cs.LG math.IT math.OC

Adversarial Water-Filling: Theory, Algorithms and Foundation Model

对抗性注水:理论、算法与基础模型

Xindi Tong, Chee Wei Tan, H. Vincent Poor

机构 * College of Computing and Data Science (CCDS), Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院(CCDS),新加坡) Princeton University, United States(普林斯顿大学,美国)

AI总结 针对频率和空间上的竞争资源分配问题,提出对抗性注水(AWF)问题及其理论和算法,并开发无线基础模型学习AWF搜索动力学,实现超过一个数量级的运行时间改进。

Comments Submitted to IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26087 2026-05-26 stat.ML cs.LG

DiscoverPhysics: Benchmarking LLMs for Out-of-the-Box Scientific Thinking

DiscoverPhysics: 基准测试LLMs的即用型科学思维

Matt L. Wiemann, Lindsay M. Smith, Peter Melchior, Siddharth Mishra-Sharma, Andrew Gordon Wilson, Pavel Izmailov, Carolina Cuesta-Lázaro

机构 * Princeton University(普林斯顿大学) Boston University(波士顿大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所) Institute for Advanced Studies(高级研究研究所)

AI总结 提出DiscoverPhysics交互式基准,通过让LLM代理探索物理定律偏离现实的模拟世界,评估其设计实验、修正假设和发现物理规律的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25427 2026-05-26 cs.CV cs.AI

Binding Visual Features Point by Point

逐点绑定视觉特征

Udith Haputhanthri, Declan Campbell, Rim Assouel, Jonathan D. Cohen, Taylor W. Webb

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学)

AI总结 研究通过文本引导的“指向”机制解决视觉语言模型在多目标场景中的绑定问题,发现该机制诱导内部视觉搜索程序,消除绑定错误并实现组合泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25254 2026-05-26 cs.CV cs.AI

Guess the Unified Model: How Much Can We Recover from Generated Images?

猜猜统一模型:从生成的图像中我们能恢复多少?

Jasin Cekinmez, Ryo Mitsuhashi, Addison J. Wu, Yida Yin

机构 * Princeton University(普林斯顿大学)

AI总结 本文研究统一模型生成图像的可分离性,通过七个模型的大量图像实验,发现模型归因高度可行,且语义内容对可分离性有贡献但非主导信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25172 2026-05-26 stat.AP cs.DL cs.LG

Rejoinder: The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review

回复:ICML 2023 排名实验:审视机器学习/人工智能同行评审中的作者自我评估

Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) New York University(纽约大学) Princeton University(普林斯顿大学) Associate Chair of ICML 2023(ICML 2023 associate chair) Program Chair of ICML 2023(ICML 2023 program chair)

AI总结 本文回应了关于ICML 2023排名实验的讨论,将同行评审视为统计估计问题,探讨了等渗机制的公平性与策略问题,并提出了结合审稿人排名和生成式AI时代以人为中心的评审框架。

Comments Rejoinder to the JASA Discussion of "The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review" (arXiv:2408.13430)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21924 2026-05-26 cs.LG stat.ML

One-Step Bellman Alignment Enables Provably Efficient Transfer in Online RL

一步贝尔曼对齐实现在线强化学习中的可证明高效迁移

Elynn Chen, Enpei Zhang, Jinhang Chai, Yujun Yan

机构 * Department of Technology, Operations, & Statistics, New York University(纽约大学技术、运营与统计系) Department of Operations Research & Financial Engineering, Princeton University(普林斯顿大学运筹学与金融工程系) Department of Computer Science, Dartmouth College(达特茅斯学院计算机科学系)

AI总结 提出一步贝尔曼对齐作为在线强化学习中迁移的正确抽象,并通过重加权目标(RWT)实现算子级修正,在RKHS函数逼近下建立了与任务迁移复杂度相关的遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16075 2026-05-26 math.NA cs.DS cs.LG cs.NA math.OC

Towards Universal Convergence of Backward Error in Linear System Solvers

线性系统求解器中后向误差的通用收敛性

Michał Dereziński, Yuji Nakatsukasa, Elizaveta Rebrova

机构 * University of Michigan(密歇根大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学)

AI总结 本文证明经典Richardson迭代在半正定线性系统上具有与条件数无关的1/k后向误差收敛率,并基于Krylov子空间最小化后向误差提出MINBERR算法,实现O(n^2/√ε)复杂度。

Comments Added convergence analysis of MINBERR-NE for general linear systems (Theorems 5.1 and 5.3)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02416 2026-05-26 cs.LG stat.ML

Relative Translation Invariant Wasserstein Distance

相对平移不变Wasserstein距离

Binshuai Wang, Qiwei Di, Ming Yin, Mengdi Wang, Quanquan Gu, Peng Wei

机构 * Department of Computer Science(计算机科学系) George Washington University(乔治华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Department of Electrical and Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学)

AI总结 受Bures距离启发,提出相对平移不变Wasserstein距离RW_p,证明其度量性质,并设计双层算法计算离散分布间的RW_p距离,当p=2时提出RW_2-LP和RW_2-Sinkhorn算法以提高数值稳定性,实验验证了算法在减少数值误差和实际雷暴模式检索中的有效性。

Comments Accepted by Transactions on Machine Learning Research (TMLR). Final accepted version. The implementation is publicly available at \url{https://github.com/DRKWang/rw_metric}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23857 2026-05-25 cs.LG cs.CL

Strong Teacher Not Needed? On Distillation in LLM Pretraining

不需要强教师?关于大语言模型预训练中的蒸馏

Taiming Lu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

AI总结 本文通过构造不同强弱关系的师生模型,研究大语言模型预训练中知识蒸馏的有效性,发现弱教师也能提升学生模型,且强教师不一定更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23238 2026-05-25 cs.AI cs.GT cs.LG cs.MA

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

GENSTRAT:迈向大型语言模型中的战略推理科学

Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala

机构 * Princeton University(普林斯顿大学) Google(谷歌)

AI总结 提出GENSTRAT框架,通过程序化生成不完全信息博弈环境,结合能力剖面和锯齿度度量,系统评估大型语言模型的战略推理能力。

Comments 33 pages, 8 figures, 9 tables (4 figures, 2 tables in main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21489 2026-05-25 cs.LG cs.AI cs.CV stat.CO stat.ML

Variance Reduction for Expectations with Diffusion Teachers

具有扩散教师的期望方差缩减

Jesse Bettencourt, Xindi Wu, Matan Atzmon, James Lucas, Jonathan Lorraine

机构 * NVIDIA University of Toronto(多伦多大学) Princeton University(普林斯顿大学)

AI总结 提出CARV框架,通过分层蒙特卡洛估计器(摊销上游计算、时间步重要性采样和分层逆CDF构造)降低扩散模型作为冻结教师时的梯度方差,在文本到3D和蒸馏实验中实现2-3倍有效计算乘数。

Comments Project page: https://research.nvidia.com/labs/sil/projects/CARV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22823 2026-05-22 cs.CV

Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

它往哪个方向移动?视频大语言模型中方向运动盲症的诊断与克服

Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) Princeton University(普林斯顿大学)

AI总结 本文研究了视频大语言模型在理解方向运动时的盲点,提出MoDirect数据集和DeltaDirect方法,通过改进模型对方向运动的感知能力,显著提升了模型在合成和真实场景中的方向识别性能。

Comments Preprint. 59 pages, including appendix. Code: https://github.com/KHU-VLL/DeltaDirect

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21214 2026-05-22 cs.LG cs.AI

Behavior-Consistent Deep Reinforcement Learning

行为一致的深度强化学习

Marcel Hussing, Liv G. d'Aliberti, Claas Voelcker, Benjamin Eysenbach, Eric Eaton

机构 * University of Pennsylvania(宾夕法尼亚大学) Princeton University(普林斯顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出了一种行为一致的深度强化学习方法,通过控制策略的分布相似性来减少跨训练运行的策略分歧,从而提高稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20205 2026-05-22 cs.LG

Hyperparameter Transfer with Mixture-of-Expert Layers

通过专家混合层进行超参数迁移

Tianze Jiang, Blake Bordelon, Cengiz Pehlevan, Boris Hanin

机构 * Operations Research Financial Engineering, Princeton University, Princeton, NJ, USA Center of Mathematical Sciences Applications, Harvard University, Cambridge, MA, USA John A. Paulson School of Engineering Applied Sciences, Center for Brain Science, Kempner Institute for the Study of Natural Artificial Intelligence, Harvard University, Cambridge, MA, USA

AI总结 本文提出了一种新的参数化方法,用于在扩展模型宽度、深度、专家数量和专家(隐藏)大小时,通过专家混合层的变压器模型进行超参数迁移,该方法基于动态平均场理论分析,实验证明其在不同规模模型间可靠地迁移超参数。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21683 2026-05-22 cs.AI

Investigating Concept Alignment Using Implausible Category Members

通过不合理的类别成员探究概念对齐

Sunayana Rane, Brenden M. Lake, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系)

AI总结 本文研究了通过询问不合理类别成员来探究概念边界,发现AI模型在某些概念上与人类存在显著差异,如将'词语'归类为'车辆'或'衣物',并探讨了这些概念错位对AI安全的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10062 2026-05-22 cs.LG cs.CV

Vendi Novelty Scores for Out-of-Distribution Detection

Vendi Novelty Scores for Out-of-Distribution Detection

Amey P. Pasarkar, Adji Bousso Dieng

机构 * Lewis-Sigler Institute For Integrative Genomics, Princeton University(普林斯顿大学整合基因组学研究所) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

AI总结 本文提出了一种基于Vendi Scores的Vendi Novelty Score(VNS)方法,从多样性角度解决分布外检测问题,该方法无需密度建模,具有线性时间复杂度和非参数特性,并在多个图像分类基准上实现了最先进的OOD检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05157 2026-05-22 cs.DS cs.LG stat.ML

Learning Mixture Models via Efficient High-dimensional Sparse Fourier Transforms

通过高效的高维稀疏傅里叶变换学习混合模型

Alkis Kalavasis, Pravesh K. Kothari, Shuchen Li, Manolis Zampetakis

机构 * Yale University(耶鲁大学) Princeton University(普林斯顿大学)

AI总结 本文提出了一种在高维空间中以多项式时间复杂度学习混合模型参数的方法,适用于具有重尾分布的混合模型,包括那些协方差有限的分布,且无需集群均值的最小分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19269 2026-05-21 cs.LG

CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

CODA:将Transformer块重写为GEMM-epilogue程序

Han Guo, Jack Zhang, Arjun Menon, Driss Guessous, Vijay Thakkar, Yoon Kim, Tri Dao

机构 * Massachusetts Institute of Technology(麻省理工学院) Princeton University(普林斯顿大学) Together AI Meta

AI总结 本文提出CODA,一种将Transformer中的非注意力计算重写为GEMM-epilogue程序的GPU内核抽象,以提高训练效率和硬件利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20833 2026-05-21 cs.CL

MemGym: a Long-Horizon Memory Environment for LLM Agents

MemGym: 一种长时间跨度的记忆环境用于LLM智能体

Wujiang Xu, Yu Wang, Kai Mei, Kaiqu Liang, Zhenting Wang, Mingyu Jin, Han Zhang, Shi-Xiong Zhang, Wenyue Hua, Sambit Sahu, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学) Capital One Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

AI总结 本文提出MemGym,一种用于评估LLM智能体记忆能力的基准测试环境,通过统一现有智能体 gym 和内部记忆基础管道,提供一个记忆推理接口。MemGym 包含五个评估赛道,涵盖四个智能体领域,能够独立评估记忆性能,排除推理、检索和工具使用能力的干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20520 2026-05-21 cs.AI

Open-World Evaluations for Measuring Frontier AI Capabilities

面向前沿AI能力的开放世界评估

Sayash Kapoor, Peter Kirgis, Andrew Schwartz, Stephan Rabanser, J. J. Allaire, Rishi Bommasani, Harry Coppock, Magda Dubois, Gillian K Hadfield, Andrew B. Hall, Sara Hooker, Seth Lazar, Steve Newman, Dimitris Papailiopoulos, Shoshannah Tekofsky, Helen Toner, Cozmin Ududec, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Cornflower Labs(Cornflower实验室) Meridian Labs(Meridian实验室) Stanford University(斯坦福大学) UK AI Security Institute(英国人工智能安全研究所) Johns Hopkins University(约翰霍普金斯大学) Adaption Labs(Adaption实验室) Australian National University(澳大利亚国立大学) Golden Gate Institute for AI(金门人工智能研究所) UW Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) AI Digest(AI摘要) Georgetown University (CSET)(乔治城大学(CSET))

AI总结 本文提出开放世界评估作为一种补充方法,通过小样本定性分析来评估长期、复杂、现实世界任务,以更准确地衡量AI能力,并介绍了CRUX项目作为定期进行此类评估的尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16565 2026-05-20 cs.AI cs.OS

Skim: Speculative Execution for Fast and Efficient Web Agents

Skim:用于快速和高效网络代理的推测执行

Mike Wong, Kevin Hsieh, Suman Nath, Ravi Netravali

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

AI总结 Skim通过利用专门构建网站的可预测结构,提出了一种推测执行框架,以降低网络代理的任务成本和延迟,同时保持准确性。

Comments 14 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22161 2026-05-20 cs.LG

Causal Evidence that Language Models use Confidence to Drive Behavior

语言模型使用置信度驱动行为的因果证据

Dharshan Kumaran, Nathaniel Daw, Simon Osindero, Petar Veličković, Viorica Patraucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

AI总结 研究探讨了语言模型是否利用置信度信号来控制行为,如决定回答或 abstain,通过四个阶段实验发现模型使用多维内部置信表示和阈值策略来实现 abstention,揭示了结构化的元认知控制机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13727 2026-05-20 cs.AI

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails

从拒绝到恢复:一种生成AI防护机制的控制论方法

Ravi Pandya, Madison Bland, Duy P. Nguyen, Changliu Liu, Jaime Fernández Fisac, Andrea Bajcsy

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Equal Advising(平等指导)

AI总结 本文提出了一种基于控制论的生成AI防护机制,通过实时监控和主动纠正高风险输出,提供了一种动态替代传统标志和阻断方法的解决方案。

Journal ref Second International Association on Safe and Ethical AI Conference (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18814 2026-05-20 cs.LG

How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines

轨迹数据归因的可信度如何?误差来源、缓解方法和实用指南

Junwei Deng, Pingbang Hu, Suliang Jin, Hao Lu, Jiachen T. Wang, Shichang Zhang, Jiaqi W. Ma

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 本文系统分析了轨迹数据归因方法的误差来源,并提出缓解方法和实用指南,通过将总误差分为配置级、算法级和系统级,改进了归因的准确性,并为数据选择提供了可行的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07618 2026-05-19 cs.LG stat.ML

Neural Networks With Dense Weights Are Not Universal Approximators

具有密集权重的神经网络不是通用逼近器

Levi Rauchwerger, Stefanie Jegelka, Ron Levie

机构 * Princeton University, Dept of CS(普林斯顿大学计算机科学系) MIT, Dept of EECS and CSAIL(麻省理工学院电子工程与计算机科学系及计算机科学与人工智能实验室) TUM, School of CIT, MCML, MDSI(技术大学(TUM)信息科技学院,MCML,MDSI) Technion – IIT, Faculty of Mathematics(技术学院–以色列理工学院数学学院)

AI总结 研究探讨了密集神经网络的逼近能力,指出在有限的权重约束下,密集连接的神经网络无法逼近任意连续函数,从而揭示了密集层神经网络的固有局限性,推动了稀疏连接在实现真正通用性中的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10930 2026-05-19 cs.CL cs.AI

Evaluating Language Models' Evaluations of Games

评估语言模型对游戏的评估

Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adrian Weller, Ionatan Kuperwajs, Lionel Wong, Joshua B. Tenenbaum, Thomas L. Griffiths

机构 * University of Cambridge(剑桥大学) MIT(麻省理工学院) Princeton University(普林斯顿大学) NYU(纽约大学) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 本文研究了语言模型对游戏评估的能力,通过比较现代语言模型和人类及符号计算代理的评估结果,发现推理模型在游戏评估上更接近人类,但随着模型接近博弈最优,其与人类数据的匹配度会减弱,且在评估趣味性时表现出更大的波动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17912 2026-05-19 cs.RO cs.CV

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏