arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 1612
2603.02196 2026-07-03 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00477 2026-07-02 cs.LG cs.CE 新提交

Interpretable vs Learned Encoders for High-Cardinality Fraud Detection

可解释编码器与学习型编码器在高基数欺诈检测中的对比

Xiao Han, Jingjing Liu, Moxuan Zheng, Zhen Zhang, Chenyu Wu

机构 * Goizueta Business School Emory University Atlanta, GA, USA(埃默里大学戈伊苏埃塔商学院) Computer Sciences University of California, Berkeley Kirkland, WA(加州大学伯克利分校计算机科学系) Stern School of Business New York University New York, NY, USA(纽约大学斯特恩商学院) School of Data Science University of Pennsylvania Philadelphia, PA, USA(宾夕法尼亚大学数据科学学院) Pratt School of Engineering Duke University Durham, NC, USA(达特茅斯大学普拉特工程学院)

AI总结 在IEEE-CIS欺诈数据集上比较7种分类编码方法,实体嵌入在AUC-ROC上最优(0.9612),与CatBoost(0.9602)无显著差异,优于其他编码器;CatBoost在AUC-PR上领先(0.822 vs 0.793),无编码器同时主导两个指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32026 2026-07-01 cs.LG cs.AI 新提交

AdaJEPA: An Adaptive Latent World Model

AdaJEPA:一种自适应潜在世界模型

Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) AMI Labs(AMI实验室)

AI总结 提出AdaJEPA,一种在模型预测控制闭环中进行测试时自适应的潜在世界模型,通过自监督信号持续校准模型,显著提升规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31895 2026-07-01 cs.CV 新提交

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31683 2026-07-01 cs.CV cs.AI cs.LG 新提交

Histogram-constrained Image Generation

直方图约束的图像生成

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

AI总结 提出直方图约束图像生成(HIG)框架,通过最优传输理论在扩散模型中精确施加用户指定的分布约束,实现全局与局部之间的中间粒度控制,并展示其在颜色/潜在直方图约束生成和高容量信息嵌入中的应用。

Comments Accepted to ECCV 2026; 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31207 2026-07-01 cs.AI cs.CY 新提交

Towards Inclusive Mobility Modeling: Characterizing and Evaluating Elderly Trajectory Patterns in Urban Systems

迈向包容性移动建模:城市系统中老年人轨迹模式的特征化与评估

Zhengxuan Wang, Haohan He, Mengying Zhou

机构 * School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) MOE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(上海财经大学计算与经济学交叉研究教育部重点实验室) Center for Data Science, New York University(纽约大学数据科学中心)

AI总结 本研究利用共享单车数据,通过合成轨迹生成案例,定量评估老年人出行数据缺失对移动建模的偏差影响,并对比马尔可夫链与大语言模型在不同人口训练集下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31106 2026-07-01 cs.RO cs.AI cs.LG 新提交

What Probing Reveals about Autonomous Driving: Linking Internal Prediction Errors to Ego Planning

探测揭示自动驾驶:内部预测误差与自我规划的关联

Hyeonchang Jeon, Kyungbeom Kim, Eugene Vinitsky, Kyung-Joong Kim

机构 * Gwangju Institute of Science and Technology (GIST)(光州科学技术院) New York University(纽约大学)

AI总结 通过线性探测和因果干预,研究自动驾驶策略在碰撞事件中缺乏及时预测能力,导致规划缺陷,并证明纠正预测可提升安全性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32005 2026-07-01 math.OC cs.LG stat.ML 新提交

Random Reshuffling Dominates Stochastic Gradient Descent

随机重排主导随机梯度下降

Zijian Liu

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 针对光滑凸优化中随机重排(RR)的收敛理论局限,本文首次证明在任意合理步长下,经过任意有限轮次后RR始终优于随机梯度下降(SGD),解决了长期悬而未决的问题。

Comments COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23297 2026-07-01 cs.CV cs.LG eess.IV 版本更新

Drop-In Perceptual Optimization for 3D Gaussian Splatting

3D高斯溅射的即插即用感知优化

Ezgi Ozyilkan, Zhiqi Chen, Oren Rippel, Jona Ballé, Kedar Tatwawadi

机构 * Apple(苹果公司) Tandon School of Engineering, New York University(纽约大学坦登工程学院)

AI总结 针对3DGS依赖像素级损失导致模糊的问题,提出正则化Wasserstein损失WD-R,通过大规模人类主观实验验证其在纹理恢复和感知指标上的优势,并推广到多种框架和场景压缩任务。

Comments Accepted as a conference paper at ECCV'26. Project page: https://apple.github.io/ml-perceptual-3dgs

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17139 2026-07-01 cs.CL cs.IR 版本更新

Rethinking On-policy Optimization for Query Augmentation

重新思考查询增强的在线策略优化

Zhichao Xu, Shengyao Zhuang, Xueguang Ma, Bingsen Chen, Yijun Tian, Fengran Mo, Tao Li, Jie Cao, Vivek Srikumar

机构 * University of Utah(犹他大学) The University of Queensland(昆士兰大学) University of Waterloo(滑铁卢大学) New York University(纽约大学) University of Notre Dame(圣母大学) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind) University of Oklahoma(俄克拉荷马大学)

AI总结 本文系统比较了基于提示和强化学习的查询增强方法,发现计算量感知下简单方法常优于RL方法,并提出混合方法OPQE,通过RL生成伪文档以最大化检索性能。

Comments TMLR camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18778 2026-07-01 cs.LG cs.CL 版本更新

Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

教模型自学:在可学习性边缘推理

Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe

机构 * MIT(麻省理工学院) Meta FAIR New York University(纽约大学)

AI总结 提出SOAR非对称自对弈框架,通过元强化学习生成自动课程,解决低初始成功率数据集上的推理模型扩展问题,发现基于学生进步的奖励优于内在可学习性奖励,且问题结构比答案正确性更重要。

Comments ICML 2026. Blog post: https://ssundaram21.github.io/soar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29600 2026-06-30 cs.CV cs.AI

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

一场景,两深度:探究单目基础模型中的几何歧义性

Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang

机构 * University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Vanderbilt University(范德比大学)

AI总结 本文提出稀疏双层序数基准MD-3k,用于测量单目深度基础模型的深度层偏好和多层空间关系准确性,发现不同模型对同一分层几何结构有不同解析,且拉普拉斯视觉提示可改变冻结模型的输出层。

Comments 49 pages, 25 figures; Accepted by European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29494 2026-06-30 cs.CV

VCS-SLAM: Geometry-Validated Semantic Evidence Fusion for 3D Gaussian SLAM

VCS-SLAM:用于3D高斯SLAM的几何验证语义证据融合

Raman Jha, Shuaihang Yuan, Yi Fang

机构 * New York University, Electrical & Computer Engineering Dept.(纽约大学电气与计算机工程系) Embodied AI and Robotics (AIR) Lab, NYU Abu Dhabi(纽约大学阿布扎比分校 embodied AI and Robotics (AIR) 实验室) New York University Abu Dhabi, Electrical Engineering(纽约大学阿布扎比分校 电气工程)

AI总结 提出VCS-SLAM框架,通过可见性一致性、表面支撑边界证据和射线级冲突不确定性评估语义观测的几何可靠性,抑制遮挡语义更新、减少语义渗漏并延迟模糊区域的标签分配,提升语义一致性和重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28824 2026-06-30 cs.GT cs.AI cs.MA cs.SY eess.SY

Exit-and-Join Dynamics and Equilibrium in Continuum Cooperative Games

连续合作博弈中的退出与加入动态及均衡

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) New York University Tandon School of Engineering(纽约大学塔恩工程学院) Brooklyn, NY, USA(布鲁克林,纽约,美国)

AI总结 针对非原子合作博弈,提出退出与加入联盟的连续动态理论,扩展Aumann-Shapley值与Aumann-Drèze值到联盟结构,推导确定性平均场动态,刻画退出-加入均衡,并证明其与Wardrop均衡等价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28615 2026-06-30 cs.LG cs.AI cs.CL stat.ML

What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs

LLM 解释的内容并非其信念:基于模型自身输入信念评估解释充分性

Nhi Nguyen, Shauli Ravfogel, Rajesh Ranganath

机构 * New York University(纽约大学)

AI总结 提出自洽充分性(SCSuff)指标,利用 LLM 自身生成替代输入来评估自由文本解释的充分性,发现 LLM 解释通常不充分且与模型大小、准确率等弱相关。

Comments 23 pages, 9 figures, 13 tables, Forty-Third International Conference on Machine Learning (ICML 2026)

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06516 2026-06-30 cs.CL

You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

你只有一份工作:利用LLM隐藏表示进行每任务量化

Amit LeVi, Raz Lapid, Rom Himelstein, Chaim Baskin, Ravid Shwartz Ziv, Avi Mendelson

机构 * Technion—Israel Institute of Technology(技术ion—以色列理工学院) Zenity(Zenity公司) DeepKeep(DeepKeep公司) Ben-Gurion University of the Negev(巴伊兰大学) New York University(纽约大学)

AI总结 本文提出TAQ框架,通过任务校准提示分配更高精度给任务相关的transformer层,提升精度-内存比和部署性能。

Comments Accepted at ICML 2026 Workshop on AdaptFM: Resource-Adaptive Foundation Model Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25651 2026-06-29 cs.CL 新提交

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Khalifa University(哈利法大学) New York University(纽约大学)

AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13236 2026-06-29 eess.IV cs.AI physics.med-ph 版本更新

Pixelwise Uncertainty Quantification of Accelerated MRI Reconstruction

加速MRI重建的像素级不确定性量化

Ilias I. Giannakopoulos, Lokesh B Gautham Muthukumar, Yvonne W. Lui, Riccardo Lattanzi

机构 * Bernard and Irene Schwartz Center for Biomedical Imaging, Department of Radiology, NYU Grossman School of Medicine(贝纳德与伊蕾娜·施瓦茨生物医学成像中心,放射学系,纽约大学格罗斯曼医学院) Courant Institute of Mathematical Sciences, NYU(数学科学学院,纽约大学) Center for Advanced Imaging Innovation and Research (CAI 2 R), Department of Radiology, NYU Grossman School of Medicine(先进成像创新与研究中心(CAI 2 R),放射学系,纽约大学格罗斯曼医学院)

AI总结 提出一种基于共形分位数回归的像素级不确定性量化框架,用于加速MRI重建,无需全采样参考图像即可自动识别不可靠区域。

Comments 12 pages, 8 figues, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26139 2026-06-26 cs.GT cs.AI 新提交

Multiscale Exit-Join Dynamics: Tactical Consensus and Strategic Coalition Formation

多尺度退出-加入动力学:战术共识与战略联盟形成

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering(电气工程系) Tandon School of Engineering(坦顿工程学院) New York University(纽约大学)

AI总结 提出多尺度联盟形成模型,耦合联盟内战术共识与战略退出-加入决策,通过固定点分析揭示不稳定性-共识悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26389 2026-06-26 physics.ao-ph cs.AI 新提交

Sampling sea state using a diffusion model

使用扩散模型采样海况

Jiarong Wu, Bertrand Chapron, Laure Zanna

机构 * Courant Institute School of Mathematics, Computing and Data Science(库朗数学、计算与数据科学学院) New York University(纽约大学) Laboratoire d’Océanographie Physique et Spatiale (LOPS)(物理与空间海洋学实验室) Ifremer

AI总结 提出基于扩散的生成模型,利用5天全球风场条件直接采样海况的复杂条件分布,实现概率性海况估计,显著加速计算并保持技巧性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09235 2026-06-26 cs.LG math.OC stat.ML 版本更新

Theory of the Frequency Principle for General Deep Neural Networks

通用深度神经网络的频率原理理论

Tao Luo, Zheng Ma, Zhi-Qin John Xu, Yaoyu Zhang

机构 * Department of Mathematics, Purdue University(普渡大学数学系) New York University Abu Dhabi and Courant Institute(纽约大学阿布扎比分校及柯朗研究所)

AI总结 本文严格研究了通用深度神经网络在训练过程中从低频到高频学习目标函数的频率原理,并给出了三个阶段的定理。

Comments CSIAM Trans. Appl. Math

Journal ref CSIAM Trans. Appl. Math. 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25589 2026-06-25 cs.LG cs.CR 新提交

Leaking Circuit Secrets: Gradient Leakage Attacks on Graph Neural Networks

泄露电路秘密:图神经网络上的梯度泄露攻击

Rupesh Raj Karn, Johann Knechtel, Ozgur Sinanoglu

机构 * Center for Cyber Security, New York University, Abu Dhabi, UAE(纽约大学阿布扎克分校网络安全中心)

AI总结 首次系统评估图神经网络在电路设计中的梯度泄露攻击风险,发现GAT加剧泄露而GIN更具鲁棒性,并分析了现有防御技术的局限性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25225 2026-06-25 cs.CV cs.LG 新提交

MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning

MJEPA:一种简单且可扩展的音频-视觉联合嵌入预测架构

Revant Teotia, Adrien Bardes, Michael Rabbat, Sumit Chopra, Matthew J. Muckley, Nicolas Ballas

机构 * FAIR at Meta(Meta AI研究实验室) New York University(纽约大学)

AI总结 提出MJEPA,使用统一编码器和单一预测目标进行跨模态预测,在音频分类任务上超越先前方法,并减少视频数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25010 2026-06-25 cs.LG cs.CL 新提交

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

涌现能力随机地从学习稀疏注意力模式中产生

Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

机构 * New York University(纽约大学)

AI总结 研究发现,transformer模型的下游能力(如上下文学习)在训练过程中随机涌现,较大模型平均更早获得,且涌现对应于任务相关注意力模式的突然学习。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20452 2026-06-25 cs.LG 版本更新

SDE-Driven Spatio-Temporal Hypergraph Neural Networks for Irregular Longitudinal fMRI Connectome Modeling in Alzheimer's Disease

SDE驱动的时空超图神经网络用于阿尔茨海默病不规则纵向fMRI连接组建模

Ruiying Chen, Yutong Wang, Houliang Zhou, Wei Liang, Yong Chen, Lifang He

机构 * Lehigh University(莱恩大学) New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出SDE-HGNN,利用随机微分方程重建不规则观测的连续潜在轨迹,构建动态超图捕获脑区高阶交互,并通过SDE控制的循环动力学实现疾病阶段自适应连接建模,在AD进展预测中优于现有方法。

Comments Submitted to AMIA Annual Symposium 2026, 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24855 2026-06-24 cs.AI 新提交

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24616 2026-06-24 cs.AI cs.PF econ.GN q-fin.EC 新提交

AI Tokenomics: The Economics of Tokens, Computation, and Pricing in Foundation Models

AI Tokenomics:基础模型中的代币、计算与定价经济学

Quanyan Zhu

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)

AI总结 本文提出AI代币经济学框架,研究代币在AI系统中的生成、消耗、定价、分配与优化,揭示代币支出与经济价值的区别,并指出开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24551 2026-06-24 cs.AI 新提交

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

GUI vs. CLI:纯屏幕与技能中介计算机使用代理的执行瓶颈

Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(上海纽约大学) Yale NLP Lab(耶鲁大学自然语言处理实验室)

AI总结 通过匹配基准测试,发现GUI代理在长流程任务中表现优于CLI代理,但CLI代理通过技能增强可超越GUI,揭示两者执行瓶颈分别在于可靠交互与技能覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24472 2026-06-24 cs.RO cs.AI 新提交

G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models

G$^3$VLA:视觉-语言-动作模型的几何归纳偏置

Yue Peng, Yongzhe Zhao, Artur Habuda, Khuyen Pham, Yanheng Zhu, Tran Nguyen Le, Fares Abu-Dakka, Li Guo

机构 * New York University Shanghai(上海纽约大学) Technical University of Denmark(丹麦技术大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

AI总结 提出G$^3$VLA模块,通过射线嵌入、投影位置编码和跨视图融合为VLA模型注入相机几何先验,无需深度传感器,在多个基准和真实机器人上提升空间敏感任务性能。

Comments Submitted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏