arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 1612
2506.00318 2026-04-07 cs.CV

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03180 2026-04-06 cs.LG cs.CL cs.IR cs.SI

PRISM: LLM-Guided Semantic Clustering for High-Precision Topics

PRISM:基于LLM的语义聚类用于高精度主题

Connor Douglas, Utkucan Balci, Joseph Aylett-Bullock

机构 * New York University(纽约大学) Binghamton University(宾汉姆顿大学)

AI总结 PRISM结合LLM的丰富表示与低成本可解释的潜在语义聚类方法,通过稀疏LLM标签微调句子编码模型,提升主题分离度,适用于多语料库的高精度主题发现。

Comments To appear in Proceedings of the ACM Web Conference 2026 (WWW 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03014 2026-04-06 cs.IR cs.AI

User-Aware Conditional Generative Total Correlation Learning for Multi-Modal Recommendation

面向用户的条件生成总相关性学习多模态推荐

Jing Du, Zesheng Ye, Congbo Ma, Feng Liu, Flora. D. Salim

机构 * The University of New South Wales(新南威尔士大学) University of Melbourne(墨尔本大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

AI总结 本文提出GTC框架,通过用户感知的内容特征过滤和总相关性优化,提升多模态推荐的性能,实验表明在NDCG@5上提升达28.30%。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02570 2026-04-06 cs.CV cs.LG

WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models

WSVD:用于低精度视觉-语言模型快速高效执行的加权低秩近似

Haiyu Wang, Yutong Wang, Jack Jiang, Sai Qian Zhang

机构 * Tandon School of Engineering, New York University(纽约大学坦登工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所)

AI总结 本文提出WSVD方法,通过加权低秩近似和量化技术,提升视觉-语言模型的执行效率,实现1.8倍以上的解码速度提升同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02485 2026-04-06 cs.CL cs.LG

Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models

未能证伪:评估和缓解语言模型中的确认偏见

Ayush Rajesh Jhaveri, Anthony GX-Chen, Ilia Sucholutsky, Eunsol Choi

机构 * New York University(纽约大学)

AI总结 研究评估了大型语言模型是否表现出确认偏见,并提出干预策略以减少其影响,通过实验发现干预可显著提高规则发现率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06649 2026-04-06 cs.LG cs.AI

Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions

局部强化学习与基于动作的均方Q函数

Frank Wu, Mengye Ren

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

AI总结 本文提出基于动作的均方Q函数,通过时间差分学习实现局部强化学习,优于现有无反向传播方法,在MinAtar和DeepMind控制套件中表现优异。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01594 2026-04-03 cs.AI

Do Large Language Models Mentalize When They Teach?

大型语言模型在教学时是否具备心智化能力?

Sevan K. Harootonian, Mark K. Ho, Thomas L. Griffiths, Yael Niv, Ilia Sucholutsky

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

AI总结 研究通过控制任务探讨LLM教学决策机制,发现LLM在教学策略上与人类相似,但Bayes-Optimal模型最佳解释其选择,提示提示合规性不等于教学效果提升。

Comments 9 pages, 5 figures. Workshop paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05500 2026-04-03 cs.AI

The Illusion of AI Expertise Under Uncertainty: Navigating Elusive Ground Truth via a Probabilistic Paradigm

人工智能专家能力的幻觉:通过概率范式导航 elusive 的真实地面真相

Aparna Elangovan, Lei Xu, Mahsa Elyasi, Ismail Akdulum, Mehmet Aksakal, Enes Gurun, Brian Hur, Saab Mansour, Ravid Shwartz Ziv, Karin Verspoor, Dan Roth

机构 * Independent Researcher(独立研究员) Amazon(亚马逊) Gazi University(加齐大学) University of Colorado(科罗拉多大学) Samsun University(萨姆松大学) The University Of Melbourne(墨尔本大学) New York University(纽约大学) RMIT University(皇家墨尔本理工大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出概率范式,揭示高置信度真实答案对专家高分的必要性,指出在真实答案变化大的数据集中,随机标注者与专家表现差异不大,强调在低专家表现时,按真实答案概率分层评估至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09031 2026-04-03 cs.LG cs.AI

A Comprehensive Graph Pooling Benchmark: Effectiveness, Robustness and Generalizability

图池化全面基准:有效性、鲁棒性和泛化性

Pengyun Wang, Junyu Luo, Yanxin Shen, Ming Zhang, Shaoen Qin, Hanwen Xing, Siyu Heng, Xiao Luo

机构 * University of Chicago(芝加哥大学) Peking University(北京大学) Nankai University(南开大学) University of Southern California(南加州大学) New York University(纽约大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文构建了包含17种图池化方法和28个图数据集的全面基准,系统评估了图池化方法在有效性、鲁棒性和泛化性三方面的性能,通过不同任务和噪声攻击实验验证其强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00464 2026-04-02 cs.HC cs.AI cs.CL cs.CY

Not My Truce: Personality Differences in AI-Mediated Workplace Negotiation

不是我的和解:人工智能调解职场谈判中的人格差异

Veda Duddu, Jash Rajesh Parekh, Andy Mao, Hanyi Min, Ziang Xiao, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 研究探讨了人工智能调解职场谈判中个体差异对效果的影响,发现不同人格特质的用户对不同干预方式的响应不同,强调了针对个体需求设计干预的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04636 2026-04-02 cs.AI

When Agents Persuade: Rhetoric Generation and Mitigation in LLMs

当代理体说服:大语言模型中的修辞生成与缓解

Julia Jose, Ritik Roongta, Rachel Greenstadt

机构 * New York University(纽约大学)

AI总结 研究探讨大语言模型在被提示生成宣传内容时的表现,通过专门模型分析其修辞手法,并发现通过监督微调等方法可有效减少此类内容生成。

Comments Accepted to the ICLR 2026 Workshop on Agents in the Wild (AgentWild). 20 pages including appendix, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08522 2026-04-02 cs.CL

AlphaResearch: Accelerating New Algorithm Discovery with Language Models

AlphaResearch:利用语言模型加速新算法发现

Zhaojian Yu, Kaiyue Feng, Yilun Zhao, Shilin He, Xiao-Ping Zhang, Arman Cohan

机构 * Tsinghua University(清华大学) New York University(纽约大学) Yale University(耶鲁大学)

AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00036 2026-04-02 q-bio.NC cs.AI cs.LG cs.NE physics.bio-ph

When and Where: A Model Hippocampal Network Unifies Formation of Time Cells and Place Cells

何时与何地:一种海马网络模型统一了时间细胞和位置细胞的形成

Qiaorong S. Yu, Zhaoze Wang, Vijay Balasubramanian

机构 * New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出一种海马网络模型,通过动态机制统一了时间细胞和位置细胞的形成,揭示了两者共享的起源与任务驱动的差异。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28901 2026-04-01 cs.RO

See Something, Say Something: Context-Criticality-Aware Mobile Robot Communication for Hazard Mitigations

看见即应言:面向灾害缓解的上下文感知移动机器人通信

Bhavya Oza, Devam Shah, Ghanashyama Prabhu, Devika Kodi, Aliasghar Arab

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) ASAS LABS, Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系ASAS实验室)

AI总结 本文提出一种上下文感知的移动机器人通信框架,通过感知驱动自适应消息生成,提升灾害响应速度和有效性,在60多次实验中验证了结构化关键性评估对响应速度和缓解效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28890 2026-04-01 cs.RO

Bootstrap Perception Under Hardware Depth Failure for Indoor Robot Navigation

基于硬件深度故障的室内机器人导航 bootstrap 感知系统

Nishant Pushparaju, Vivek Mattam, Aliasghar Arab

机构 * New York University(纽约大学) City College of New York(纽约市立学院)

AI总结 本文提出一种在硬件深度故障情况下用于室内机器人导航的 bootstrap 感知系统,通过自参照性质校准单目深度,提升障碍物感知覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28888 2026-04-01 cs.RO

A Semantic Observer Layer for Autonomous Vehicles: Pre-Deployment Feasibility Study of VLMs for Low-Latency Anomaly Detection

面向自动驾驶的语义观察层:VLMs在低延迟异常检测中的预部署可行性研究

Kunal Runwal, Swaraj Gajare, Daniel Adejumo, Omkar Ankalkope, Siddhant Baroth, Aliasghar Arab

机构 * The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系) Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院电气与计算机工程系)

AI总结 本文提出一种语义观察层,通过量化视觉-语言模型实现低延迟异常检测,验证了其在自动驾驶平台上的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15987 2026-04-01 cs.LG cs.AI cs.DS stat.ML

Provably Extracting the Features from a General Superposition

从一般叠加中可证明地提取特征

Allen Liu

机构 * UC Berkeley(加州大学伯克利分校) NYU Courant(纽约大学库朗数学科学研究所)

AI总结 从学习理论角度研究如何从叠加中提取可解释特征,提出高效的查询算法以恢复特征方向和函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10938 2026-04-01 cs.LG cs.AI cs.CL cs.CV

Stronger Normalization-Free Transformers

更强的无归一化变换器

Mingzhi Chen, Taiming Lu, Jiachen Zhu, Mingjie Sun, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Derf函数,通过大规模搜索找到更有效的归一化替代方案,其在视觉识别、语音表示和DNA序列建模中均优于LayerNorm、RMSNorm和DyT。

Comments Published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21273 2026-04-01 cs.LG

Deep Polynomial Chaos Expansion

深度多项式混沌展开

Johannes Exenberger, Sascha Ranftl, Robert Peharz

机构 * CAIML, TU Wien(维也纳工业大学 CAIML) TU Graz(格拉茨工业大学) Brown University(布朗大学) Courant Institute NYU(纽约大学库朗研究所) Graz Center for Machine Learning(格拉茨机器学习中心)

AI总结 本文提出深度多项式混沌展开(DeepPCE),通过结合可处理的概率电路理念,实现高维输入空间的有效扩展,保持了PCE精确统计推断的能力,同时性能媲美多层感知机。

Comments 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21458 2026-04-01 cs.AI cs.CL cs.CV

MindCube: Spatial Mental Modeling from Limited Views

MindCube:从有限视角构建空间心理模型

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) New York University(纽约大学) University of Washington(华盛顿大学)

AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。

Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28243 2026-03-31 cs.RO cs.SY eess.SY

Cost-Matching Model Predictive Control for Efficient Reinforcement Learning in Humanoid Locomotion

基于成本匹配的模型预测控制用于人形机器人高效强化学习

Wenqi Cai, Kyriakos G. Vamvoudakis, Sébastien Gros, Anthony Tzes

机构 * New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校) Georgia Institute of Technology(佐治亚理工学院) Norwegian University of Science and Technology (NTNU)(挪威科技大学)

AI总结 本文提出一种基于模型预测控制的强化学习框架中的成本匹配方法,通过参数化MPC和中心动力学来近似高保真闭环数据获得的动作价值函数,提升人形机器人运动性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27796 2026-03-31 cs.RO

Spectral Decomposition of Inverse Dynamics for Fast Exploration in Model-Based Manipulation

逆动力学的谱分解用于基于模型的操纵快速探索

Solvin Sigurdson, Benjamin Riviere, Joel Burdick

机构 * California Institute of Technology(加州理工学院) New York University(纽约大学)

AI总结 本文提出利用逆动力学方程的谱分解生成轨迹的方法,通过正交成分高效探索复杂接触动态,实现长时域规划,展示了在高复杂度领域中的实时能力。

Comments 8 pages, 8 figures, accepted to the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19347 2026-03-31 cs.AR cs.LG

Exploring the Agentic Frontier of Verilog Code Generation

探索Verilog代码生成的代理前沿

Patrick Yubeaton, Siddharth Garg, Chinmay Hegde

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)

AI总结 本文系统评估了代理LLM在Verilog生成中的影响,通过CVDP基准测试,分析了结构化提示和工具设计对性能的影响,并比较了开源与闭源模型的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27429 2026-03-31 cs.CV

Mind the Shape Gap: A Benchmark and Baseline for Deformation-Aware 6D Pose Estimation of Agricultural Produce

注意形状差距:一种用于农业产品的变形感知6D姿态估计的基准和基线

Nikolas Chatzis, Angeliki Tsinouka, Katerina Papadimitriou, Niki Efthymiou, Marios Glytsos, George Retsinas, Paris Oikonomou, Gerasimos Potamianos, Petros Maragos, Panagiotis Paraskevas Filntisis

机构 * Robotics Institute, Athena Research Center(雅典娜研究中心机器人研究所) HERON - Hellenic Robotics Center of Excellence(HERON - 希腊机器人卓越中心) School of Electrical & Computer Engineering, NTUA(国立雅典理工大学电气与计算机工程学院) Music Technology, New York University(纽约大学音乐技术系) Department of Electrical & Computer Engineering, UTH(色萨利大学电气与计算机工程系)

AI总结 本文提出PEAR基准和SEED框架,解决农业产品变形导致的6D姿态估计难题,展示现有方法性能下降,并证明显式形状建模对农业机器人可靠姿态估计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27156 2026-03-31 cs.LG cs.AI

GSR-GNN: Training Acceleration and Memory-Saving Framework of Deep GNNs on Circuit Graph

GSR-GNN:电路图上深度GNN的训练加速与内存节省框架

Yuebo Luo, Shiyang Li, Yifei Feng, Vishal Kancharla, Shaoyi Huang, Caiwen Ding

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校) New York University(纽约大学) Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 本文提出GSR-GNN框架,通过可逆残差模块和分组稀疏非线性操作,实现深度GNN在大规模电路图上的高效训练,达到87.2%的内存节省和30倍以上的加速,同时保持相关质量指标的稳定。

Comments 8 pages including references, already been accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24903 2026-03-31 cs.CV

Self-Supervised Learning for Knee Osteoarthritis: Diagnostic Limitations and Prognostic Value of Hospital Data

自监督学习在膝骨关节炎中的应用:医院数据的诊断局限性与预后价值

Haresh Rengaraj Rajamohan, Yuxuan Chen, Kyunghyun Cho, Cem M. Deniz

机构 * Department of Physics, J.K. Institute of Science(物理系,J.K. 科学研究所) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) Center for Data Science, New York University(数据科学中心,纽约大学) Bernard and Irene Schwartz Center for Biomedical Imaging, New York University Langone Health(伯纳德和艾琳·施瓦茨生物医学成像中心,纽约大学朗格尼健康中心) Department of Radiology, New York University Langone Health(放射学系,纽约大学朗格尼健康中心) Perlmutter Cancer Center, New York University Langone Health(珀尔马特癌症中心,纽约大学朗格尼健康中心)

AI总结 本研究评估自监督学习是否能提升膝骨关节炎的诊断与预后建模,发现医院数据在诊断分级中表现有限,但对预后预测有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12812 2026-03-31 cs.CL cs.AI

Does Tone Change the Answer? Evaluating Prompt Politeness Effects on Modern LLMs: GPT, Gemini, and LLaMA

语调会改变答案吗?评估提示礼貌性对现代LLMs的影响:GPT、Gemini和LLaMA

Hanyu Cai, Binqi Shen, Lier Jin, Lan Hu, Xiaojing Fan

机构 * Northwestern University(西北大学) Duke University(杜克大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

AI总结 本文通过MMMLU基准测试,评估了不同语调提示对GPT、Gemini和LLaMA模型在STEM和人文领域任务中的准确性影响,发现礼貌性提示在部分人文任务中显著提升性能,但整体上现代LLMs对语调变化具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20620 2026-03-30 cs.CV cs.RO

Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI

Wanderland: 为开放世界具身AI提供几何学基础的模拟

Xinhao Liu, Jiaqi Li, Youming Deng, Ruxin Chen, Yingjia Zhang, Yifei Ma, Li Guo, Yiming Li, Jing Zhang, Chen Feng

机构 * New York University(纽约大学) Cornell University(康奈尔大学)

AI总结 本文提出Wanderland框架,通过多传感器采集和高精度几何重建,解决开放世界具身AI中模拟与现实差距大的问题,并展示其在导航政策学习中的应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏