arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

New York University(纽约大学)

2026-03-18 至 2026-03-18 共收录 10
2603.16792 2026-03-18 cs.CV cs.AI

V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising

V-Co:通过去噪更深入地审视视觉表示对齐

Han Lin, Xichen Pan, Zun Wang, Yue Zhang, Chu Wang, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NYU(纽约大学) Meta AI2(人工智能研究院)

AI总结 本文通过统一的JiT框架系统研究视觉去噪,揭示了四个关键要素:双流架构、结构化无条件预测、感知漂移混合损失和特征重缩放,从而在ImageNet-256上实现更高效的生成模型。

Comments code: https://github.com/HL-hanlin/V-Co

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16731 2026-03-18 cs.LG

Understanding Quantization of Optimizer States in LLM Pre-training: Dynamics of State Staleness and Effectiveness of State Resets

理解大语言模型预训练中优化器状态的量化:状态陈旧的动力学与状态重置的有效性

Kristi Topollai, Anna Choromanska

机构 * New York University(纽约大学)

AI总结 研究低精度指数移动平均优化器状态的动力学,揭示量化导致状态陈旧的问题,并提出预测模型指导状态重置策略,提升低精度预训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16718 2026-03-18 cs.CL

Arabic Morphosyntactic Tagging and Dependency Parsing with Large Language Models

阿拉伯词法句法标注与依赖解析中的大语言模型

Mohamed Adel, Bashar Alhafni, Nizar Habash

机构 * Computational Approaches to Modeling Language Lab(语言建模方法计算实验室) New York University Abu Dhabi(纽约大学阿布扎克分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文评估了大语言模型在阿拉伯语词法句法标注和依赖解析任务中的表现,发现提示设计和示例选择对性能影响显著,专有模型在特征层面标注接近监督基线,且在依赖解析中具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15940 2026-03-18 cs.CR cs.CV

Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models

不要留下空白:视觉-语言模型中的无幻觉物体遮蔽

Amira Guesmi, Muhammad Shafique

机构 * Engineering Division, New York University Abu Dhabi, UAE(纽约大学阿布扎比分校工程系)

AI总结 本文提出一种背景一致的物体遮蔽攻击方法,通过重新编码视觉表示使目标物体与背景一致,避免幻觉产生,实验显示其能有效遮蔽目标物体并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15923 2026-03-18 stat.ML cs.LG

Learning to Recall with Transformers Beyond Orthogonal Embeddings

基于非正交嵌入的Transformer学习回忆

Nuri Mert Vural, Alberto Bietti, Mahdi Soltanolkotabi, Denny Wu

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所) Flatiron Institute(Flatiron研究所) University of Southern California(南加州大学) New York University and Flatiron Institute(纽约大学和Flatiron研究所)

AI总结 本文研究了在非正交嵌入条件下,单层Transformer在简单token检索任务中的存储容量,揭示了样本量、嵌入维度和序列长度之间的乘积关系。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15903 2026-03-18 cs.CL

Agent-based imitation dynamics can yield efficiently compressed population-level vocabularies

基于代理的模仿动力学可以产生高效压缩的群体层面词汇

Nathaniel Imel, Richard Futrell, Michael Franke, Noga Zaslavsky

机构 * Department of Psychology, New York University(纽约大学心理学系) Department of Language Science, University of California, Irvine(加州大学欧文分校语言科学系) Department of Linguistics, University of Tübingen(图宾根大学语言学系)

AI总结 本文探讨了基于代理的模仿动力学如何在信号游戏中实现词汇的高效压缩,结合进化博弈论与信息瓶颈框架,揭示了词汇优化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15563 2026-03-18 cs.LG cs.AI

The PokeAgent Challenge: Competitive and Long-Context Learning at Scale

PokeAgent挑战:在大规模中实现竞争性和长上下文学习

Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin

机构 * Princeton(普林斯顿大学) UT-Austin(得克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind) Team Heatz(团队Heatz) Team PA-Agent(团队PA-Agent) Team FoulPlay(团队FoulPlay) Team 4thLesson(团队4thLesson) Team Q(团队Q) Team Anthonys(团队Anthonys) Team Hamburg(团队Hamburg) Team Porygon2AI(团队Porygon2AI) Team Deepest(团队Deepest) Team August(团队August)

AI总结 PokeAgent挑战通过两个互补赛道,解决部分可观测性、博弈推理和长周期规划问题,提供大规模基准测试和首个RPG速run评估框架,揭示通用(LLM)、专业(RL)和精英人类表现间的差距。

Comments 41 pages, 26 figures, 5 tables. NeurIPS 2025 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11408 2026-03-18 q-fin.ST cs.CL

Beyond Polarity: Multi-Dimensional LLM Sentiment Signals for WTI Crude Oil Futures Return Prediction

超越极性:多维LLM情感信号用于WTI原油期货收益率预测

Dehao Dai, Ding Ma, Dou Liu, Kerui Geng, Yiqing Wang

机构 * University of California San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) Tulane University(路易斯安那州立大学) Southern Methodist University(南方 Methodist 大学)

AI总结 本文研究多维情感信号对WTI原油期货收益率预测的提升作用,利用GPT-4o等模型提取五种情感维度,发现结合GPT-4o和FinBERT可获得最佳预测效果,证明情感信号超越单纯极性具有预测价值。

Comments 28 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13644 2026-03-18 cs.RO cs.AI cs.CV

World Models for Learning Dexterous Hand-Object Interactions from Human Videos

为从人类视频学习灵巧手-物体交互构建世界模型

Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, Yann LeCun

机构 * FAIR at Meta(Meta 的 FAIR 部门) New York University(纽约大学)

AI总结 本文提出DexWM模型,通过手部关键点提取实现对精细手部动作的建模,提升未来状态预测和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15624 2026-03-18 cs.CV cs.AI cs.RO

Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision

探索视觉语言模型在帮助视障和低视力人士导航中的应用

Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher, Marco Mezzavilla, Yao Wang, Sundeep Rangan, Maurizio Porfiri, Zhou Yu, John-Ross Rizzo

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) Politecnico di Milano(米兰理工大学)

AI总结 本文评估了多种VLMs在基础视觉技能和导航任务中的表现,发现GPT-4o在空间推理和场景理解上表现最佳,而开源模型在复杂环境中存在不足,需进一步改进以提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏