arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 1612
2603.09723 2026-04-29 cs.CL cs.AI

RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation

RbtAct: 用于生成可操作性评审反馈的反驳作为监督

Sihong Wu, Yiling Ma, Yilun Zhao, Tiansheng Hu, Owen Jiang, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学) TCS Research(TCS研究院)

AI总结 本文提出RbtAct,通过利用反驳作为隐式监督,优化反馈生成器以提高可操作性。引入了视角条件段级评审反馈生成任务,并构建了RMR-75K数据集,实验表明在可操作性和具体性上优于基线模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22793 2026-04-29 cs.LG

GSpaRC: Gaussian Splatting for Real-time Reconstruction of RF Channels

GSpaRC:高斯点云用于射频信道的实时重建

Bhavya Sai Nukapotula, Rishabh Tripathi, Seth Pregler, Dileep Kalathil, Srinivas Shakkottai, Theodore S. Rappaport

机构 * Texas A&M University(德克萨斯A&M大学) New York University(纽约大学)

AI总结 GSpaRC通过高斯点云技术实现射频信道的高精度实时重建,显著降低训练和推理时间,适用于5G及未来无线系统。

Comments Project website: https://nbhavyasai.github.io/GSpaRC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05205 2026-04-29 cs.CL

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

RELIC:通过上下文语言识别评估复杂推理

Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

机构 * Department of Linguistics(语言学系) Center for Data Science(数据科学中心) New York University(纽约大学)

AI总结 RELIC通过评估语言是否属于上下文无关文法生成的语言,衡量LLM的复杂推理能力,发现先进模型在任务复杂度增加时推理计算减少,策略转向猜测。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24737 2026-04-28 cs.LG cs.AI cs.CC stat.ML

Learning to Think from Multiple Thinkers

从多个思考者学习思考

Nirmit Joshi, Roey Magen, Nathan Srebro, Nikolaos Tsilivis, Gal Vardi

机构 * Toyota Technological Institute at Chicago(芝加哥科技学院) Weizmann Institute of Science(魏茨曼科学研究院) New York University(纽约大学)

AI总结 研究从多个思考者提供的链式思维监督学习,探讨在单个思考者监督下易学但仅凭结果监督难学的类别,证明在加密假设下,多思考者监督下学习可能困难,并提出高效主动学习算法。

Comments Comments are welcome. There are 78 pages and 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24563 2026-04-28 physics.chem-ph cs.LG stat.ML

Enhancing molecular dynamics with equivariant machine-learned densities

通过等价性机器学习密度增强分子动力学

Mihail Bogojeski, Muhammad R. Hasyim, Leslie Vogt-Maranto, Klaus-Robert Müller, Kieron Burke, Mark E. Tuckerman

机构 * BIFOLD and Machine Learning Group, Technische Universität Berlin(BIFOLD与机器学习组,柏林技术大学) Department of Chemistry, New York University(纽约大学化学系) Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Max-Planck-Institut für Informatik(马克斯·普朗克研究所(信息学)) Department of Physics and Astronomy, University of California, Irvine(加州大学 Irvine 分校物理与天文学系) Department of Chemistry, University of California, Irvine(加州大学 Irvine 分校化学系) Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院) NYU-ECNU Center for Computational Chemistry at NYU Shanghai(纽约大学上海计算化学中心)

AI总结 本文提出DenSNet,通过等价神经网络学习电子密度,实现分子动力学与电子结构的统一框架,验证了其在乙醇、乙硫醇和香豆素等分子中的应用,并展示了其在大规模分子模拟中预测光谱和电子性质的可行性。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24506 2026-04-28 cs.AI cs.LG

MIMIC: A Generative Multimodal Foundation Model for Biomolecules

MIMIC:一种生成式多模态基础模型用于生物分子

Siavash Golkar, Jake Kovalic, Irina Espejo Morales, Samuel Sledzieski, Minhuan Li, Ksenia Sokolova, Geraud Krawezik, Alberto Bietti, Claudia Skok Gibbs, Roman Klypa, Shengwei Xiong, Francois Lanusse, Liam Parker, Kyunghyun Cho, Miles Cranmer, Tom Hehir, Michael McCabe, Lucas Meyer, Rudy Morel, Payel Mukhopadhyay, Mariel Pettee, Helen Qu, Jeff Shen, David Fouhey, Hadi Sotoudeh, Vikram Mulligan, Pilar Cossio, Sonya M. Hanson, Alisha N. Jones, Olga G. Troyanskaya, Shirley Ho

机构 * Polymathic AI Center for Data Science, New York University(多学科人工智能数据科学中心,纽约大学) Polymathic AI Department of Applied Physics, Yale University(多学科人工智能应用物理系,耶鲁大学) Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) Princeton Precision Health, Princeton University(普林斯顿精准健康,普林斯顿大学) Department of Chemistry, New York University(化学系,纽约大学) Department of Computer Science, Princeton University(计算机科学系,普林斯顿大学) Lewis-Sigler Institute for Integrative Genomics, Princeton University(刘易斯-西格尔整合基因组学研究所,普林斯顿大学) Center for Computational Astrophysics, Flatiron Institute(计算天文学中心,Flatiron研究所) Department of Astrophysical Sciences, Princeton University(天体物理科学系,普林斯顿大学) Department of Physics, New York University(物理学系,纽约大学)

AI总结 MIMIC通过多模态生成模型统一生物分子的表示学习、条件预测和受限设计,实现对RNA和蛋白质的先进预测与设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23902 2026-04-28 cs.AI

LLM-Augmented Traffic Signal Control with LSTM-Based Traffic State Prediction and Safety-Constrained Decision Support

基于LSTM的交通信号控制与大语言模型增强的交通状态预测与安全约束决策支持

Jiazhao Shi

机构 * Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

AI总结 本文提出一种结合LSTM交通状态预测和大语言模型的交通信号控制框架,通过预测信号相位和生成自然语言解释,提升交通效率并确保安全约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23863 2026-04-28 cs.RO cs.SY eess.SY

Cooptimizing Safety and Performance Using Safety Value-Constrained Model Predictive Control

通过安全价值约束模型预测控制优化安全与性能

Hao Wang, Nam Nguyen, Armand Jordana, Ludovic Righetti, Somil Bansal

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(南加州大学明希德电气与计算机工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空与航天系) Electrical and Computer Engineering Department, New York University(纽约大学电气与计算机工程系)

AI总结 本文提出基于安全价值函数的终端约束MPC方法,实现安全与性能的协同优化,通过仿真和硬件实验验证了其在约束满足和鲁棒性方面的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23815 2026-04-28 cs.CL

DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute

DRACULA:寻找用户想要的行动深度研究代理执行研究

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Allen Institute for Artificial Intelligence (Ai2)(人工智能研究院(Ai2))

AI总结 DRACULA通过收集用户对中间行动的反馈,研究深度研究代理如何预测用户偏好行动,揭示了行动选择的可预测性及用户目标对行动执行的影响。

Comments In-progress Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18920 2026-04-28 cs.SD cs.CL

Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features

不同说话模式下基于发声和音素特征的sEMG编码精度比较

Chenqian Le, Ruisi Li, Beatrice Fumagalli, Yasamin Esmaeili, Xupeng Chen, Amirhossein Khalilian-Gourtani, Tianyu He, Adeen Flinker, Yao Wang

机构 * New York University(纽约大学)

AI总结 研究比较了SPARC和音素特征在不同说话模式下的sEMG预测精度,发现SPARC在多数电极和所有说话模式中表现更优,且亚 vocal说话仍能检测到发声活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18648 2026-04-28 cs.CV cs.AI

DanceCrafter: Fine-Grained Text-Driven Controllable Dance Generation via Choreographic Syntax

DanceCrafter: 通过编舞语法实现细粒度文本驱动可控舞蹈生成

Hang Yuan, Xiaolin Hu, Yan Wan, Menglin Gao, Wenzhe Yu, Cong Huang, Fei Xu, Qing Li, Christina Dan Wang, Zhou Yu, Kai Chen

机构 * East China Normal University(东华大学) Beijing Dance Academy(北京舞蹈学院) Beijing University of Posts and Telecommunications(北京邮电大学) New York University Shanghai(纽约大学上海分校) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 本文提出编舞语法框架和DanceFlow数据集,结合专业舞蹈档案与高保真动作捕捉数据,构建细粒度可控舞蹈生成模型DanceCrafter,实现高质量复杂舞蹈序列生成。

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12134 2026-04-28 cs.AI cs.HC

Value Alignment Tax: Measuring Value Trade-offs in LLM Alignment

价值对齐税:在大语言模型对齐中测量价值权衡

Jiajun Chen, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

AI总结 本文提出VAT框架,用于测量对齐干预如何影响价值系统,揭示目标值与非目标值之间的系统性权衡,通过实验数据展示对齐过程中的潜在风险。

Comments Preprint. Under review. 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22973 2026-04-28 cs.RO

Collaborative Trajectory Prediction via Late Fusion

通过晚期融合进行协作轨迹预测

Nadya Abdel Madjid, Murad Mebrahtu, Zakhar Yagudin, Bilal Hassan, Naoufel Werghi, Jorge Dias, Dzmitry Tsetserukou, Majid Khonji

机构 * Khalifa University, Computer Science(卡利法大学,计算机科学) New York University Abu Dhabi, Computer Science(纽约大学阿布扎赫德分校,计算机科学) Khalifa University, Computer and Information Engineering(卡利法大学,计算机与信息工程) Khalifa University, KUCARS-KU Center for Autonomous Robotic Systems, Department of Computer Science(卡利法大学,KUCARS-KU自主机器人系统中心,计算机科学系) Skolkovo Institute of Science, Intelligent Space Robotics Laboratory, Center for Engineering Systems and Sciences, and Technology(斯科尔科沃科学研究所,智能空间机器人实验室,工程系统与科学中心,和技术)

AI总结 本文提出通过将协作从感知阶段转移到预测模块,并引入晚期融合框架来减少不确定性,提升轨迹预测的准确性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22847 2026-04-28 cs.CV

Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes

Dream-Cubed:通过训练数十亿个立方体实现Minecraft中的可控生成建模

Tim Merino, Sam Earle, Ryunosuke Iwai, Julian Togelius, Edoardo Cetin

机构 * New York University(纽约大学) Sakana AI

AI总结 本文提出Dream-Cubed数据集及基于立方体的生成模型,用于高效生成交互式3D环境,通过分析扩散模型的不同形式和架构,评估生成质量并释放预训练模型以推动未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22036 2026-04-27 cs.CV cs.AI cs.LG

EgoMAGIC- An Egocentric Video Field Medicine Dataset for Training Perception Algorithms

EgoMAGIC- 一种用于训练感知算法的自拍视频医学数据集

Brian VanVoorst, Nicholas Walczak, Christopher Gilleo, Charles Meissner, Fabio Felix, Iran Roman, Bea Steers, Claudio Silva, Yuhan Shen, Zijia Lu, Shih-Po Lee, Ehsan Elhamifar

机构 * RTX BBN Technologies(RTX BBN技术公司) New York University(纽约大学) Northeastern University(东北大学)

AI总结 本文介绍EgoMAGIC数据集,包含50项医学任务的3355个视频,用于训练感知算法,通过挑战赛推动研究,提供124种医学物体的检测基准。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21377 2026-04-24 cs.RO cs.HC

A Replicable Robotics Awareness Method Using LLM-Enabled Robotics Interaction: Evidence from a Corporate Challenge

一种利用LLM增强的机器人交互方法进行可复制的机器人意识:来自企业挑战的证据

S. A. Prieto, M. A. Gopee, Y. Ben Arab, B. García de Soto, J. Esteba, P. Olivera Brizzio

机构 * KINESIS Core Technology Platform, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校KINESIS核心科技平台) S.M.A.R.T. Construction Research Group, Division of Engineering, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校S.M.A.R.T.建筑研究小组) AD Ports Group, Corporate Innovation Department(AD Ports集团企业创新部)

AI总结 本文提出了一种基于挑战的机器人意识方法,通过LLM增强的人形机器人与阿德港集团员工的互动,展示了在工业环境中提升机器人意识的可行性与可复制性。

Comments 10 pages, 8 Figures, to be submitted for journal per-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20421 2026-04-23 cs.LG

Unlocking the Forecasting Economy: A Suite of Datasets for the Full Lifecycle of Prediction Market: [Experiments \& Analysis]

解锁预测经济:一个用于预测市场全生命周期的数据集套件:[实验与分析]

Huaiyu Jia, Luofeng Zhou, Wentao Zhang, Lin William Cong, Siguang Li, Shuo Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出首个持续维护的去中心化预测市场全生命周期数据集,通过整合市场元数据、交易记录和预言机事件,提供可复现且可扩展的数据模型,用于分析市场活动及NBA和CPI案例。

Comments Project page: https://www.polymonitor.club/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07527 2026-04-23 cs.LG

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

卡尔曼滤波增强的GRPO用于基于强化学习的语言模型推理

Hu Wang, Congbo Ma, Ian Reid, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

AI总结 本文提出KRPO,通过卡尔曼滤波估计潜在提示级奖励基线,提升语言模型推理的训练奖励和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06239 2026-04-23 cs.RO

Open-Architecture End-to-End System for Real-World Autonomous Robot Navigation

面向真实世界的自主机器人导航开架系统

Venkata Naren Devarakonda, Ali Umut Kaypak, Raktim Gautam Goswami, Naman Patel, Rooholla Khorrambakht, Prashanth Krishnamurthy, Farshad Khorrami

机构 * Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(控制/机器人研究实验室(CRRL),电气与计算机工程系,NYU塔恩顿工程学院)

AI总结 本文提出一种轻量级开架端到端系统,通过整合多组件实现四足机器人实时导航,利用自然语言任务和语义信息构建场景图,基于LLM生成动态计划,实现在多个室内环境中的零样本自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20738 2026-04-23 cs.CL

RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering

RespondeoQA:一种双语拉丁-英语问答基准

Marisa Hudspeth, Patrick J. Burns, Brendan O'Connor

机构 * Manning College of Information & Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校信息与计算机科学学院) Institute for the Study of the Ancient World, New York University(纽约大学古代世界研究院)

AI总结 本文提出一个包含7800个问答对的双语拉丁-英语问答翻译基准,涵盖拉丁语教学资料中的多种问题类型,评估了三种大语言模型在技能类问题上的表现。

Comments Published in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16529 2026-04-22 cs.SE cs.AI cs.CL cs.LG

Scaling Test-Time Compute for Agentic Coding

为代理编程扩展测试时计算

Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk Helenowski, Ruan Silva, Zhengxing Chen, Srinivasan Iyer, Manzil Zaheer, Daniel Fried, Hannaneh Hajishirzi, Sanjeev Arora, Gabriel Synnaeve, Ruslan Salakhutdinov, Anirudh Goyal

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Washington(华盛顿大学) New York University(纽约大学) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

AI总结 本文提出基于轨迹紧凑表示的代理编程测试时扩展框架,通过递归竞赛投票和并行-蒸馏-细化方法提升长周期代理性能,实验证明在SWE-Bench和Terminal-Bench上显著提升效果。

Comments 70 pages, 26 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02779 2026-04-22 cs.CV cs.AI

3D Foundation Model for Generalizable Disease Detection in Head Computed Tomography

用于头部CT图像通用疾病检测的3D基础模型

Weicheng Zhu, Haoxu Huang, Huanze Tang, Rushabh Musthyala, Boyang Yu, Long Chen, Emilio Vega, Thomas O'Donnell, Seena Dehkharghani, Jennifer A. Frontera, Arjun V. Masurkar, Kara Melmed, Narges Razavian

机构 * New York University, Center for Data Science(纽约大学数据科学中心) New York University, Courant Institute of Mathematical Sciences(纽约大学Courant数学科学研究所) NYU Grossman School of Medicine, Department of Radiology(纽约大学 Grossman 医学院放射科) Siemens Healthineers(西门子医疗科技) NYU Grossman School of Medicine, Department of Neurology(纽约大学 Grossman 医学院神经病学部) NYU Grossman School of Medicine, Department of Neuroscience and Physiology(纽约大学 Grossman 医学院神经科学与生理学部) NYU Grossman School of Medicine, Neuroscience Institute(纽约大学 Grossman 医学院神经科学研究所)

AI总结 本文提出FM-CT模型,通过自监督学习在无需人工标注的情况下训练,提升头部CT图像中疾病检测的泛化能力,验证了自监督学习在医学影像中的有效性。

Comments Nature Biomedical Engineering (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18797 2026-04-22 cs.CV

CrossPan: A Comprehensive Benchmark for Cross-Sequence Pancreas MRI Segmentation and Generalization

CrossPan:跨序列胰腺MRI分割与泛化的综合性基准

Linkai Peng, Cuiling Sun, Zheyuan Zhang, Wanying Dou, Halil Ertugrul Aktas, Andrea M Bejar, Elif Keles, Tamas Gonda, Michael B Wallace, Zongwei Zhou, Gorkem Durak, Rajesh N Keswani, Ulas Bagci

机构 * Department of Radiology, Northwestern University(西北大学放射科) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系) Department of Computer Science, Northwestern University(西北大学计算机科学系) Department of Gastroenterology, New York University(纽约大学消化内科部) Division of Gastroenterology and Hepatology, Mayo Clinic in Florida(佛罗里达梅奥诊所消化内科与肝病学部) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Departments of Gastroenterology and Hepatology, Northwestern University(西北大学消化内科与肝病学部)

AI总结 研究揭示跨序列泛化是胰腺MRI分割临床应用的主要障碍,指出跨序列域偏移比跨中心差异更严重,且现有方法在物理驱动对比反转下效果有限,半监督学习在稳定强度分布下有提升但不稳定。

Comments Accepted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02304 2026-04-22 cs.CL

When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers

验证何时有效?对LLM作为解决方案验证器的深入探讨

Jack Lu, Ryan Teehan, Jinran Jin, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学)

AI总结 研究探讨了在何种条件下验证有效,通过分析37个模型在9个基准测试中的表现,发现跨模型家族验证效果优于自验证,且验证收益随模型相似性增加而降低。

Comments Accepted at ICLR 2026 AI with Recursive Self-Improvement workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18574 2026-04-21 cs.LG cs.AI

When Can LLMs Learn to Reason with Weak Supervision?

大语言模型何时能通过弱监督学习推理?

Salman Rahman, Jingyan Shen, Anna Mordvina, Hamid Palangi, Saadia Gabriel, Pavel Izmailov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New York University(纽约大学) Google(谷歌)

AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24562 2026-04-21 cs.LG

Scaling Recurrence-aware Foundation Models for Clinical Records via Next-Visit Prediction

通过下一步预测扩展临床记录的复发意识基础模型

Haresh Rengaraj Rajamohan, Xiang Gao, Weicheng Zhu, Shih-Lun Huang, Long Chen, Gabe Schulman, Huizhen Jin, Shengduo Li, Yixuan Wang, Huidi Yang, Kyunghyun Cho, Cem M. Deniz, Narges Razavian

机构 * Center for Data Science(数据科学中心) New York University(纽约大学) Department of Radiology(放射科) NYU Grossman School of Medicine(NYU Grossman医学院) Center for Biomedical Imaging(生物医学成像中心) Department of Population Health(人群健康部)

AI总结 本文提出RAVEN模型,通过复发意识的下一步预测策略,改进序列EHR数据生成,解决重复事件对性能指标的干扰问题,并展示模型在不同数据规模下的扩展行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06221 2026-04-21 cs.CL

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷

Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Scale AI George Mason University(乔治·梅森大学)

AI总结 本文提出BenchMarker工具,利用LLM检测多项选择基准测试中的三项常见缺陷,通过人工标注和审计12个基准测试,发现自动和众包数据中存在大量缺陷,且修复方法可能引入新问题,影响NLP评估质量。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07761 2026-04-21 cs.CL

Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers

测试时推理器是战略性的多选题答题者

Nishant Balepur, Atrey Desai, Rachel Rudinger

机构 * University of Maryland(马里兰大学) New York University(纽约大学)

AI总结 本文研究了测试时推理器在多选题回答中的策略性表现,发现其在全输入和仅选项输入下均能提升准确性,挑战了部分输入成功总是缺陷的观点。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21722 2026-04-21 cs.LG cs.AI stat.ML

Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape

Ioannis Bantzis, James B. Simon, Arthur Jacot

机构 * EPFL Lausanne(日内瓦联邦理工学院拉沃斯分校) UC Berkeley(伯克利大学) Courant Institute, NYU(纽约大学Courant研究所)

Comments Accepted at ICLR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏