arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 1612
2412.19441 2026-02-12 quant-ph cs.LG

Comparative Performance Analysis of Quantum Machine Learning Architectures for Credit Card Fraud Detection

量子机器学习架构在信用卡欺诈检测中的性能比较

Mansour El Alami, Nouhaila Innan, Muhammad Shafique, Mohamed Bennai

机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD), Abu Dhabi, UAE(纽约大学阿布扎比分校(NYUAD)工程学院 eBRAIN 实验室,阿布扎赫,阿联酋) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute, NYUAD, Abu Dhabi, UAE(量子与拓扑系统中心(CQTS),NYUAD 研究院,纽约大学阿布扎比分校(NYUAD),阿布扎赫,阿联酋)

AI总结 本文比较了三种量子机器学习架构在信用卡欺诈检测中的性能,发现VQC表现最佳,而EQNN面临非标准化数据挑战,强调了模型配置的重要性。

Comments 15 pages, 20 figures, 8 tables. Accepted in Applied Intelligence

Journal ref Appl Intell 56, 83 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09040 2026-02-11 eess.AS cs.AI cs.LG cs.SD

Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures

用于联合嵌入预测架构中自监督语音表示学习的软聚类锚点

Georgios Ioannides, Adrian Kieback, Judah Goldfeder, Linsey Pang, Aman Chadha, Aaron Elkins, Yann LeCun, Ravid Shwartz-Ziv

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) James Silberrad Brown Center for AI(詹姆斯·西伯拉德·布朗人工智能中心) Columbia University(哥伦比亚大学) Northeastern University(东北大学) Stanford University(斯坦福大学) Amazon GenAI(亚马逊生成人工智能)

AI总结 GMM-Anchored JEPA通过软聚类锚点提升语音表示学习,实现ASR、情感识别和槽填充的性能提升。

Comments 15 pages, 5 figures. Code: github.com/gioannides/clustering-anchored-jepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20906 2026-02-11 cs.LG

TwinWeaver: An LLM-Based Foundation Model Framework for Pan-Cancer Digital Twins

TwinWeaver: 一种基于大语言模型的跨癌症数字双胞胎基础模型框架

Nikita Makarov, Maria Bordukova, Lena Voith von Voithenberg, Estrella Pivel-Villanueva, Sabrina Mielke, Jonathan Wickes, Hanchen Wang, Mingyu Derek Ma, Keunwoo Choi, Kyunghyun Cho, Stephen Ra, Raul Rodriguez-Esteban, Fabian Schmich, Michael Menden

机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(罗氏计算科学卓越中心) Computational Health Center, Helmholtz Munich, Munich, Germany(海德堡慕尼黑计算健康中心) Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(慕尼黑路易斯·马克西米利安大学生物学系) Early Development Oncology, Roche Innovation Center Zurich, Roche, Schlieren, Switzerland(罗氏苏黎世创新中心早期肿瘤学) Computational Sciences Center of Excellence, Genentech, New York City, USA(基因泰克计算科学卓越中心) Computational Sciences Center of Excellence, Genentech, South San Francisco, USA(基因泰克计算科学卓越中心) Center for Data Science, New York University, New York City, USA(纽约大学数据科学中心) Department of Computer Science, Stanford University, Stanford, CA, USA(斯坦福大学计算机科学系) Computational Sciences Center of Excellence, Roche, Basel, Switzerland(罗氏巴塞尔计算科学卓越中心) Department of Biochemistry(生物化学系) Biotechnology Institute, The University of Melbourne, Melbourne, Australia(墨尔本大学生物技术研究所)

AI总结 TwinWeaver通过基于大语言模型的框架,构建跨癌症数字双胞胎,提升临床事件预测与风险分层精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06477 2026-02-11 cs.LG cs.AI

Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin

注意力沉降与压缩山谷是大语言模型中的双面现象

Enrique Queipo-de-Llano, Álvaro Arroyo, Federico Barbero, Xiaowen Dong, Michael Bronstein, Yann LeCun, Ravid Shwartz-Ziv

机构 * University of Oxford(牛津大学) AITHYRA New York University(纽约大学)

AI总结 本研究揭示了大语言模型中注意力沉降与压缩山谷的联系,提出信息流的Mix-Compress-Refine理论,解释LLM如何通过大规模激活控制注意力和压缩来组织深度计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01879 2026-02-11 cs.CL cs.AI

REPAIR: Robust Editing via Progressive Adaptive Intervention and Reintegration

通过渐进自适应干预与再整合实现鲁棒编辑

Yisu Wang, Ming Wang, Haoyuan Song, Wenjie Huang, Chaozheng Wang, Yi Xie, Xuming Ran

机构 * Engineering Center for Space Utilization of Chinese Academy of Sciences(中国科学院空间利用工程技术中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science and Engineering(计算机科学与工程学院) Northeastern University(东北大学) New York University(纽约大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

AI总结 REPAIR通过闭环反馈和动态内存管理实现鲁棒编辑,提升编辑准确性并减少知识遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09017 2026-02-10 cs.RO cs.LG

Contact-Anchored Policies: Contact Conditioning Creates Strong Robot Utility Models

接触锚定策略:接触条件创造强大的机器人效用模型

Zichen Jeff Cui, Omar Rayyan, Haritheja Etukuru, Bowen Tan, Zavier Andrianarivo, Zicheng Teng, Yihang Zhou, Krish Mehta, Nicholas Wojno, Kevin Yuanbo Wu, Manan H Anjaria, Ziyuan Wu, Manrong Mao, Guangxun Zhang, Binit Shah, Yejin Kim, Soumith Chintala, Lerrel Pinto, Nur Muhammad Mahi Shafiullah

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校) University of California, Los Angeles(加州大学洛杉矶分校) Hello Robot Inc.(Hello Robot公司) Ai2 University of Waterloo(滑铁卢大学)

AI总结 接触锚定策略通过接触条件实现强大的机器人效用模型,仅用23小时演示数据即在三种基本操作技能上实现跨环境泛化,并在零样本评估中超越现有最先进方法56%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08997 2026-02-10 cs.CY cs.CL

Paradox of De-identification: A Critique of HIPAA Safe Harbour in the Age of LLMs

去标识的悖论:在大型语言模型时代对HIPAA安全港的批判

Lavender Y. Jiang, Xujin Chris Liu, Kyunghyun Cho, Eric K. Oermann

机构 * New York University(纽约大学)

AI总结 本文批判HIPAA安全港在大型语言模型时代存在的不足,指出去标识的不完美性可能影响患者与提供者之间的信任,并提出通过因果图和实证研究揭示去标识悖论,呼吁社区采取行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08723 2026-02-10 cs.LG cs.CR stat.ML

Data Reconstruction: Identifiability and Optimization with Sample Splitting

数据重建:基于样本分割的可识别性与优化

Yujie Shen, Zihan Wang, Jian Qian, Qi Lei

机构 * Zhili College at Tsinghua University(清华大学紫荆学院) Courant Institute for Mathematical Sciences at New York University(纽约大学Courant数学科学研究所) School of Computing and Data Science at University of Hong Kong(香港大学计算与数据科学学院) Courant Institute for Mathematical Sciences, and Center for Data Science at New York University(纽约大学Courant数学科学研究所和数据科学中心)

AI总结 本文研究了数据重建的可识别性与优化问题,提出样本分割方法以提升重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08238 2026-02-10 cs.CL

On convexity and efficiency in semantic systems

关于语义系统中的凸性与效率

Nathaniel Imel, Noga Zaslavasky

机构 * Department of Psychology, New York University(纽约大学心理学系)

AI总结 本文通过信息瓶颈框架分析了语义系统中凸性与效率的区别,发现效率在区分颜色命名系统方面更具预测性,而凸性在某些情况下效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19184 2026-02-10 cs.CV

A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches

对类无关计数的综述:从基于参考到开放世界文本引导方法的进展

Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi

机构 * CNR-ISTI Istanbul Technical University(伊斯坦布尔技术大学) Division of Engineering, NYU Abu Dhabi(NYU阿布扎比分校工程系)

AI总结 本文综述了类无关计数方法,提出三种范式并评估了30种架构,探讨了其性能、挑战及未来方向。

Comments Preprint version of an article accepted ad Elsevier's CVIU

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03035 2026-02-10 cs.RO cs.AI cs.LG

NLP Sampling: Combining MCMC and NLP Methods for Diverse Constrained Sampling

NLP采样:结合MCMC和NLP方法进行多样化的受限采样

Marc Toussaint, Cornelius V. Braun, Joaquim Ortiz-Haro

机构 * Learning & Intelligent Systems Lab, TU Berlin(柏林技术大学学习与智能系统实验室) Machines in Motion Lab, New York University(纽约大学运动机器实验室)

AI总结 本文提出NLP采样框架,结合MCMC和NLP方法,解决多样化的受限采样问题,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07787 2026-02-10 cs.AI

Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition

多智能体是否梦想着电子屏幕?通过任务分解在AndroidWorld上实现完美准确率

Pierre-Louis Favreau, Jean-Pierre Lo, Clement Guiguet, Charles Simon-Meunier, Nicolas Dehandschoewercker, Allen G. Roush, Judah Goldfeder, Ravid Shwartz-Ziv

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

AI总结 Minitap通过任务分解和多智能体架构在AndroidWorld上实现100%准确率,超越人类表现,解决单智能体架构的多个失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07277 2026-02-10 cs.CV cs.LG

Cross-View World Models

跨视角世界模型

Rishabh Sharma, Gijs Hogervorst, Wayne E. Mackey, David J. Heeger, Stefano Martiniani

机构 * Simons Center for Computational Physical Chemistry(Simon计算物理化学中心) Center for Soft Matter Research, Department of Physics(软物质研究中心,物理系) Statespace Labs, Inc.(Statespace公司) Center for Neural Science, New York University(神经科学中心,纽约大学) Department of Psychology, New York University(心理学系,纽约大学) Courant Institute of Mathematical Sciences, New York University(Courant数学科学研究所,纽约大学)

AI总结 本文提出跨视角世界模型,通过多视角预测训练智能体在不同视角下进行规划,提升空间感知与多智能体协作能力。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07203 2026-02-10 cs.LG cs.AI

Exactly Computing do-Shapley Values

精确计算do-肖普利值

R. Teal Witter, Álvaro Parafita, Tomas Garriga, Maximilian Muschalik, Fabian Fumagalli, Axel Brando, Lucas Rosenblatt

机构 * Mathematical Sciences Department, Claremont McKenna College(克莱门特麦肯纳学院数学科学系) Barcelona Supercomputing Center, Barcelona, Spain(巴塞罗那超级计算中心) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

AI总结 本文提出了一种精确计算do-肖普利值的方法,通过不可约集的线性时间算法,显著提高了计算效率并降低了识别负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18221 2026-02-10 cs.LG cs.AI stat.ML

These Are Not All the Features You Are Looking For: A Fundamental Bottleneck in Supervised Pretraining

这些并非你所寻找的所有特征:监督预训练中的一个根本瓶颈

Xingyu Alice Yang, Jianyu Zhang, Léon Bottou

机构 * Fundamental AI Research (FAIR) at Meta(Meta 的基础人工智能研究(FAIR)) New York University(纽约大学)

AI总结 本文提出通过模型集成策略提升迁移学习性能,发现预训练模型存在特征不一致导致的迁移偏差问题,并在ResNet上验证了该方法的有效性。

Comments 10 pages, 6 figures, Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05975 2026-02-09 cs.IR cs.CL

SAGE: Benchmarking and Improving Retrieval for Deep Research Agents

SAGE:深度研究代理检索的基准测试与改进

Tiansheng Hu, Yilun Zhao, Canyu Zhang, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) Center for Data Science, New York University(纽约大学数据科学中心)

AI总结 SAGE基准测试评估了深度研究代理的检索能力,发现BM25在推理密集型检索中表现优于大语言模型检索器,并提出基于语料库的测试时扩展框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02514 2026-02-09 eess.IV cs.CV cs.IT eess.SP math.IT stat.ML

Learning a distance measure from the information-estimation geometry of data

从数据的信息-估计几何学习距离度量

Guy Ohayon, Pierre-Etienne H. Fiquet, Florentin Guth, Jona Ballé, Eero P. Simoncelli

机构 * Flatiron Institute(Flatiron研究所) New York University(纽约大学)

AI总结 本文提出信息-估计度量(IEM),通过学习去噪器和积分计算,用于图像质量评估,效果与现有方法相当或更优。

Comments ICLR 2026. Code is available at https://github.com/ohayonguy/information-estimation-metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00956 2026-02-09 cs.CV

Continual-MEGA: A Large-scale Benchmark for Generalizable Continual Anomaly Detection

Continual-MEGA: 一个大规模基准用于通用的持续异常检测

Geonu Lee, Yujeong Oh, Geonhui Jang, Soyoung Lee, Jeonghyo Song, Sungmin Cha, YoungJoon Yoo

机构 * snuailab chungang(Chung-Ang University) nyu(New York University)

AI总结 Continual-MEGA基准通过引入大规模数据集和零样本泛化场景,提升了持续异常检测的通用性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06056 2026-02-09 cs.MM cs.AI cs.CL cs.CV

Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space

分析扩散模型和自回归视觉语言模型在多模态嵌入空间中的表现

Zihang Wang, Siyue Zhang, Yilun Zhao, Jingyi Yang, Tingyu Song, Anh Tuan Luu, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学) Yale University(耶鲁大学) NYU Shanghai(纽约大学上海分校) Alibaba-NTU Singapore Joint Research Institute(阿里-国立新加坡大学联合研究机构) University of the Chinese Academy of Sciences(中国科学院大学) Center for Data Science(数据科学中心) New York University(纽约大学)

AI总结 本文研究了多模态扩散模型在多模态嵌入任务中的表现,发现其在分类、VQA和检索任务中均逊于自回归VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05692 2026-02-06 cs.CL

MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert Annotations

MedErrBench: 一种细粒度多语言基准,用于医疗错误检测与修正,带有临床专家注释

Congbo Ma, Yichun Zhang, Yousef Al-Jazzazi, Ahamed Foisal, Laasya Sharma, Yousra Sadqi, Khaled Saleh, Jihad Mallat, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎赫尔分校) New York University(纽约大学) University of Birmingham(伯明翰大学) Cleveland Clinic Abu Dhabi(克利夫兰医学中心阿布扎赫尔分校)

AI总结 MedErrBench是一个多语言医疗错误检测与修正基准,通过临床专家注释评估各类语言模型性能,揭示非英语环境中的性能差距,推动多语言临床NLP发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05374 2026-02-06 cs.CL cs.LG

Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks

跨语言实证评估大型语言模型在阿拉伯语医疗任务中的表现

Chaimae Abouzahir, Congbo Ma, Nizar Habash, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校)

AI总结 本研究通过跨语言实证分析,揭示了阿拉伯语和英语在医疗问答任务中LLM性能的差异,指出语言驱动的性能差距随任务复杂性增加而加剧,强调了语言意识在医疗任务LLM设计中的重要性。

Comments Accepted to HeaLing-EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05339 2026-02-06 cs.CV cs.LG

Consistency-Preserving Concept Erasure via Unsafe-Safe Pairing and Directional Fisher-weighted Adaptation

通过不安全-安全配对和方向性Fisher加权适应进行一致性保持的概念擦除

Yongwoo Kim, Sungmin Cha, Hyunsoo Kim, Jaewon Lee, Donghyun Kim

机构 * Korea University(韩国大学) New York University(纽约大学) Korea Institute of Science(韩国科学技术院)

AI总结 本文提出PAIR框架,通过不安全-安全配对和方向性Fisher加权适应,实现对有害概念的精细化擦除,保持生成内容的结构和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05176 2026-02-06 cs.CL

Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems

Among Us: 在模型协作系统中衡量并减轻恶意贡献

Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) New York University(纽约大学)

AI总结 研究针对模型协作系统中的恶意贡献问题,通过实验评估恶意模型的影响,并提出外部监督策略以缓解其影响。

Comments 19 pages, 15 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04863 2026-02-05 cs.LG cs.AI cs.CL stat.ML

Subliminal Effects in Your Data: A General Mechanism via Log-Linearity

数据中的潜意识效应:通过对数线性性的一般机制

Ishaq Aden-Ali, Noah Golowich, Allen Liu, Abhishek Shetty, Ankur Moitra, Nika Haghtalab

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) Courant Institute, New York University(纽约大学Courant研究所) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出Logit-Linear-Selection方法,揭示数据集中的隐藏效应机制,通过选择特定子集使模型表现出多样化行为。

Comments Code available at https://github.com/ishaqadenali/logit-linear-selection

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04489 2026-02-05 cs.CL

Deconstructing sentence disambiguation by joint latent modeling of reading paradigms: LLM surprisal is not enough

通过联合潜在建模阅读范式解构句子消歧:LLM 惊喜值不足以解释

Dario Paape, Tal Linzen, Shravan Vasishth

机构 * Department of Linguistics, University of Potsdam(语言学系,波茨坦大学) Center for Data Science/Department of Linguistics, New York University(数据科学中心/语言学系,纽约大学)

AI总结 本文通过联合潜在建模阅读范式,提出了一种更准确的句子消歧模型,证明LLM的惊喜值不足以解释人类阅读行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02389 2026-02-05 cs.SE cs.CR cs.LG

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04021 2026-02-05 cs.LG q-bio.QM stat.ML

Group Contrastive Learning for Weakly Paired Multimodal Data

用于弱配对多模态数据的组对比学习

Aditya Gorla, Hugues Van Assel, Jan-Christian Huetter, Heming Yao, Kyunghyun Cho, Aviv Regev, Russell Littman

机构 * Research and Early Development (gRED), Genentech(Genentech 研究与早期发展部门) UCLA(加州大学洛杉矶分校) Biology Research | AI Development (BRAID), Genentech(Genentech 生物研究 | 人工智能开发部门) Genentech Computational Sciences NYU(Genentech 计算科学与纽约大学)

AI总结 GROOVE通过组级对比学习方法,有效处理弱配对多模态数据,提升跨模态匹配与填补任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03979 2026-02-05 cs.CL

Likelihood-Based Reward Designs for General LLM Reasoning

基于似然的奖励设计用于通用大语言模型推理

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

机构 * Meta FAIR University of Amsterdam(阿姆斯特丹大学) New York University(纽约大学)

AI总结 本文提出基于对数概率的奖励设计,用于提升大语言模型在推理任务中的表现,尤其在可验证和不可验证场景中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏