arXivDaily arXiv每日学术速递 周一至周五更新

作者

Yejin Choi

Natural Language Processing

共收录 365
2601.21257 2026-04-21 cs.CL

MoCo: A One-Stop Shop for Model Collaboration Research

MoCo:模型协作研究的一站式解决方案

Shangbin Feng, Yuyang Bai, Ziyuan Yang, Yike Wang, Zhaoxuan Tan, Jiajie Yan, Zhenyu Lei, Wenxuan Ding, Weijia Shi, Haojin Wang, Zhenting Qi, Yuru Jiang, Heng Wang, Chengsong Huang, Yu Fei, Jihan Yao, Yilun Du, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) University of Notre Dame(诺特大学) University of Virginia(弗吉尼亚大学) New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。

Comments Moco is available at https://github.com/BunsenFeng/model_collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12374 2026-04-15 cs.LG cs.AI cs.CL

Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Super:开放、高效的混合专家混合Mamba-Transformer模型用于代理推理

NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Khattar, Adeola Adesoba, Adi Renduchintala, Adil Asif, Aditya Agrawal, Aditya Vavre, Ahmad Kiswani, Aishwarya Padmakumar, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Gronskiy, Alex Kondratenko, Alex Neefus, Alex Steiner, Alex Yang, Alexander Bukharin, Alexander Young, Ali Hatamizadeh, Ali Taghibakhshi, Alina Galiautdinova, Alisa Liu, Alok Kumar, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrew Tao, Anjaney Shrivastava, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Ann Guan, Anna Shors, Annamalai Chockalingam, Anubhav Mandarwal, Aparnaa Ramani, Arham Mehta, Arti Jain, Arun Venkatesan, Asha Anoosheh, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asli Sabanci Demiroz, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Benjamin Chislett, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bobby Chen, Boris Ginsburg, Brandon Norick, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Buvaneswari Mani, Carlo del Mundo, Chankyu Lee, Chanran Kim, Chantal Hwang, Chao Ni, Charles Wang, Charlie Truong, Cheng-Ping Hsieh, Chenhan Yu, Chenjie Luo, Cherie Wang, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Chris Holguin, Chris Wing, Christian Munley, Christopher Parisien, Chuck Desai, Chunyang Sheng, Collin Neale, Cyril Meurillon, Dakshi Kumar, Dan Gil, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Burkhardt Eliuth Triana, Daniel Egert, Daniel Fatade, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Edelsohn, David Messina, David Mosallanezhad, David Tamok, Deena Donia, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di Wu, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dmitry Konyagin Brandon Tuttle, Dong Ahn, Dongfu Jiang, Dorrin Poorkay, Douglas O'Flaherty, Duncan Riach, Dusan Stosic, Dustin Van Stee, Edgar Minasyan, Edward Lin, Eileen Peters Long, Elad Segal, Elena Lantz, Elena Lewis, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric W. Tramel, Erick Galinkin, Erik Pounds, Esti Etrog, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Farshad Saberi Movahed, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Fortuna Zhang, Frankie Siino, Frida Hou, Gantavya Bhatt, Gargi Prasad, Geethapriya Venkataramani, Geetika Gupta, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Grace Wu, Greg Pauloski, Greyson Davis, Grigor Nalbandyan, Guoming Zhang, Guy Farber, Guyue Huang, Haifeng Qian, Haran Kumar Shiv Kumar, Harry Kim, Harsh Sharma, Hayate Iso, Hayley Ross, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huy Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igino Padovani, Igor Gitman, Igor Shovkun, Ikroop Dhillon, Ilya Loshchilov, Ingrid Kelly, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jain Tu, Jan Baczek, Jan Kautz, Jane Polak Scowcroft, Janica Rosenberg, Jared Casper, Jarrod Pflum, Jason Grant, Jason Sewall, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiaqi Zeng, Jie Lou, Jill Milton, Jim Chow, Jimmy Zhang, Jinhang Choi, Jining Huang, Jocelyn Huang, Joel Caruso, Joey Conway, Joey Guman, Johan Jatko, John Kamalu, Johnny Greco, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joyjit Daw, Juan Yu, Julio Tapia, Junkeun Yi, Jupinder Parmar, Jyothi Achar, Kari Briski, Kartik Mattoo, Katherine Cheung, Katherine Luna, Keith Wyss, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirill Buryak, Kirthi Shankar Sivamani, Konstantinos Krommydas, Kris Murphy, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Laikh Tewari, Laya Sleiman, Leo Du, Leon Derczynski, Li Ding, Lilach Ilan, Lingjie Wu, Lizzie Wei, Luis Vega, Lun Su, Maarten Van Segbroeck, Maer Rodrigues de Melo, Magaret Zhang, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Sreedhar, Makesh Tarun Chandran, Manuel Reyes Gomez, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Margaret Zhang, Mark Cai, Mark Gabel, Markus Kliegl, Martyna Patelka, Maryam Moosaei, Matthew Varacalli, Matvei Novikov, Mauricio Ferrato, Mehrzad Samadi, Melissa Corpuz, Meng Xin, Mengdi Wang, Mengru Wang, Meredith Price, Micah Schaffer, Michael Andersch, Michael Boone, Michael Evans, Michael Z Wang, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Hollinger, Mingyuan Ma, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Nader Khalil, Najeeb Nabwani, Nancy Agarwal, Nanthini Balasubramaniam, Narimane Hennouni, Narsi Kodukula, Natalie Hereth, Nathaniel Pinckney, Nave Assaf, Negar Habibi, Nestor Qin, Neta Zmora, Netanel Haber, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nirmalya De, Nowel Pitt, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Almog, Omri Puny, Oren Tropp, Otavio Padovani, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Peter Belcak, Peter Jin, Pinky Xu, Piotr Januszewski, Pooya Jannaty, Prachi Shevate, Pradeep Thalasta, Pranav Prashant Thombre, Prasoon Varshney, Prerana Gambhir, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Quan Tran Minh, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Rahul Kandu, Raina Zhong, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Renee Yao, Renjie Pi, Richard Mazzarese, Richard Wang, Rick Izzo, Ridhima Singla, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Roger Waleffe, Rohit Varma Kalidindi, Rohit Watve, Roi Koren, Ron Fan, Ruchika Kharwar, Ruisi Cai, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Ryota Egashira, Sadegh Mahdavi, Sagar Singh Ashutosh Joshi, Sahil Modi, Samuel Kriman, Sandeep Pombra, Sanjay Kariyappa, Sanjeev Satheesh, Santiago Pombo, Saori Kaji, Satish Pasumarthi, Saurav Mishra, Saurav Muralidharan, Scott Hara, Sean Narenthiran, Sebastian Rogawski, Seonjin Na, Seonmyeong Bak, Sepehr Sameni, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh Adam Lord, Sharath Turuvekere Sreenivas, Shaun Kotek, Shaya Gharghabi, Shelby Thomas, Sheng-Chieh Lin, Shibani Likhite, Shiqing Fan, Shiyang Chen, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuo Zhang, Shuoyang Ding, Shyam Renjith, Shyamala Prayaga, Siddhartha Jain, Simeng Sun, Sirisha Rella, Sirshak Das, Smita Ithape, Sneha Harishchandra S, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sriharsha Niverty, Stas Sergienko, Stefana Gloginic, Stefania Alborghetti, Stephen Ge, Stephen McCullough, Sugam Dipak Devare, Suguna Varshini Velury, Sukrit Rao, Sumeet Kumar Barua, Sunny Gai, Suseella Panguluri, Sushil Koundinyan, Swathi Patnam, Sweta Priyadarshi, Swetha Bhendigeri, Syeda Nahida Akter, Sylendran Arunagiri, Tailling Yuan, Talor Abramovich, Tan Bui, Tan Yu, Terry Kong, Thanh Do, Thomas Gburek, Thorgane Marques, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Timothy Ma, Tiyasa Mitra, Tomasz Grzegorzek, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Traian Rebedea, Trenton Starkey, Tugrul Konuk, Twinkle Vashishth, Tyler Condensa, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Vanshil Atul Shah, Veena Vaidyanathan, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vikas Mehta, Virginia Adams, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wan Seo, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wei-Ming Chen, Wendy Quan, Wenliang Dai, Wenwen Gao, Will Jennings, William Zhang, Xiaowei Ren, Xiaowen Xin, Xin Li, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Suhara, Youngeun Kwon, Yuan Zhang, Yuki Huang, Zach Moshe, Zhilin Wang, Zhiyu Cheng, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijia Chen, Zijie Yan, Zuhair Ahmed

机构 * NVIDIA

AI总结 Nemotron 3 Super是首个采用NVFP4预训练、LatentMoE架构和MTP层加速推理的混合Mamba-Transformer模型,实现更高的推理吞吐量和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08644 2026-04-13 cs.CL

EXAONE 4.5 Technical Report

EXAONE 4.5 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Changhun Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Kwangrok Ryoo, Minju Seo, Sejong Yang, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Kyubeen Han, Joonwon Jang, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Jiyeon Jung, Daeseong Kim, Dohoon Kim, Dohyun Kim, Hyunseo Kim, Minu Kim, Myoungshin Kim, Youchul Kim, Byungoh Ko, Christopher Lee, Edward Hwayoung Lee, Honglak Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Woohyung Lim, Jueun Mun, Jaewoo Park, Jimin Park, Jinho Park, Yongmin Park, Wooseok Seo, Yongwoo Song, Sihyuk Yi, Kyungjae Yoo, Sangyeon Yoon

机构 * LG AI Research(LG AI 研究院)

AI总结 EXAONE 4.5通过集成专用视觉编码器扩展EXAONE 4.0框架,实现多模态预训练,提升文档理解和语言能力,支持256K tokens上下文长度,优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06268 2026-04-09 cs.LG

RAGEN-2: Reasoning Collapse in Agentic RL

RAGEN-2:代理强化学习中的推理崩溃

Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi Chen, Linjie Li, Zhengyuan Yang, Pingyue Zhang, Yiping Lu, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者) Imperial College London(伦敦帝国学院) Oxford University(牛津大学) University of Washington(华盛顿大学) Microsoft(微软) Stanford University(斯坦福大学)

AI总结 研究发现代理强化学习中推理稳定性受模板崩溃影响,通过引入互信息代理提升推理质量与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25454 2026-04-08 cs.AI cs.CL

DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search

DeepSearch: 通过蒙特卡洛树搜索克服强化学习中的瓶颈问题

Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi

机构 * Stanford University(斯坦福大学) University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所革新智能研究中心) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Amazon AWS(亚马逊云科技)

AI总结 DeepSearch通过将蒙特卡洛树搜索整合到强化学习中,解决探索不足的问题,提升数学推理能力,实验显示其在推理任务中达到62.95%的准确率,且效率显著高于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23562 2026-03-31 cs.LG cs.AI

Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG

合成混合训练:在RAG之上扩展参数化知识获取

Seungju Han, Konwoo Kim, Chanwoo Park, Benjamin Newman, Suhas Kotha, Jaehun Jung, James Zou, Yejin Choi

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

AI总结 本文提出合成混合训练方法,结合合成问答和文档,通过互补训练信号提升模型性能,在QuaLITY基准上实现4.4%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-03-23 cs.CL cs.AI

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18534 2026-03-20 cs.LG

Data-efficient pre-training by scaling synthetic megadocs

通过扩展合成巨文档实现数据高效的预训练

Konwoo Kim, Suhas Kotha, Yejin Choi, Tatsunori Hashimoto, Nick Haber, Percy Liang

机构 * Stanford University(斯坦福大学)

AI总结 本文研究如何通过生成更长的合成巨文档提升预训练效果,发现其在降低损失和提升基准准确率方面优于简单重述,数据效率从1.48倍提升至1.80倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06415 2026-03-20 cs.HC cs.AI

Biased AI can Influence Political Decision-Making

有偏见的AI会影响政治决策

Jillian Fisher, Shangbin Feng, Robert Aron, Thomas Richardson, Yejin Choi, Daniel W. Fisher, Jennifer Pan, Yulia Tsvetkov, Katharina Reinecke

机构 * Department of Statistics, University of Washington(华盛顿大学统计学系) Department of Computer Science, University of Washington(华盛顿大学计算机科学系) Dallas, Texas(德克萨斯州达拉斯) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Psychiatry and Behavioral Science, University of Washington(华盛顿大学精神病学与行为科学系) Department of Communication, Stanford University(斯坦福大学传播学系)

AI总结 本文通过两个互动实验研究了LLM偏见对政治观点和决策的影响,发现参与者更容易接受与模型偏见一致的观点,即使个人政治倾向相反,且AI知识水平与偏见影响减弱相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13941 2026-03-17 cs.LG cs.AI

Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning

Nemotron-CrossThink: 在数学推理之外实现自学习的扩展

Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov, Seungju Han, Ying Lin, Evelina Bakhturina, Eric Nyberg, Yejin Choi, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

AI总结 本文提出NEMOTRON-CROSSTHINK框架,通过整合多领域数据提升推理泛化能力,改进数学和非数学任务的准确性与效率。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21035 2026-03-17 cs.CR cs.CL cs.LG

A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage

隐私的虚假感:超越表面隐私泄露的文本数据净化评估

Rui Xin, Niloofar Mireshghallah, Shuyue Stella Li, Michael Duan, Hyunwoo Kim, Yejin Choi, Yulia Tsvetkov, Sewoong Oh, Pang Wei Koh

AI总结 研究指出现有文本数据净化方法仅评估显性标识符泄露,忽视文本中细微标记可能引发的重新识别风险,提出新框架量化个体隐私风险,发现辅助信息可推断敏感属性,揭示当前净化技术存在隐私虚假感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16301 2026-03-10 cs.AI cs.CL

Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills

代理AI的适应:训练后、记忆和技能的综述

Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yang, Kun Qian, Tian Wang, Changran Hu, Manling Li, Quanzheng Li, Hao Peng, Sheng Wang, Jingbo Shang, Chao Zhang, Jiaxuan You, Liyuan Liu, Pan Lu, Yu Zhang, Heng Ji, Yejin Choi, Dawn Song, Jimeng Sun, Jiawei Han

机构 * UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学) Princeton(普林斯顿大学) Harvard(哈佛大学) UC Berkeley(加州大学伯克利分校) Caltech(加州理工学院) UCSD(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) Northwestern(西北大学) TAMU(德克萨斯大学奥斯汀分校) MGH(麻省总医院) Keiji AI Unity

AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06084 2026-03-04 cs.CL cs.AI

Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability

频谱调节:面向分布覆盖和上下文可引导性的后训练

Taylor Sorensen, Benjamin Newman, Jared Moore, Chan Park, Jillian Fisher, Niloofar Mireshghallah, Liwei Jiang, Yejin Choi

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14632 2026-03-04 cs.CL

Diverging Preferences: When do Annotators Disagree and do Models Know?

分歧偏好:标注者何时分歧以及模型是否知道?

Michael JQ Zhang, Zhilin Wang, Jena D. Hwang, Yi Dong, Olivier Delalleau, Yejin Choi, Eunsol Choi, Xiang Ren, Valentina Pyatkin

机构 * New York University(纽约大学) Allen Institute for Artificial Intelligence(人工智能研究院) NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) University of Southern California(南加州大学)

AI总结 本文研究了标注者分歧的来源,发现任务不明确等因素导致大多数分歧,并提出方法以减轻其在LLM评估和训练中的影响。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01265 2026-03-03 cs.LG cs.AI cs.CL

RLP: Reinforcement as a Pretraining Objective

RLP:将强化学习作为预训练目标

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye, Jan Kautz, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Stanford University(斯坦福大学)

AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。

Comments ICLR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13648 2026-03-03 cs.CL cs.AI

SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs

SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距

Yuling Gu, Oyvind Tafjord, Hyunwoo Kim, Jared Moore, Ronan Le Bras, Peter Clark, Yejin Choi

机构 * Allen Institute for AI(艾伦人工智能研究所) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27492 2026-03-03 cs.CV

ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

ThinkMorph:多模态交错链式推理中的涌现特性

Jiawei Gu, Yunzhuo Hao, Huichen Will Wang, Linjie Li, Michael Qizhe Shieh, Yejin Choi, Ranjay Krishna, Yu Cheng

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) absolute AI The Chinese University of Hong Kong(香港中文大学)

AI总结 ThinkMorph通过统一模型提升多模态推理性能,展现视觉操控与模式切换等新兴能力。

Comments project page: https://thinkmorph.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06966 2026-02-26 cs.LG cs.AI cs.CY

Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research

机器去学习并不如你所想:生成式AI政策与研究的启示

A. Feder Cooper, Christopher A. Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alexandra Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Elyse Mitchell, Niloofar Mireshghallah, Abigail Z. Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, Ilia Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, danah boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel E. Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy B. Cyphert, Mark A. Lemley, Nicolas Papernot, Katherine Lee

机构 * The GenLaw Center(GenLaw中心) Microsoft Research(微软研究院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Center for Democracy & Technology(民主与科技中心) Princeton(普林斯顿) Google(谷歌) University of Washington(华盛顿大学) University of Michigan(密歇根大学) Cornell Tech(康奈尔科技) Cornell Law School(康奈尔法学院) Cornell University(康奈尔大学) Lighthouse Stanford Law School(斯坦福法学院) UC Berkeley(伯克利大学) Independent(独立研究者) Northeastern University(东北大学) Harvard Business School(哈佛商学院) W. Virginia University College of Law(维珍尼亚大学法学院)

AI总结 本文指出机器去学习并非通用解决方案,揭示其在生成式AI政策与研究中的局限性。

Comments NeurIPS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17560 2026-02-24 cs.AI

ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment

ODESteer: 一种基于常微分方程的统一激活引导框架用于大语言模型对齐

Hongjue Zhao, Haosen Sun, Jiangtao Kong, Xiaochang Li, Qineng Wang, Liwei Jiang, Qi Zhu, Tarek Abdelzaher, Yejin Choi, Manling Li, Huajie Shao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) William & Mary(威廉与玛丽学院) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 ODESteer通过基于常微分方程的理论框架,统一了激活引导方法,实现了在大语言模型对齐中的显著性能提升。

Comments Accepted by ICLR 2026 (Camera Ready Version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16313 2026-02-19 cs.CL

MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks

MemoryArena:评估多会话代理任务中的代理记忆

Zexue He, Yu Wang, Churan Zhi, Yuanzhe Hu, Tzu-Ping Chen, Lang Yin, Ze Chen, Tong Arthur Wu, Siru Ouyang, Zihan Wang, Jiaxin Pei, Julian McAuley, Yejin Choi, Alex Pentland

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of Pittsburgh(匹兹堡大学)

AI总结 MemoryArena是一个用于评估多会话代理任务中代理记忆的统一评估环境,揭示了现有长上下文记忆基准在代理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09000 2026-02-10 cs.AI

iGRPO: Self-Feedback-Driven LLM Reasoning

iGRPO:基于自我反馈的LLM推理

Ali Hatamizadeh, Shrimai Prabhumoye, Igor Gitman, Ximing Lu, Seungju Han, Wei Ping, Yejin Choi, Jan Kautz

机构 * NVIDIA(英伟达)

AI总结 iGRPO通过动态自我条件和两阶段优化,提升LLM在数学推理任务中的表现,实现更准确和一致的解决方案。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07055 2026-02-10 cs.AI cs.CL cs.LG

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

空间理论:基础模型能否通过主动探索构建空间信念?

Pingyue Zhang, Zihan Huang, Yue Wang, Jieyu Zhang, Letian Xue, Zihan Wang, Qineng Wang, Keshigeyan Chandrasegaran, Ruohan Zhang, Yejin Choi, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学)

AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。

Comments published at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16175 2026-02-06 cs.LG cs.AI

Learning to Discover at Test Time

在测试时间学习以发现

Mert Yuksekgonul, Daniel Koceja, Xinhao Li, Federico Bianchi, Jed McCaleb, Xiaolong Wang, Jan Kautz, Yejin Choi, James Zou, Carlos Guestrin, Yu Sun

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达) Astera Institute(Astera研究院) UC San Diego(加州大学圣地亚哥分校) Together AI

AI总结 通过在测试时间进行强化学习,TTT-Discover方法在多个科学领域实现了新的前沿状态,利用开放模型和公开代码实现高效解决方案。

Comments Code: https://github.com/test-time-training/discover

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13342 2026-02-06 cs.AI cs.CL cs.LG

Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers

验证验证者:揭示事实验证器中的陷阱与潜力

Wooseok Seo, Seungju Han, Jaehun Jung, Benjamin Newman, Seungwon Lim, Seungbeen Lee, Ximing Lu, Yejin Choi, Youngjae Yu

机构 * Yonsei University(延世大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Seoul National University(首尔国立大学)

AI总结 本研究评估了多种大语言模型和事实验证器,揭示了数据标注问题、前沿模型性能及小型验证器的改进潜力。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14843 2026-02-05 cs.LG cs.AI cs.CL

The Invisible Leash: Why RLVR May or May Not Escape Its Origin

无形的绳索:为何RLVR可能或可能不逃脱其起源

Fang Wu, Weihao Xuan, Ximing Lu, Mingjie Liu, Yi Dong, Zaid Harchaoui, Yejin Choi

机构 * stanford(斯坦福大学) tokyo(东京大学) nvidia

AI总结 RLVR可能限制模型发现原创解决方案,其在提升精度的同时可能缩小探索范围,需未来创新以扩展代表性不足的解决方案区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03183 2026-02-04 cs.CL cs.AI

Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch

Privasis:从零开始合成最大的“公共”私有数据集

Hyunwoo Kim, Niloofar Mireshghallah, Michael Duan, Rui Xin, Shuyue Stella Li, Jaehun Jung, David Acuna, Qi Pang, Hanshen Xiao, G. Edward Suh, Sewoong Oh, Yulia Tsvetkov, Pang Wei Koh, Yejin Choi

机构 * NVIDIA CMU(卡内基梅隆大学) USC(南加州大学)

AI总结 Privasis是首个从零开始构建的百万级合成数据集,用于提升隐私敏感领域研究的规模和效率,其模型在隐私净化任务中表现优异。

Comments For code and data, see https://privasis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23223 2026-02-04 cs.CL

Are you going to finish that? A Practical Study of the Partial Token Problem

你打算完成那个吗?对部分标记问题的实用研究

Hao Xu, Alisa Liu, Jonathan Hayase, Yejin Choi, Noah A. Smith

机构 * Paul G. Allen School of Computer Science(保罗·G·艾伦计算机科学与工程学院) Engineering, University of Washington(华盛顿大学工程学院) Nvidia(Nvidia公司) Allen Institute for AI(艾伦人工智能研究所)

AI总结 本文研究了部分标记问题对语言模型预测的影响,发现词边界与令牌边界不一致导致严重预测偏差,并提出缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22975 2026-02-04 cs.AI

Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text

金 Goose:从不可验证的互联网文本中合成无限 RLVR 任务的简单技巧

Ximing Lu, David Acuna, Jaehun Jung, Jian Hu, Di Zhang, Shizhe Diao, Yunheng Zou, Shaokun Zhang, Brandon Cui, Mingjie Liu, Hyunwoo Kim, Prithviraj Ammanabrolu, Jan Kautz, Yi Dong, Yejin Choi

机构 * NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) University of California San Diego(圣地亚哥大学)

AI总结 Golden Goose 通过从不可验证的互联网文本中合成无限 RLVR 任务,提升大型语言模型在复杂推理和网络安全领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏