arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-05-20 至 2026-05-20 共收录 13
2605.20075 2026-05-20 cs.CL cs.AI

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

机构 * Georgia Tech(佐治亚理工学院) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Microsoft(微软公司)

AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。

Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19932 2026-05-20 cs.AI cs.CL cs.LG

PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

PEEK:上下文地图作为长上下文LLM代理的导向缓存

Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学)

AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19407 2026-05-20 cs.LG cs.AI

A Bitter Lesson for Data Filtering

数据过滤的惨痛教训

Christopher Mohri, John Duchi, Tatsunori Hashimoto

机构 * Department of Computer Science(计算机科学系) Departments of Statistics and Electrical Engineering(统计学与电气工程系) Stanford University(斯坦福大学)

AI总结 本文研究了大规模模型预训练中的数据过滤,发现即使有足够的计算资源,过滤数据也不是最佳选择,因为充分训练的大型模型能够容忍低质量数据甚至从中受益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19359 2026-05-20 cs.CV cs.LG

MAM-CLIP: Vision-Language Pretraining on Mammography Atlases for BI-RADS Classification

MAM-CLIP:基于乳腺X线图集的视觉-语言预训练用于BI-RADS分类

Halil Ibrahim Gulluk, Olivier Gevaert

机构 * Department of Electrical Engineering(电气工程系) Biomedical Informatics Research (BMIR)(生物医学信息学研究(BMIR)) Stanford University(斯坦福大学)

AI总结 本文提出MAM-CLIP模型,通过预训练PubMedBERT和对比学习来提升乳腺X线图像的BI-RADS分类性能,实验表明在标注样本稀缺时,该方法能显著提高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19341 2026-05-20 cs.CL cs.AI cs.LG stat.ML

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

HalluWorld: 一个用于通过参考世界模型控制幻觉的基准

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) Patronus AI Independent Researcher(独立研究者) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) DegenAI Labs(DegenAI实验室)

AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。

Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19113 2026-05-20 stat.ME cs.LG stat.ML

Learning Interpretable Point-Based Clinical Risk Scores via Direct Optimization

通过直接优化学习可解释的基于点的临床风险评分

Ying Cui, Albert M Li, Vivek Charu, Yeon-Mi Hwang, Tina Hernandez-Boussard, Lu Tian

机构 * Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Decatur High School(德凯高中) Department of Pathology, Stanford University School of Medicine(斯坦福大学医学院病理学系) Division of Computational Medicine, Department of Medicine, Stanford University(斯坦福大学医学系计算医学分会)

AI总结 本文提出了一种新的机器学习算法,通过灵活的贪心优化策略直接学习可解释的基于点的临床风险评分,以在明确的最优性目标下优化加法评分。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19099 2026-05-20 cs.AI cs.CL cs.MA

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

DecisionBench: 一个用于长周期代理工作流中涌现委托的基准测试

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

机构 * OpenMesh AI University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) MIT(麻省理工学院)

AI总结 本文提出DecisionBench基准测试,用于评估长周期代理工作流中涌现的委托机制,通过五个条件参考扫描发现委托质量、路由保真度和潜在性能上限等核心发现。

Comments 28 pages, 9 figures, 11 tables. Code and data: https://huggingface.co/decisionbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18597 2026-05-20 cs.AI

Latent Action Reparameterization for Efficient Agent Inference

潜在动作重参数化用于高效智能体推断

Wenhao Huang, Qingwen Zeng, Qiyue Chen, Zijie Guo, Yu Sun, Cheng Yang, Siru Ouyang, Jiri Gesi, Fang Wu, Jiayi Zhang, Huaming Chen, Bang Liu, Xiangru Tang, Chenglin Wu

机构 * Université de Montréal(蒙特利尔大学) The University of Sydney(悉尼大学) Fudan University(复旦大学) Yale University(耶鲁大学) DeepWisdom University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Science(亚马逊科学) Stanford University(斯坦福大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Mila - Quebec AI Institute(蒙特利尔人工智能研究所)

AI总结 本文提出Latent Action Reparameterization (LAR)框架,通过学习紧凑的潜在动作空间来提升大语言模型智能体的推断效率,减少有效动作 horizon 并保持原始动作空间的表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16679 2026-05-20 cs.CL cs.AI

CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?

CHI-Bench: 能否让AI代理自动化端到端、长周期、政策丰富的医疗工作流程?

Haolin Chen, Deon Metelski, Leon Qi, Tao Xia, Joonyul Lee, Steve Brown, Kevin Riley, Frank Wang, T. Y. Alvin Liu, Hank Capps MD, Zeyu Tang, Xiangchen Song, Lingjing Kong, Fan Feng, Tianyi Zeng, Zhiwei Liu, Zixian Ma, Hang Jiang, Fangli Geng, Yuan Yuan, Chenyu You, Qingsong Wen, Hua Wei, Yanjie Fu, Yue Zhao, Carl Yang, Biwei Huang, Kun Zhang, Caiming Xiong, Sanmi Koyejo, Eric P. Xing, Philip S. Yu, Weiran Yao

机构 * Johns Hopkins Medicine(约翰霍普金斯医学中心) Wellstar Health System(Wellstar健康系统) Stanford University(斯坦福大学) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Yale School of Medicine(耶鲁医学院) Salesforce AI Research(Salesforce人工智能研究) University of Washington(华盛顿大学) Northeastern University(东北大学) Brown University(布朗大学) Boston College(波士顿学院) Stony Brook University(史泰森布里克大学) University of Oxford(牛津大学) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Emory University(埃默里大学) MBZUAI Recursive Superintelligence(递归超级智能) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文提出CHI-Bench基准,旨在评估AI代理在医疗工作流程中端到端、长周期和政策丰富任务中的自动化能力,揭示当前基准测试中政策密度、多角色协作和多方交互等能力的不足。

Comments Website: https://actava.ai/benchmarks Code: https://github.com/actava-ai/chi-bench Dataset: https://huggingface.co/datasets/actava/chi-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24470 2026-05-20 cs.RO cs.AI

Foundation models on the bridge: Semantic hazard detection and safety maneuvers for maritime autonomy with vision-language models

桥梁上的基础模型:基于视觉-语言模型的语义危险检测与安全操作用于海上自主性

Kim Alexander Christensen, Andreas Gudahl Tufte, Alexey Gusev, Rohan Sinha, Milan Ganai, Ole Andreas Alsos, Marco Pavone, Martin Steinert

机构 * Dept. of Mechanical and Industrial Engineering, NTNU(机械与工业工程系,挪威科技大学) Dept. of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学) Dept. of Computer Science, Stanford University(计算机科学系,斯坦福大学) NVIDIA Research(NVIDIA研究)

AI总结 本文提出了一种基于视觉-语言模型的语义危险检测与安全操作方法,用于满足IMO草案MASS代码对海上自主船舶的要求,通过快速-慢速异常管道和短时间范围的人类可覆盖回退操作来实现,在40个港口场景中验证了该方法的性能。

Comments 17 pages without bibliography or appendix. The main paper has 16 figures. Paper webpage can be found at https://kimachristensen.github.io/bridge_policy/

Journal ref Ocean Engineering 359, Part 3 (2026), Article 124646

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07183 2026-05-20 cs.CL cs.AI cs.LG cs.SI

Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews

大规模监控AI修改内容:ChatGPT对AI会议同行评审影响的案例研究

Weixin Liang, Zachary Izzo, Yaohui Zhang, Haley Lepp, Hancheng Cao, Xuandong Zhao, Lingjiao Chen, Haotian Ye, Sheng Liu, Zhi Huang, Daniel A. McFarland, James Y. Zou

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Machine Learning Department, NEC Labs America(NEC美国实验室机器学习部门) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Department of Sociology, Stanford University(斯坦福大学社会学系) Graduate School of Business, Stanford University(斯坦福大学商学院) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Computer Science, UC Santa Barbara(加州大学圣芭芭拉分校计算机科学系)

AI总结 本文提出了一种方法,用于估计大规模语料库中可能被大语言模型(LLM)显著修改或生成的文本比例。通过专家撰写和AI生成的参考文本,该最大似然模型能够高效地在语料库层面考察实际的LLM使用情况。研究以ChatGPT发布后举行的AI会议同行评审(ICLR 2024、NeurIPS 2023、CoRL 2023和EMNLP 2023)为案例,发现6.5%至16.9%的提交文本可能被LLM显著修改。生成文本的情境揭示了用户行为:在信心较低、接近截止日期或回复作者反驳较少的评审中,估计的LLM生成文本比例更高。此外,观察到语料库层面的趋势可能过于微妙,无法在个体层面检测到,并讨论了这些趋势对同行评审的影响。呼吁未来跨学科研究探讨LLM使用如何改变我们的信息和知识实践。

Comments 46 pages, 31 figures, ICML '24

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18956 2026-05-20 cs.CV

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE: 一种用于人体动作编辑、推理、生成和解释的多粒度框架

Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

机构 * Computer Vision Institute, School of Computer Science and Software Engineering, Shenzhen University(计算机视觉研究院,计算机科学与软件工程学院,深圳大学) Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(Nottingham Ningbo 中国计算机科学学院) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Radiation Oncology, Stanford University(放射肿瘤科,斯坦福大学) Sun Yat-sen University(中山大学) School of Computer Science, University of Nottingham(计算机科学学院,Nottingham大学)

AI总结 本文提出MotionMERGE框架,通过细粒度语言引导的动作控制、跨粒度协同预训练和细粒度动作-语言对齐,实现了更精确的动作生成、理解和编辑,并建立了新的细粒度文本驱动动作编辑和动作引导推理基准。

详情

展开后加载摘要…

URL PDF HTML 收藏