arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 41 篇

2510.22961 2026-03-03 eess.AS 93%

Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models

为统一多模态语音识别适应语音基础模型与大语言模型

Jing-Xuan Zhang, Genshun Wan, Jin Li, Jianqing Gao, Duo Zhao, Zhen-Hua Ling

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);LLM(abstract)

AI总结 本文提出UASR-LLM框架,通过大语言模型与语音基础模型结合,实现多模态语音识别的统一优化与性能提升。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02041 2026-03-03 cs.CL cs.AI 92%

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力

Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) School of Humanities, Tallinn University(塔林大学人文学院)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(title,abstract);LLM(abstract);large language model(abstract)

AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01348 2026-03-03 cs.LG cs.AI 88%

UTICA: Multi-Objective Self-Distllation Foundation Model Pretraining for Time Series Classification

UTICA:面向时间序列分类的多目标自蒸馏基础模型预训练

Yessin Moakher, Youssef Attia El Hili, Vasilii Feofanov

机构 * Ecole Polytechnique(巴黎高等师范学院) Huawei Noah’s Ark Lab(华为诺亚实验室) com(42.com)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 UTICA通过自蒸馏方法在时间序列分类中实现最先进的性能,结合增强裁剪和块掩码技术,提升模型对时间和局部结构的表征能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23383 2026-03-03 cs.CL cs.AI cs.LG 88%

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

一次训练,全部回答:为一次训练成本进行多项预训练实验

Sebastian Bordt, Martin Pawelczyk

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) University of Vienna(维也纳大学) Faculty of Computer Science(计算机科学学院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20666 2026-03-03 cs.CL cs.AI 86%

Cognitive models can reveal interpretable value trade-offs in language models

认知模型可以揭示语言模型中的可解释价值权衡

Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman

机构 * Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Google DeepMind(谷歌DeepMind) Department of Psychology, Harvard University(哈佛大学心理学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用认知模型评估语言模型中的价值权衡,揭示其行为特征变化及对社会行为的影响。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17206 2026-03-03 cs.LG cs.AI cs.CL 85%

Soft-Masked Diffusion Language Models

软掩码扩散语言模型

Michael Hersche, Samuel Moor-Smith, Thomas Hofmann, Abbas Rahimi

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出软掩码方法,通过动态融合掩码token与预测token的嵌入,提升扩散语言模型的生成性能和准确性。

Comments Accepted at the Fourteenth International Conference on Learning Representations (ICLR2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01220 2026-03-03 cs.CL 84%

Generative AI & Fictionality: How Novels Power Large Language Models

生成AI与虚构性:小说如何赋能大语言模型

Edwin Roland, Richard Jean So

机构 * School of Information Science University of Illinois Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校) Department of English Duke University(英语系杜克大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 研究探讨小说如何影响生成AI,发现LLMs利用小说属性并产生新社交回应,强调计算训练数据的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02026 2026-03-03 cs.CV cs.CL cs.LG 84%

Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT

学习如何注视:面向3D CT的疾病感知视觉-语言预训练

Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种面向3D CT的疾病感知视觉-语言预训练模型,通过对比预训练和基于提示的疾病监督,实现了文本到图像检索、疾病分类及内扫描片段定位的统一模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02052 2026-03-03 q-bio.BM cs.AI cs.LG q-bio.QM 84%

General Protein Pretraining or Domain-Specific Designs? Benchmarking Protein Modeling on Realistic Applications

通用蛋白质预训练还是领域特定设计?在真实应用场景中对蛋白质建模的基准测试

Shuo Yan, Yuliang Yan, Bin Ma, Chenao Li, Haochun Tang, Jiahua Lu, Minhua Lin, Yuyuan Feng, Enyan Dai

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Pennsylvania State University(宾夕法尼亚州立大学) Xiamen University(厦门大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Protap通过比较不同架构和预训练策略,在真实应用场景中评估蛋白质建模的性能,发现领域特定知识和结构信息对提升模型效果至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13654 2026-03-03 cs.SE cs.CR 83%

SOSecure: Safer Code Generation with RAG and StackOverflow Discussions

SOSecure: 借助检索增强生成与StackOverflow讨论实现更安全的代码生成

Manisha Mukherjee, Vincent J. Hellendoorn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 SOSecure通过检索增强生成与StackOverflow讨论提升代码安全性,实现71.7%-96.7%的修复率,优于其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00479 2026-03-03 cs.CV 82%

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03862 2026-03-03 cs.CL cs.AI 81%

Not-Just-Scaling Laws: Towards a Better Understanding of the Downstream Impact of Language Model Design Decisions

并非仅仅的规模法则:迈向更深入理解语言模型设计决策对下游影响的探索

Emmy Liu, Amanda Bertsch, Lintang Sutawika, Lindia Tjuatja, Patrick Fernandes, Lara Marinov, Michael Chen, Shreya Singhal, Carolin Lawrence, Aditi Raghunathan, Kiril Gashteovski, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Language Technologies Institute(语言技术研究所) Instituto Superior Técnico (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院)) Instituto de Telecomunicações(电信研究所) NEC Laboratories Europe, Germany(德国NEC欧洲实验室) CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(北马其顿斯·西里尔和方法ius大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析92个开源预训练模型,发现结合模型大小和训练token数量以外的特征,可提升对下游性能预测能力,揭示了数据组成和架构决策对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02081 2026-03-03 cs.DB cs.AI cs.CL cs.LG cs.MA 80%

GenDB: The Next Generation of Query Processing -- Synthesized, Not Engineered

GenDB:查询处理的下一代——合成而非工程

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GenDB利用大语言模型合成查询执行代码,以替代传统复杂的查询处理引擎,实现更高效和定制化的查询处理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00193 2026-03-03 q-bio.QM 80%

Multimodal Alignment Improves Generalizability of Genomic Biomarker Prediction in Computational Pathology

多模态对齐提升了计算病理学中基因组生物标志物预测的泛化能力

Ekaterina Redekop, Eric Zimmermann, Ava P Amini, Alex X Lu, Neil Tenenholtz, James Brian Hall, Lorin Crawford, Kristen A Severson

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 MARBLE通过多模态对比预训练策略,将组织病理学图像与基因组生物标志物的表示对齐,提升计算病理学中基因组生物标志物预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11582 2026-03-03 cs.LG cs.CV q-bio.NC 79%

Brain-Semantoks: Learning Semantic Tokens of Brain Dynamics with a Self-Distilled Foundation Model

Brain-Semantoks: 通过自蒸馏基础模型学习脑动态的语义标记

Sam Gijsen, Marc-Andre Schulz, Kerstin Ritter

机构 * Hertie Institute for AI in Brain Health, University of Tübingen(图宾根大学脑健康人工智能研究所) Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Charité – Universitätsmedizin Berlin, Department of Psychiatry and Psychotherapy(柏林夏里特医学院心理治疗系)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Brain-Semantoks通过自蒸馏基础模型学习脑动态的语义标记,提升fMRI时间序列在下游任务中的性能。

Comments Accepted at ICLR 2026. Code and pretrained models available at https://github.com/SamGijsen/Brain-Semantoks

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23465 2026-03-03 cs.AI 79%

ViTSP: A Vision Language Models Guided Framework for Solving Large-Scale Traveling Salesman Problems

ViTSP:一种由视觉语言模型引导的解决大规模旅行商问题的框架

Zhuoli Yin, Yi Ding, Reem Khir, Hua Cai

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 ViTSP利用预训练视觉语言模型指导大规模TSP求解,通过识别子问题提升全局解的质量,实验表明其在大规模实例上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04097 2026-03-03 cs.LG 79%

Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks

视觉-语言模型是否会泄露所学内容?基于自适应令牌加权的模型逆向攻击

Ngoc-Bao Nguyen, Sy-Tuyen Ho, Koh Jun Hao, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出SMI-AW攻击方法,揭示视觉-语言模型在隐私泄露方面的脆弱性,通过自适应令牌加权提升图像重建效果,验证了VLMs在敏感领域中的隐私风险。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01758 2026-03-03 cs.CV 78%

Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining

通过语言枢轴预训练统一异构多模态遥感检测

Yuxuan Li, Yuming Chen, Yunheng Li, Ming-Ming Cheng, Xiang Li, Jian Yang

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 BabelRS通过语言枢轴预训练框架统一异构多模态遥感检测,解耦模态对齐与任务学习,提升训练稳定性与检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00482 2026-03-03 cs.CV cs.IT math.IT 78%

TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications

TokenCom: 一种用于多模态和多任务令牌通信的视觉-语言模型

Feibo Jiang, Siwei Tu, Li Dong, Xiaolong Li, Kezhi Wang, Cunhua Pan, Zhu Han, Jiangzhou Wang

机构 * Hunan Provincial Key Laboratory of Intelligent Computing and Language Information Processing, Hunan Normal University(湖南省级智能计算与语言信息处理重点实验室,湖南师范大学) School of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学) Changsha Social Laboratory of Artificial Intelligence, Hunan University of Technology and Business(长沙人工智能社会实验室,湖南工业大学) School of Computer Science, Hunan University of Technology and Business(计算机科学学院,湖南工业大学) Department of Computer Science, Brunel University London(伦敦布鲁内尔大学计算机科学系) National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心) Department of Electrical and Computer Engineering, University of Houston(电子与计算机工程系,休斯顿大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 TokenCom提出了一种新的视觉-语言模型框架TaiChi,通过双视觉分词器和双向注意力网络提升多模态和多任务令牌通信的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16597 2026-03-03 cs.CL cs.IR 77%

Scaling Knowledge Graph Construction through Synthetic Data Generation and Distillation

通过合成数据生成与蒸馏扩展知识图谱构建

Prafulla Kumar Choubey, Xin Su, Man Luo, Xiangyu Peng, Caiming Xiong, Tiep Le, Shachar Rosenman, Vasudev Lal, Phil Mui, Ricky Ho, Phillip Howard, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SynthKG和Distill-SynthKG方法,通过合成数据生成和蒸馏技术提升文档级知识图谱构建效率,并设计图检索框架提升检索与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01042 2026-03-03 cs.CL cs.AI cs.LG 75%

Thoth: Mid-Training Bridges LLMs to Time Series Understanding

Thoth:中期训练使LLM具备时间序列理解能力

Jiafeng Lin, Yuxuan Wang, Jialong Wu, Huakun Luo, Zhongyi Pei, Jianmin Wang

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Thoth通过中期训练和Book-of-Thoth语料库,使LLM具备时间序列理解能力,并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04067 2026-03-03 cs.LG cs.AI cs.CL 75%

What Scales in Cross-Entropy Scaling Law?

交叉熵缩放定律中什么因素具有可扩展性?

Junxi Yan, Zixi Wei, Qingyao Ai, Yiqun Liu, Jingtao Zhan

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分解交叉熵为误差熵、自我对齐和置信度三个部分,揭示了误差熵是唯一遵循幂律缩放的因素,从而解释了交叉熵缩放定律在小规模有效但在大尺度失效的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03605 2026-03-03 cs.AI cs.LG stat.ML 73%

Understanding the Role of Training Data in Test-Time Scaling

理解训练数据在测试时扩展中的作用

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了训练数据对测试时扩展性能的影响,发现增加计算量可减少上下文长度并提升模型表现,但若训练数据缺乏必要技能则可能损害性能。

Comments 25 pages, 5 figures, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00436 2026-03-03 cs.LG cs.AI 73%

ROKA: Robust Knowledge Unlearning against Adversaries

ROKA: 面对对抗者的鲁棒知识反学习

Jinmyeong Shin, Joshua Tapia, Nicholas Ferreira, Gabriel Diaz, Moayed Daneshyari, Hyeran Jeon

机构 * University of California, Merced(加州大学梅尔塞德斯分校) California State University, East Bay(加州州立大学东湾分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ROKA通过神经愈合机制实现鲁棒的知识反学习,有效对抗间接反学习攻击,同时保护保留数据的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00732 2026-03-03 cs.RO cs.CV 71%

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

UniHM: 一体化的视觉语言模型用于统一的灵巧手操作

Zhenhao Zhang, Jiaxin Liu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 预训练与数据 :language model(title)

AI总结 UniHM通过统一的视觉语言模型实现灵巧手操作,利用开放词汇指令提升泛化能力和物理可行性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26560 2026-03-03 stat.ML cs.LG q-bio.NC 70%

Estimating Dimensionality of Neural Representations from Finite Samples

从有限样本估计神经表示的维度

Chanwoo Chun, Abdulkadir Canatar, SueYeon Chung, Daniel Lee

机构 * Harvard University(哈佛大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所) Cornell Tech(康奈尔科技)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种偏倚校正估计器,用于从有限样本中准确估计神经表示的维度,并展示了其在生物神经记录和语言模型中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14042 2026-03-03 cs.LG cs.CV stat.ML 70%

Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners

对抗性预训练的Transformer可能成为普遍稳健的上下文学习者

Soichiro Kumano, Hiroshi Kera, Toshihiko Yamasaki

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出对抗性预训练的Transformer可作为普遍稳健的基础模型,通过上下文学习实现对多种下游任务的稳健泛化。

Comments ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 67%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01950 2026-03-03 cs.LG cs.CL cs.CV 62%

Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment

语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训

Christopher Driggers-Ellis, Nachiketh Tibrewal, Rohit Bogulla, Harsh Khanna, Sangpil Youm, Christan Grant, Bonnie Dorr

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。

Comments 8 pages, 2 figures, 3 tables. Includes link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01335 2026-03-03 cs.LG cs.AI 62%

Provable and Practical In-Context Policy Optimization for Self-Improvement

可证明且实用的上下文内策略优化用于自我改进

Tianrun Yu, Yuxiao Yang, Zhaoyang Wang, Kaixiang Zhao, Porter Jenkins, Xuchao Zhang, Chetan Bansal, Huaxiu Yao, Weitong Zhang

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICPO方法,通过上下文内自我反思和最小熵优化,在保持低推理成本的同时实现数学推理任务的高性能

Comments 34 pages, 8 tables, 4 figures, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏