arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-10 至 2026-07-10 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2607.08221 2026-07-10 cs.CV 新提交 90%

LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression

LUMI:基于语言模型的与分词器无关的无损图像压缩

Chris Xing Tian, Chengkai Wu, Ziyu Wang, Rongqun Lin, Kecheng Chen, Xiandong Meng, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Department of Electrical Engineering, City University of Hong Kong, Hong Kong SAR(香港城市大学电子工程系,香港特别行政区) Department of Computer Science, City University of Hong Kong, Hong Kong SAR(香港城市大学计算机科学系,香港特别行政区) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究基于LLM的无损图像压缩问题,提出LUMI框架,用像素嵌入模块取代像素即文本分词,引入位置编码,仅训练部分参数,LLM主干固定。实验表明其提供统一接口,压缩率有竞争力且跨域鲁棒性强。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08186 2026-07-10 cs.CL 新提交 89%

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

大规模隐藏解码:大语言模型的潜在计算扩展

Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

机构 * WeChat AI Team(微信人工智能团队)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究在Transformer主干固定时,通过为token分配更多计算改进大语言模型,提出隐藏解码方法,将token扩展为n个流并结合流分解注意力,实验验证该方法在前沿规模的有效性及跨扩展因子时收益随n增加。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 86%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08162 2026-07-10 cs.CV cs.AI cs.LG 新提交 81%

ProsMAE: Multi-Source MAE Pretraining for ISUP Grade Classification

ProsMAE:用于ISUP分级分类的多源MAE预训练

Anna Jung, Kyeonghun Kim, Youngung Han, Eunseob Choi, Jiwon Yang, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) GIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 针对全切片图像模型训练难题,提出多源MAE框架ProsMAE,利用多数据集切片预训练编码器,通过ProsCLS用于ISUP分级分类,在不相交PANDA分割下比普通MAE冻结线性探针基线有更高QWK。

Comments Accepted to APCCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交 80%

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26428 2026-07-10 cs.RO cs.AI 新提交 79%

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

Play2Perfect:灵巧操作预训练对精密装配的关键因素

Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 提出Play2Perfect框架,通过任务无关的玩耍预训练获取可复用的操作先验,再微调用于精密装配,在稀疏奖励和接触密集任务中实现33倍样本效率提升。

Comments 22 pages, 12 figures, 4 tables. Project page: https://play2perfect.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交 79%

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08011 2026-07-10 cs.CR cs.AI cs.IR cs.LG 新提交 79%

Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions

小心你的自动补全内容:后门代码补全的取证溯源

Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(德克萨斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型代码补全易受后门攻击的问题,提出CodeTracer取证框架,它仅靠微调语料库和错误补全事件,提取行为指纹,经推理将不安全逻辑归因于特定后门数据,评估显示其有高准确性、低误识率和强鲁棒性。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06116 2026-07-10 cs.AI cs.CL cs.CY 79%

The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety

在大语言模型中的同质化问题:迈向人工智能安全中的有意义多样性

Ian Rios-Sialer

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型中同质化问题,提出通过编码价值观系统来促进多样性,通过实验揭示性别偏见并引入xeno-reproduction概念以缓解同质化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08077 2026-07-10 cs.LG 新提交 74%

Modular Pretraining Enables Access Control

模块化预训练实现访问控制

Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对人工智能两用困境及多模型部署成本高问题,提出梯度路由辅助模块(GRAM)预训练方法,能在推理时消融模块功能。实验显示其可有效禁用目标功能且抗微调恢复,训练成本低,紧密跟踪数据过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15138 2026-07-10 cs.CL cs.AI 版本更新 73%

Less Is More: Reducing Token Counts Without Compromising Performance

少即是多:在不影响性能的情况下减少词元数量

Gyeongje Cho, Yeonkyoung So, Sangmin Lee, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何在不影响大语言模型性能的前提下减少词元数量,提出Thunder-Tok子词元分词器,先构建种子词汇表并过滤不完整候选词元,再用基于似然的词元分数修剪,实验证明该方法能有效降低词元生成率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00970 2026-07-10 cs.CL 新提交 70%

Svarna: An Open Corpus Workbench for Modern Greek

Svarna:现代希腊语开放语料库工作台

Stergios Chatzikyriakidis

机构 * Department of Philosophy, Linguistics and Theory of Science (FLoV), University of Gothenburg(哥德堡大学哲学、语言学与理论科学系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 介绍一个免费开源的现代希腊语网络语料库工作台Svarna,整合五个数据库共5.07亿词,提供索引、频率分析、搭配提取等功能,填补希腊语言技术空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06629 2026-07-10 cs.LG q-bio.NC 新提交 57%

STST-JEPA: Shallow-Target Spatio-Temporal Joint Embedding Prediction Architecture For EEG Self-Supervised Learning

STST-JEPA:用于脑电图自监督学习的浅目标时空联合嵌入预测架构

Roy Segal, Yoni Svechinsky, Tomer Fekete

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 研究针对脑电图脑年龄模型面临的问题,引入STST-JEPA自监督变压器,结合潜在预测目标与辅助信号重建项,经预训练和微调后在多任务中表现出色,且年龄预测残差与认知效率负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10254 2026-07-10 cs.LG 版本更新 57%

Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure

通过整合因果结构改进TabPFN的合成数据生成

Davide Tugnoli, Andrea De Lorenzo, Marco Virgolin, Giovanni Cinà

机构 * Department of Mathematics, Informatics and Geosciences(数学、信息学与地质科学系) University of Trieste(特里este大学) Department of Engineering and Architecture(工程与建筑系) InSilicoTrials Technologies BV(InSilicoTrials技术公司) Amsterdam UMC Institute for Logic, Language and Computation(阿姆斯特丹大学医学中心逻辑、语言与计算研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 通过整合因果结构改进TabPFN的合成数据生成,提升合成数据的质量和稳定性

Comments Camera-ready version, accepted at UAI 2026. 9 pages main text, 44 pages total (including supplementary material), 35 figures. Code: https://github.com/DavideTugnoli/tabpfn-causal-synthetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12999 2026-07-10 cs.CV cs.AI 版本更新 57%

Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型

Ruichuan An, Kai Zeng, Ming Lu, Sihan Yang, Renrui Zhang, Huitong Ji, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) CUHK MMLab(香港中文大学MMLab) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。

Comments ECCV26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2606.05194 2026-07-10 cs.LG cs.AI cs.CL 版本更新 91%

Temporal Preference Concepts and their Functions in a Large Language Model

时间偏好概念及其在大语言模型中的功能

Ian Rios-Sialer, Shantanu Darveshi, Shuai Jiang, Avigya Paudel, Anastasiia Pronina, Ipshita Bandyopadhyay, Justin Shenk

机构 * AISC(AI Safety Camp) SPAR(Supervised Program for Alignment Research)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过因果定位和激活修补,本文发现大语言模型在中间到上层节点编码时间偏好几何结构,且行为分析表明模型对未来折扣比人类更平缓,但偏好不稳定,可通过引导向量调控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07916 2026-07-10 cs.AI cs.LG 新提交 86%

Persona Cartography: Charting Language Model Personality Traits in Weight Space

人物角色制图:在权重空间中描绘语言模型的个性特征

Luke Baines, Anton Gonzalvez Hawthorne, Mariia Koroliuk, Irakli Shalibashvili, Clément Dumas, Konstantinos Voudouris, David Demitri Africa

机构 * dsit.gov.uk(数字科学与创新部)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型人物角色,用大五人格框架将其视为行为特征空间位置,训练低秩适配器控制特征,评估其效果,发现可构建混合人物角色并保持性能,还表明特征轴影响安全行为,引入无监督管道,为人格测量等架桥。

Comments 85 pages, 80 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08393 2026-07-10 cs.AI cs.CL 新提交 85%

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

迈向对大语言模型微调中记忆知识无法泛化原因的机理理解

Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型微调中记忆知识无法泛化的问题,用自修补技术监测知识渗透动态,发现与知识电路未对准假设一致,还设计启发式策略验证,跨域实验证明发现具稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07719 2026-07-10 cs.LG cs.AI cs.CV 新提交 84%

ReCoLoRA: Spectrum-Aware Recursive Consolidation for Continual LLM Fine-Tuning

ReCoLoRA:用于持续语言模型微调的频谱感知递归合并

Wentao Lu

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对持续语言模型微调中类似LoRA方法新任务覆盖旧任务的问题,提出ReCoLoRA框架,通过特定初始化、选秩及递归合并等操作,在多任务持续GLUE序列实验中,用更少参数取得更好成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交 81%

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07951 2026-07-10 cs.LG physics.ao-ph 新提交 79%

Evaluating the Generalizability of Foundation Models for Extreme Environmental Events: Case Study of California Wildfire PM2.5

评估极端环境事件基础模型的泛化能力:以加利福尼亚野火PM2.5为例

Yongcan Huang, Li Jiang, Ze Yu Liu

机构 * College of Engineering, University of Georgia(佐治亚大学工程学院) Information System Department, UMBC(马里兰大学巴尔的摩郡分校信息系统系) College of Graduate and Professional Studies, Trine University(特瑞大学研究生与专业研究学院) School of Professional Studies, Columbia University(哥伦比亚大学专业研究学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究以加利福尼亚野火PM2.5为例,比较六种时间序列基础模型配置与全训练基线及朴素持久性方法,通过留一事件法评估泛化能力,发现BiLSTM表现最佳,零样本TSFMs改进有限,LoRA微调有改善但未超循环基线,挑战大预训练模型主导环境预测的假设并提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08404 2026-07-10 q-bio.QM cs.AI cs.LG 新提交 76%

DrugGen 2: A disease-aware language model for enhancing drug discovery

DrugGen 2:一种用于增强药物发现的疾病感知语言模型

Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami, Navid Mazrouei, Matin Irajpour, Yousof Gheisari, Hajar Sirous

机构 * Regenerative Medicine Research Center(再生医学研究中心) Isfahan University of Medical Sciences(伊斯法罕医科大学) Isfahan Neuroscience Research Center(伊斯法罕神经科学研究中心) School of Pharmacy(药学院) Department of Medicinal Chemistry(药理化学系) Cardiovascular Research Institute(心血管研究学院) Department of Genetics and Molecular Biology(基因与分子生物学系) Bioinformatics Research Center(生物信息学研究中心)

专题命中 指令微调 :language model(title);分类 cs.AI、cs.LG

AI总结 研究针对当前药物设计计算方法忽视疾病背景的问题,提出DrugGen-2模型,通过微调预训练GPT-2模型,经监督微调与强化学习两步策略,依疾病和靶点设计小分子,在糖尿病肾病靶点评估中性能超基线模型,推动AI辅助药物发现。

Comments 15 pages, 2 figures, 1 table, and 4 supplementary files. To use the model, see https://github.com/alimotahharynia/DrugGen-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08456 2026-07-10 cs.CL cs.AI 新提交 76%

Two Axes of LLM Abstention: Answer Correctness and Question Answerability

大语言模型弃权的两个轴:答案正确性和问题可回答性

Benedikt J. Wagner

机构 * University of London(伦敦大学)

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型弃权的两个轴,即答案正确性和问题可回答性。发现普通方法无法区分二者,通过对多个模型研究找到不同轴的特点及问题所在,提出校准策略,可提高答案质量,在不同规模下控制不可回答答案率和错误答案率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08079 2026-07-10 cs.AI 新提交 74%

PARA-PV: Physics-Aware Retrieval-Augmented PV Prediction Based on Frozen Foundation Model and Distribution Shift Correction

PARA-PV:基于冻结基础模型和分布偏移校正的物理感知检索增强型光伏功率预测

Hang Fan, Weican Liu, Ying Lu, Dunnan Liu, Long Cheng, Wei Wei

机构 * School of Economics and Management(经济管理学院) School of Electrical and Electronic Engineering(电子电气工程学院) School of Control and Computer Engineering(控制与计算机工程学院) Department of Electrical Engineering(电气工程系)

专题命中 指令微调 :foundation model(title);分类 cs.AI

AI总结 研究针对光伏功率预测难题,提出PARA-PV框架,通过编码观测、检索历史数据、校准基础预测及校正分布偏移,并采用物理约束损失函数,嵌入物理知识实现准确预测,为可靠电网调度和可再生能源整合助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11549 2026-07-10 cs.HC 版本更新 67%

UNIPO: Unified Interactive Visual Explanation for RL Fine-Tuning Policy Optimization

UNIPO:统一的交互式可视化用于RL微调策略优化

Aeree Cho, Alexander D. Greenhalgh, Jonathan Bodea, Anthony Peng, Duen Horng Chau

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 UNIPO通过统一设计揭示RL微调算法的token级训练动态,提供高阶训练概述、步骤级提示响应检查器和算法对比视图,支持非专家教学和AI从业者算法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08312 2026-07-10 cs.LG 新提交 57%

Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix

用于语言基础世界模型的写保护离散瓶颈:一种结构限制及充分修复

Jiayi Fang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 指令微调 :LLM(abstract);分类 cs.LG

AI总结 研究语言与世界模型离散符号系统的交互问题,提出防止基于Gumbel-softmax的离散符号瓶颈失败的三个约束,经实验验证该方法能实现高基础准确率,且修复参数少、无需微调。

Comments 20 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12726 2026-07-10 cs.LG 版本更新 57%

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

在最后的标记之前:诊断最终标记安全探针失败

Shravan Doda

机构 * SafeSwitch HarmBench SorryBench

专题命中 指令微调 :LLM(abstract_cn);分类 cs.LG

AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。

Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 50%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 指令微调 :pretraining(abstract)

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 10 篇

2606.03238 2026-07-10 cs.LG cs.AI 版本更新 92%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07856 2026-07-10 cs.AI 版本更新 91%

Dual-Difficulty Curriculum Learning for Direct Preference Optimization

用于直接偏好优化的双难度课程学习

Mengyang Li, Haozhan Geng, Zhong Zhang, Shuang Liu

机构 * Tianjin Key Laboratory of Wireless Mobile Communications and Power Transmission(天津无线移动通信与电力传输重点实验室) Tianjin Normal University(天津师范大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型对齐中课程学习依赖一维难度视图的问题,提出将对齐难度重构为二维空间,开发DM-Curri-DPO框架,引入GSP-Curri-DPO分组自定进度学习框架,实验表明该方法提升了数据效率与鲁棒性,为LLM对齐建立新范式。

Comments We found a critical flaw in the prompt complexity metric, which affects the 2D curriculum grid construction and leads to potentially invalid comparisons. Since this undermines our main conclusions, we are withdrawing the paper and will revise the methodology before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏