arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-10 至 2026-07-10 共收录 160 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2607.08221 2026-07-10 cs.CV 新提交 90%

LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression

LUMI:基于语言模型的与分词器无关的无损图像压缩

Chris Xing Tian, Chengkai Wu, Ziyu Wang, Rongqun Lin, Kecheng Chen, Xiandong Meng, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Department of Electrical Engineering, City University of Hong Kong, Hong Kong SAR(香港城市大学电子工程系,香港特别行政区) Department of Computer Science, City University of Hong Kong, Hong Kong SAR(香港城市大学计算机科学系,香港特别行政区) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究基于LLM的无损图像压缩问题,提出LUMI框架,用像素嵌入模块取代像素即文本分词,引入位置编码,仅训练部分参数,LLM主干固定。实验表明其提供统一接口,压缩率有竞争力且跨域鲁棒性强。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08186 2026-07-10 cs.CL 新提交 89%

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

大规模隐藏解码:大语言模型的潜在计算扩展

Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

机构 * WeChat AI Team(微信人工智能团队)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究在Transformer主干固定时,通过为token分配更多计算改进大语言模型,提出隐藏解码方法,将token扩展为n个流并结合流分解注意力,实验验证该方法在前沿规模的有效性及跨扩展因子时收益随n增加。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 86%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08162 2026-07-10 cs.CV cs.AI cs.LG 新提交 81%

ProsMAE: Multi-Source MAE Pretraining for ISUP Grade Classification

ProsMAE:用于ISUP分级分类的多源MAE预训练

Anna Jung, Kyeonghun Kim, Youngung Han, Eunseob Choi, Jiwon Yang, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) GIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 针对全切片图像模型训练难题,提出多源MAE框架ProsMAE,利用多数据集切片预训练编码器,通过ProsCLS用于ISUP分级分类,在不相交PANDA分割下比普通MAE冻结线性探针基线有更高QWK。

Comments Accepted to APCCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交 80%

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26428 2026-07-10 cs.RO cs.AI 新提交 79%

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

Play2Perfect:灵巧操作预训练对精密装配的关键因素

Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 提出Play2Perfect框架,通过任务无关的玩耍预训练获取可复用的操作先验,再微调用于精密装配,在稀疏奖励和接触密集任务中实现33倍样本效率提升。

Comments 22 pages, 12 figures, 4 tables. Project page: https://play2perfect.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交 79%

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08011 2026-07-10 cs.CR cs.AI cs.IR cs.LG 新提交 79%

Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions

小心你的自动补全内容:后门代码补全的取证溯源

Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(德克萨斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型代码补全易受后门攻击的问题,提出CodeTracer取证框架,它仅靠微调语料库和错误补全事件,提取行为指纹,经推理将不安全逻辑归因于特定后门数据,评估显示其有高准确性、低误识率和强鲁棒性。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08077 2026-07-10 cs.LG 新提交 74%

Modular Pretraining Enables Access Control

模块化预训练实现访问控制

Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对人工智能两用困境及多模型部署成本高问题,提出梯度路由辅助模块(GRAM)预训练方法,能在推理时消融模块功能。实验显示其可有效禁用目标功能且抗微调恢复,训练成本低,紧密跟踪数据过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00970 2026-07-10 cs.CL 新提交 70%

Svarna: An Open Corpus Workbench for Modern Greek

Svarna:现代希腊语开放语料库工作台

Stergios Chatzikyriakidis

机构 * Department of Philosophy, Linguistics and Theory of Science (FLoV), University of Gothenburg(哥德堡大学哲学、语言学与理论科学系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 介绍一个免费开源的现代希腊语网络语料库工作台Svarna,整合五个数据库共5.07亿词,提供索引、频率分析、搭配提取等功能,填补希腊语言技术空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06629 2026-07-10 cs.LG q-bio.NC 新提交 57%

STST-JEPA: Shallow-Target Spatio-Temporal Joint Embedding Prediction Architecture For EEG Self-Supervised Learning

STST-JEPA:用于脑电图自监督学习的浅目标时空联合嵌入预测架构

Roy Segal, Yoni Svechinsky, Tomer Fekete

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 研究针对脑电图脑年龄模型面临的问题,引入STST-JEPA自监督变压器,结合潜在预测目标与辅助信号重建项,经预训练和微调后在多任务中表现出色,且年龄预测残差与认知效率负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 10 篇

2607.07916 2026-07-10 cs.AI cs.LG 新提交 86%

Persona Cartography: Charting Language Model Personality Traits in Weight Space

人物角色制图:在权重空间中描绘语言模型的个性特征

Luke Baines, Anton Gonzalvez Hawthorne, Mariia Koroliuk, Irakli Shalibashvili, Clément Dumas, Konstantinos Voudouris, David Demitri Africa

机构 * dsit.gov.uk(数字科学与创新部)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型人物角色,用大五人格框架将其视为行为特征空间位置,训练低秩适配器控制特征,评估其效果,发现可构建混合人物角色并保持性能,还表明特征轴影响安全行为,引入无监督管道,为人格测量等架桥。

Comments 85 pages, 80 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08393 2026-07-10 cs.AI cs.CL 新提交 85%

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

迈向对大语言模型微调中记忆知识无法泛化原因的机理理解

Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型微调中记忆知识无法泛化的问题,用自修补技术监测知识渗透动态,发现与知识电路未对准假设一致,还设计启发式策略验证,跨域实验证明发现具稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07719 2026-07-10 cs.LG cs.AI cs.CV 新提交 84%

ReCoLoRA: Spectrum-Aware Recursive Consolidation for Continual LLM Fine-Tuning

ReCoLoRA:用于持续语言模型微调的频谱感知递归合并

Wentao Lu

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对持续语言模型微调中类似LoRA方法新任务覆盖旧任务的问题,提出ReCoLoRA框架,通过特定初始化、选秩及递归合并等操作,在多任务持续GLUE序列实验中,用更少参数取得更好成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交 81%

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07951 2026-07-10 cs.LG physics.ao-ph 新提交 79%

Evaluating the Generalizability of Foundation Models for Extreme Environmental Events: Case Study of California Wildfire PM2.5

评估极端环境事件基础模型的泛化能力:以加利福尼亚野火PM2.5为例

Yongcan Huang, Li Jiang, Ze Yu Liu

机构 * College of Engineering, University of Georgia(佐治亚大学工程学院) Information System Department, UMBC(马里兰大学巴尔的摩郡分校信息系统系) College of Graduate and Professional Studies, Trine University(特瑞大学研究生与专业研究学院) School of Professional Studies, Columbia University(哥伦比亚大学专业研究学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究以加利福尼亚野火PM2.5为例,比较六种时间序列基础模型配置与全训练基线及朴素持久性方法,通过留一事件法评估泛化能力,发现BiLSTM表现最佳,零样本TSFMs改进有限,LoRA微调有改善但未超循环基线,挑战大预训练模型主导环境预测的假设并提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08404 2026-07-10 q-bio.QM cs.AI cs.LG 新提交 76%

DrugGen 2: A disease-aware language model for enhancing drug discovery

DrugGen 2:一种用于增强药物发现的疾病感知语言模型

Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami, Navid Mazrouei, Matin Irajpour, Yousof Gheisari, Hajar Sirous

机构 * Regenerative Medicine Research Center(再生医学研究中心) Isfahan University of Medical Sciences(伊斯法罕医科大学) Isfahan Neuroscience Research Center(伊斯法罕神经科学研究中心) School of Pharmacy(药学院) Department of Medicinal Chemistry(药理化学系) Cardiovascular Research Institute(心血管研究学院) Department of Genetics and Molecular Biology(基因与分子生物学系) Bioinformatics Research Center(生物信息学研究中心)

专题命中 指令微调 :language model(title);分类 cs.AI、cs.LG

AI总结 研究针对当前药物设计计算方法忽视疾病背景的问题,提出DrugGen-2模型,通过微调预训练GPT-2模型,经监督微调与强化学习两步策略,依疾病和靶点设计小分子,在糖尿病肾病靶点评估中性能超基线模型,推动AI辅助药物发现。

Comments 15 pages, 2 figures, 1 table, and 4 supplementary files. To use the model, see https://github.com/alimotahharynia/DrugGen-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08456 2026-07-10 cs.CL cs.AI 新提交 76%

Two Axes of LLM Abstention: Answer Correctness and Question Answerability

大语言模型弃权的两个轴:答案正确性和问题可回答性

Benedikt J. Wagner

机构 * University of London(伦敦大学)

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型弃权的两个轴,即答案正确性和问题可回答性。发现普通方法无法区分二者,通过对多个模型研究找到不同轴的特点及问题所在,提出校准策略,可提高答案质量,在不同规模下控制不可回答答案率和错误答案率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08079 2026-07-10 cs.AI 新提交 74%

PARA-PV: Physics-Aware Retrieval-Augmented PV Prediction Based on Frozen Foundation Model and Distribution Shift Correction

PARA-PV:基于冻结基础模型和分布偏移校正的物理感知检索增强型光伏功率预测

Hang Fan, Weican Liu, Ying Lu, Dunnan Liu, Long Cheng, Wei Wei

机构 * School of Economics and Management(经济管理学院) School of Electrical and Electronic Engineering(电子电气工程学院) School of Control and Computer Engineering(控制与计算机工程学院) Department of Electrical Engineering(电气工程系)

专题命中 指令微调 :foundation model(title);分类 cs.AI

AI总结 研究针对光伏功率预测难题,提出PARA-PV框架,通过编码观测、检索历史数据、校准基础预测及校正分布偏移,并采用物理约束损失函数,嵌入物理知识实现准确预测,为可靠电网调度和可再生能源整合助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08312 2026-07-10 cs.LG 新提交 57%

Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix

用于语言基础世界模型的写保护离散瓶颈:一种结构限制及充分修复

Jiayi Fang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 指令微调 :LLM(abstract);分类 cs.LG

AI总结 研究语言与世界模型离散符号系统的交互问题,提出防止基于Gumbel-softmax的离散符号瓶颈失败的三个约束,经实验验证该方法能实现高基础准确率,且修复参数少、无需微调。

Comments 20 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 50%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 指令微调 :pretraining(abstract)

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 8 篇

2607.07976 2026-07-10 cs.CL cs.AI cs.LG 新提交 85%

When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准

Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang, Hoang Anh Duy Le, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(里士满大学) Workato(Workato公司) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07993 2026-07-10 cs.CL cs.LG 新提交 82%

Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator

幻觉自我博弈:通过进化生成器引导强化检测器

Shiping Yang, Shining Liang, Weihao Liu, Wenbiao Ding, Linjun Shou, Lu Cheng, Angel X. Chang

机构 * Simon Fraser University(西蒙 Fraser大学) Microsoft(微软) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对高质量标注数据稀缺致识别LLM生成输出中幻觉困难及现有方法局限,提出幻觉自我博弈框架,含检测器和生成器,经多轮训练优化,能在无外部监督下提升小型LLM性能。

Comments Accepted to COLM 2026. Camera-ready version to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08255 2026-07-10 cs.AI 新提交 81%

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

竞争然后合作:前沿人工智能教师构建可验证课程以提升编码学生超越模仿

Miseong Shawn Kim

机构 * Genesis Cortex AI Inc.(创世纪皮层人工智能公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究探讨大型语言模型作教师时的教学问题,提出竞争然后合作框架,让四个前沿人工智能教师先对决排名,再合作构建课程提升学生。发现执行验证下教师解决标准问题情况,模仿不一定提升学生,合作课程能提升学生,强调合作构建可验证环境的价值。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08409 2026-07-10 cs.CL cs.AI 新提交 79%

When Synthetic Speech Is All You Have: Better Call GRPO

当你只有合成语音时:最好调用GRPO

Shashi Kumar, Yanis Labrak, Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交 75%

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 70%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07937 2026-07-10 cs.CL 新提交 57%

When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation

当去偏措施适得其反:基于预处理的刻板印象缓解的反直觉副作用

Yahan Zheng, John Guerrerio, Soroush Vosoughi, Weicheng Ma

机构 * Dartmouth College(达特茅斯学院) Oakland University(奥克兰大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 研究基于预处理的刻板印象缓解方法的副作用,通过两个模型家族、多种策略及不同数据规模验证副作用存在,标准基准常忽略,注意力分析显示副作用与注意力流变化无关,还讨论评估意义并提供诊断方法及主张透明缓解措施。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 8 篇

2607.08284 2026-07-10 cs.AI 新提交 81%

Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench

通过PredicateLongBench理解长上下文任务的难度轴

Siddhartha Jain, Ameya Velingker

机构 * NVIDIA

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型长上下文能力评估不足,提出PredicateLongBench基准,通过识别满足谓词的最长连续子序列压力测试长上下文推理,探索多个难度轴,用两种生成管道实验,发现前沿模型在难度提升时表现不佳,助于理解能力局限。

详情

展开后加载摘要…

URL PDF HTML 收藏