arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2606.30661 2026-07-01 cs.CY 新提交 92%

Understanding Censorship in Large Language Models: From Mechanisms to Governance

理解大型语言模型中的审查:从机制到治理

Quanyan Zhu

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31247 2026-07-01 cs.SD eess.AS 新提交 87%

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

FlexiSLM:一种动态可控帧率的语音语言模型

Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出FlexiSLM,首个支持动态可控帧率的语音语言模型,利用动态帧率表示在高质量点超越固定帧率7B模型,并在6.25 Hz时推理速度减半且保持高质量。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30944 2026-07-01 eess.AS cs.SD 新提交 85%

Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation

保留语音到文本LLM能力的语音到语音生成

Yuxuan Hu, Heng Lu, Ruchao Fan, Yao Qian, Xiaofei Wang, Jian Xue, Heming Wang, Shuohang Wang, Young Jin Kim, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30813 2026-07-01 cs.LG cs.AI 新提交 82%

Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

梯度平滑:耦合逐层更新以改进优化

Haoming Meng, Anton Sugolov, Vardan Papyan

机构 * Vector Institute(向量研究所)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出深度梯度增强框架,通过窗口平滑算子沿深度方向变换优化器更新,在不改变模型架构或训练目标下提升多种架构和任务的优化与泛化性能。

Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30700 2026-07-01 cs.SD cs.AI cs.LG eess.AS eess.SP 新提交 79%

BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

BEST-RQ-2:先上下文化再预测——自监督音频表示的两步方法

Ludovic K. Tuncay, Etienne Labbé, Thomas Pellegrini

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出BEST-RQ-2,通过两步式上下文化-预测预训练方案,使用ViT编码器和轻量预测器,在保持推理计算不变下提升跨域迁移性能。

Journal ref Interspeech 2026, Sep 2026, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30749 2026-07-01 cs.RO 新提交 78%

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

从抓取到灵巧:大规模抓取预训练用于灵巧操作

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。

Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30922 2026-07-01 cond-mat.other 新提交 78%

An Interaction Language Model: Mechanism Discovery from Statistical Patterns of Physical Interactions

交互语言模型:从物理交互的统计模式中发现机制

Triparna Ganguly, Hanqi Jiang, Xinliang Li, Yi Pan, Junhao Chen, Miyuki Karunathilaka, Tianming Liu, Yohannes Abate

专题命中 预训练与数据 :language model(title,abstract)

AI总结 提出交互语言模型(ILM),通过统计学习物理交互的依赖关系,推断交互路径、识别缺失步骤并预测下一步交互,在分子扩散任务中实现可审计的机制发现。

Comments Corresponding authors: Tianming Liu, Yohannes Abate

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21876 2026-07-01 cs.LG cs.AI 新提交 73%

Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian

蛋白质接触已经存在于注意力中:分类雅可比矩阵的单次前向替代方案

Rome Thorstenson

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出通过选择少量注意力头(仅需10个标记蛋白质)平均即可在一次前向传播中恢复蛋白质接触,在无泄漏数据上优于分类雅可比矩阵,并发现该信号依赖于双向预训练。

Comments 28 pages, 9 figures. Code and data: https://github.com/Rome-1/plm-contact-fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31325 2026-07-01 cs.AI 新提交 70%

HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)

HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论

Aurélien Pellet, Julien Perez, Marie Puren

机构 * LRE EPITA EPITECH Bpifrance CJM

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。

Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30905 2026-07-01 cs.CY cs.AI 新提交 70%

How Human Feedback Shapes AI-generated Community Notes

人类反馈如何塑造AI生成的社区笔记

Soham De, Isaac Slaughter, Jiawei Guo, Qiao-Yun Cheng, Jiayuan Yan, Sruti Banerjee, Martin Saveski

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究分析X平台协作笔记中人类反馈对AI生成草稿的影响,发现事实修正和补充背景的建议最易被采纳,人类反馈提升笔记有用性,但协作笔记达到有用状态的比例低于纯人类或纯AI笔记,且主要补充而非替代它们。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30777 2026-07-01 cs.CV 新提交 67%

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

通过潜在场景嵌入揭示轨迹预测中的可迁移性

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

机构 * Linköping University(林雪平大学) Lund University(隆德大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31991 2026-07-01 cs.LG cs.AI 新提交 62%

Amplifying Membership Signal Through Chained Regeneration

通过链式再生放大成员信号

Wojciech Łapacz, Stanisław Pawlak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MADreMIA框架,利用链式再生迭代轨迹增强生成模型的成员推断和数据集推理攻击,在低误报率下提升信号强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31135 2026-07-01 cs.CV cs.LG 新提交 57%

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration

MSNN-LINet:通过连续线性集成进行跨模态学习

Gabriel Clinger

机构 * The George Washington University(乔治华盛顿大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出线性集成网络LINet,通过连续线性集成卷积操作实现RGB-D场景分类中的逐层跨模态学习,解决多模态融合的结构性妥协问题,并在SUN RGB-D数据集上取得领先结果。

Comments 14 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 50%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 21 篇

2606.30877 2026-07-01 eess.SY cs.LG cs.SY 新提交 92%

A Systematic Approach to Multi-Agent AI from Advanced Regulatory Control Theory: Safe and Auditable LLM Operator Agents for Process Control

基于先进调节控制理论的多智能体AI系统化方法:用于过程控制的安全且可审计的LLM操作员智能体

Idelfonso B. R. Nogueira, Sigurd Skogestad

机构 * Norwegian University of Science and Technology (NTNU)(挪威科技大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出将先进调节控制理论映射为多智能体系统,每个反馈回路对应一个专业LLM操作员智能体,通过确定性或LLM编排器解决约束冲突,在奶牛场通风案例中实现可审计轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16517 2026-07-01 cs.LG q-bio.QM 新提交 91%

How Post-Training Shapes Biological Reasoning Models

后训练如何塑造生物学推理模型

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);language model(abstract);foundation model(abstract)

AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30899 2026-07-01 cs.CR cs.AI 新提交 89%

Curvature-Guided Module Localization for Low-Rank Detoxification of Backdoored Large Language Models

曲率引导的模块定位用于后门大语言模型的低秩解毒

Arash Raftari, Mehrdad Mahdavi, Nathan Blackthorn, Andrew Arash Mahyari

机构 * AIVault Inc.(AIVault公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出一种基于激活修补和Fisher/K-FAC曲率分析的机制引导权重空间修复框架,定位并低秩修复后门大语言模型中最有影响力的模块,有效抑制触发条件恶意行为同时保持良性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30943 2026-07-01 cs.CL 新提交 87%

Bridging Scientific Heritage: An Arabic--Russian Parallel Corpus and LLM Benchmark for Sustainable Knowledge Transfer

连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与LLM基准

M. K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 指令微调 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 为解决阿拉伯语和俄语科学交流的语言障碍,构建了约2.7万句对的混合平行语料库,微调mT5、NLLB和Qwen2.5-7B模型,Qwen2.5-7B+QLoRA达到BLEU 23.15,推动跨语言知识转移与可持续发展。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30914 2026-07-01 cs.CL 新提交 86%

Beyond Clean Text: Evaluating Encoder and Decoder Robustness for Bangla Event Detection in Noisy Text

超越干净文本:评估编码器和解码器在孟加拉语噪声文本事件检测中的鲁棒性

Tanvir Ahmed Sijan, S. M Golam Rifat, Nayeemul Islam, Md. Musfique Anwar

机构 * Jahangirnagar University(贾汉吉尔纳加尔大学) Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学) Bangladesh University of Engineering and Technology(孟加拉国工程技术大学)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 针对孟加拉语事件检测在噪声文本中的鲁棒性问题,构建含9,979句标注的基准数据集,系统评估编码器模型(BanglaBERT、XLM-R)与解码器LLM(Llama 3、Gemma 3),发现解码器模型鲁棒性更强,而编码器模型在干净文本上表现更好但受噪声影响大。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31166 2026-07-01 cs.CL cs.LG 新提交 86%

TAG-DLM: Diffusion Language Models for Text-Attributed Graph Learning

TAG-DLM:面向文本属性图学习的扩散语言模型

Lingjie Chen, Yuanchen Bei, Haobo Xu, Yanjun Zhao, Yuzhong Chen, Hanghang Tong

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) VISA(VISA研究院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出TAG-DLM方法,通过掩码扩散语言模型统一文本推理与图消息传递,线性化邻域并利用拓扑注意力掩码实现图结构注入,无需微调即可适应节点分类、链接预测等任务,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31408 2026-07-01 cs.CR cs.OS 新提交 86%

EnclaveX: End-to-End Confidential AI with CPU/GPU TEEs

EnclaveX: 端到端机密AI与CPU/GPU TEE

Robert Schambach, Quoc Do Le, Sergei Arnautov, Christof Fetzer

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出结合CPU和GPU TEE的端到端工作流,通过Intel TDX和AMD SEV-SNP等机制保障AI/LLM应用的机密性和完整性,并评估了性能开销。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31846 2026-07-01 cs.RO cs.AI 新提交 84%

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1: 面向视觉-语言-动作模型的高效强化学习

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

机构 * Zioneer Robot Team(Zioneer机器人团队)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25086 2026-07-01 cs.LG cs.AI stat.ML 新提交 84%

Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models

为返回的模型进行训练:改进迭代平均语言模型的优化

Kwok Chun Au, Adam Block

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系)

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对返回迭代平均而非最终迭代的语言模型,提出PACE方法,通过最优控制理论优化平均估计器,在二次模型中证明其能显著降低均方误差,并在1-2B参数LM微调和GPT-2预训练中优于AdamW。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 83%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31813 2026-07-01 cs.LG cs.AI 新提交 82%

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

保持几何的正交初始化用于RLVR中的低秩适应

Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta Superintelligence Labs(Meta超级智能实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对RLVR中LoRA初始化问题,提出保持几何的正交初始化方法(RLPO和RLMO),理论证明其最小化与全微调差距,实验表明稳定训练且优于标准LoRA。

Comments 30 pages, accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31099 2026-07-01 cs.CV cs.AI 新提交 81%

Seeing Through Multiple Views: Parameter-Efficient Fine-Tuning via Selective Neurons for Consistent Radiology Report Generation

透视多视图:通过选择性神经元进行参数高效微调以实现一致的放射学报告生成

Yucheng Chen, Jinjing Zhu, Yang Yu, Yufei Shi, Hane Naghshbandi, Jinhua Liu, Angela S. Koh, Fang Fen, Kian Eng Ong, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(新加坡南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡人工智能医学中心) The Chinese University of Hong Kong, Sha Tin, New Territories, Hong Kong(香港中文大学) National Heart Centre Singapore (NHCS), Singapore(新加坡国家心脏中心)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出View-PNDF框架,通过检测和微调视图特定神经元,从神经元层面实现多视图X光报告的一致性生成,仅更新少量参数即可提升视图特定报告质量并保持通用性能。

Comments Accepted by MICCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-07-01 cs.AI cs.CV 新提交 81%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31719 2026-07-01 cs.CL cs.AI 新提交 81%

Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

Nan Li, Albert Gatt, Massimo Poesio

机构 * Utrecht University(乌得勒支大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究视觉-语言模型在对话中是否混淆潜在共享与已共享信息,发现模型过度依赖地图内容预测对齐,忽视对话历史中的基础建立过程。

Comments 17 pages, 9 figures, 8 tables; accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31591 2026-07-01 cs.LG cs.AI 新提交 79%

Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment

邪恶光谱:优化器如何放大或抑制涌现性失调

Jason R. Brown, Patrick Leask, Lev McKinney

机构 * Astra Fellows Program(Astra Fellows 项目) University of Cambridge(剑桥大学) Durham University(杜伦大学) University of Toronto(多伦多大学)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究优化器选择对LLM涌现性失调的影响,发现优化器导致7倍失调率差异,Muon通过隐式正则化奇异值分布保持对齐,谱正则化可缓解失调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31392 2026-07-01 cs.AI 新提交 77%

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO: 用于工具使用智能体的反思增强策略优化

Binjie Zhang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏