arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 269 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 18 篇

2606.25331 2026-06-25 cs.CL cs.AI cs.LG 新提交 83%

Improved Large Language Diffusion Models

改进的大规模语言扩散模型

Shen Nie, Qiyang Min, Shaoxuan Xu, Zihao Huang, Yuxuan Song, Yong Shan, Yankai Lin, Wayne Xin Zhao, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心) ByteDance Seed(字节跳动Seed)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出iLLaDA,一种8B参数的全双向注意力掩码扩散语言模型,从零训练至12T tokens,在通用、数学和代码基准上显著优于LLaDA,并可与Qwen2.5 7B竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24993 2026-06-25 cs.LG 新提交 81%

The Geometry of Sequential Learning: Lie-Bracket Prediction of Transfer Order

序列学习的几何:李括号预测迁移顺序

John Sweeney

机构 * Sideplane AI

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出李括号对偶性分数预测序列学习中的源域顺序,通过李括号锦标赛实现O(N log N)排序,在指令微调和DPO中达到高准确率。

Comments Accepted to ICML 2026. 20 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24985 2026-06-25 cs.LG cs.AI 新提交 81%

Retrieval-Augmented Personalization with Foundation Models for Wearable Stress Detection

基于检索增强个性化与基础模型的可穿戴压力检测

Louis Simon, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对可穿戴压力检测中个体差异大的问题,提出基于检索增强的轻量级个性化方法,利用冻结的基础模型从用户历史中检索相似模式生成紧凑嵌入,在WESAD数据集上准确率提升3.92%,宏F1提升4.76%,接近监督微调性能且无需标签数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17423 2026-06-25 cs.CV cs.CL 版本更新 79%

Privacy-Aware Visual Language Models

隐私感知的视觉语言模型

Laurens Samson, Nimrod Barazani, Sennay Ghebreab, Yuki M. Asano

机构 * Socially-Intelligent Artificial Systems Group, University of Amsterdam(智能社会人工智能系统组,阿姆斯特丹大学) University of Amsterdam(阿姆斯特丹大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 针对视觉语言模型隐私理解不足的问题,构建高质量基准数据集PrivBench和指令微调数据集PrivTune,通过少量样本微调显著提升隐私敏感性,性能超越GPT-4。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25821 2026-06-25 cs.CL cs.AI 新提交 73%

SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识

Tianyu Dong, Yangyang Liu, Jiang Zhou, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 指令微调 :LLM(abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言在稀疏MoE架构中路由不一致的问题,提出SARA框架,利用对称JS散度约束对齐多语言输入与高资源语义锚点的路由分布,提升低资源语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25700 2026-06-25 cs.LG cs.RO 新提交 70%

Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

基于低秩适配的强化学习内存高效策略库

Samuel Valland Lyngset, Tor Viljen Raanaas, Gard Sveipe, Eirik Møller Nilsen, Jim Torresen, Kai Olav Ellefsen, Tobias Lømo

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究将参数高效微调方法(如LoRA)迁移至机器人强化学习,通过PPO算法微调基线模型构建多任务策略库,实现内存占用降低20-160倍,存储节省90-95%,且成功率无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24963 2026-06-25 cs.CV cs.LG 新提交 70%

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24947 2026-06-25 cs.LG cs.SY eess.SY 新提交 70%

Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources

分布式能源协调的监督强化学习

Haoyuan Deng, Yihong Zhou, Thomas Morstyn, Yi Wang

机构 * National Natural Science Foundation of China(国家自然科学基金) Research Grants Council of the Hong Kong SAR(香港研究资助局) Advanced Research + Invention Agency (ARIA)(高级研究与发明机构) Engineering and Physical Sciences Research Council (EPSRC)(工程与物理科学研究理事会)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出监督强化学习框架,先通过监督学习预训练策略,再经离线与在线微调,实现分布式能源高效协调,显著提升成本效益。

Comments Presented at PSCC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22193 2026-06-25 cs.CL 版本更新 70%

Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

规模还是推理?推理蒸馏的计算等价分析

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo

机构 * Diabolocom Artefact Research Center Equall ISIA Lab, University of Mons(ISIA实验室,蒙斯大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 通过控制实验,在相同计算预算下比较推理蒸馏与标准指令微调,发现指令微调在多数配置下处于帕累托前沿,而推理蒸馏仅在7B以上开放任务中有效,混合25-50%推理数据可低成本获得大部分收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25475 2026-06-25 math.DS 新提交 67%

A Krieger Embedding Theorem for Near Markov Sofic Shifts

近马尔可夫索菲克平移的克里格嵌入定理

Brian Marcus, Tom Meyerovitch, Chengyu Wu

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文推广了Krieger嵌入定理,给出了将子平移嵌入到混合(不可约)近马尔可夫索菲克平移的充要条件,并证明了当被嵌入子平移为不可约索菲克时,条件可有限判定。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25195 2026-06-25 cs.CR cs.AI 新提交 57%

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

SoK:AI安全代码生成:进展、陷阱与前进之路

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02205 2026-06-25 cs.LG 版本更新 57%

From Uncertain to Safe: Conformal Adaptation of Diffusion Models for Safe PDE Control

从不确定到安全:扩散模型的安全自适应用于PDE控制

Peiyan Hu, Xiaowei Qian, Wenhao Deng, Rui Wang, Haodong Feng, Ruiqi Feng, Tao Zhang, Long Wei, Yue Wang, Zhi-Ming Ma, Tailin Wu

机构 * intern(实习生) Westlake University(西湖大学) School of Engineering, Westlake University(西湖大学工程学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Fudan University(复旦大学) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 提出SafeDiffCon方法,通过共形预测估计不确定性分位数,结合后训练和推理阶段调整扩散模型,在满足安全约束下实现最优PDE控制。

Comments ICML 2025. 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 18 篇

2505.12843 2026-06-25 cs.LG cs.AI 版本更新 92%

Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

偏差拟合以缓解RLHF中奖励模型的长度偏差

Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出FiMi-RM框架,通过自学习长度与奖励的非线性关系并解耦,有效缓解RLHF中奖励模型因长度偏差导致的奖励破解问题。

Comments 16 pages, 12 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25447 2026-06-25 cs.LG cs.CL 新提交 91%

The Interplay of Harness Design and Post-Training in LLM Agents

马具设计与后训练在LLM智能体中的相互作用

Kyungmin Kim, Youngbin Choi, Seoyeon Lee, Suhyeon Jun, Dongwoo Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 研究将马具(工具集成脚手架)作为可控设计维度,分析其对后训练的影响,发现马具感知的后训练能提升分布内和分布外性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04773 2026-06-25 cs.LG cs.AI 版本更新 91%

Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning

分布偏好优化:大语言模型遗忘的细粒度视角

Kai Qin, Jiaqi Wu, Jianxiang He, Haoyuan Sun, Yifei Zhao, Xu Wang, Bin Liang, Yongzhe Chang, Cheng Li, Tiantian Zhang, Houde Liu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Jianghuai Advanced Technology Center(江淮先进技术中心) University of Technology Sydney(悉尼大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型遗忘中负偏好优化缺乏显式正信号的问题,提出分布偏好优化(DiPO),通过选择性放大或抑制模型高置信度输出logits构建偏好分布对,实现细粒度遗忘,在TOFU和MUSE基准上取得最优遗忘质量与模型效用的平衡。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26080 2026-06-25 cs.LG cs.AI 新提交 91%

Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

被忽视的免费午餐:后训练中的进展优势用于LLM智能体

Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出进展优势概念,利用强化学习后训练中的隐式优势函数作为无标注、领域无关的步骤级评分,在测试时扩展、不确定性量化和失败归因中超越专用奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25556 2026-06-25 cs.CL cs.AI cs.LG 新提交 90%

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE:基于双模拟引导与动作反事实估计的LLM智能体策略优化

Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao

机构 * University of Chicago(芝加哥大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Stanford University(斯坦福大学) University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对分组强化学习中状态-动作信用分配不匹配问题,提出BiPACE优势估计器,通过双模拟引导的状态聚类和动作反事实基线,在无需批评网络或额外采样的前提下提升LLM智能体训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25509 2026-06-25 cs.RO cs.CV 新提交 89%

ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

ASSCG:自动驾驶中快慢LLM规划的恰到好处门控

Sining Ang, Yuan Chen, Liu Haiyan, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Lenovo Group Limited(联想集团)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25328 2026-06-25 cs.SD cs.AI 新提交 88%

Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection

语音深度伪造检测中鲁棒适应的语音基础模型监督后训练

Zihan Pan, Sailor Hardik, Jinyang Wu

机构 * Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(资讯通信研究院(I2R),新加坡科技研究局(A*STAR))

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.AI

AI总结 提出混合帧后训练策略,通过帧级监督学习局部不一致性,在ASVspoof5上实现单模型EER 4.50%,在ASVspoof2021上LA与DF的EER差距仅0.16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17967 2026-06-25 cs.CL 新提交 88%

Learning task-specific subspaces via interventional post-training of speech foundation models

通过语音基础模型的干预后训练学习任务特定子空间

Jack Cox, Jon Barker

机构 * University of Sheffield(谢菲尔德大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.CL

AI总结 提出一种干预对比学习后训练方法,将语音基础模型的纠缠表示分解为内容和说话人子空间,提升说话人验证和关键词识别性能。

Comments Accepted to Interspeech 2026; 6 pages (4 main body), 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00327 2026-06-25 cs.IR cs.AI 版本更新 87%

DynamicPO: Dynamic Preference Optimization for Recommendation

DynamicPO:基于推荐的动态偏好优化

Xingyu Hu, Kai Zhang, Jiancan Wu, Shuli Wang, Chi Wang, Wenshuai Chen, Yinhua Zhu, Haitao Wang, Xingxing Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Meituan(美团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DynamicPO框架,通过动态边界负样本选择和双边距动态beta调整,解决偏好优化崩溃问题,提升推荐准确性。

Comments DASFAA 2026 Best Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09910 2026-06-25 cs.CL 版本更新 86%

Learning to Erase Private Knowledge from Multi-Documents for Retrieval-Augmented Large Language Models

学习从多文档中擦除私有知识以用于检索增强型大语言模型

Yujing Wang, Jinwen Chen, Hainan Zhang, Liang Pang, Yongxin Tong, Binghui Guo, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究所) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 提出Eraser4RAG,通过构建全局知识图谱、划分私有与公共子图并微调Flan-T5重写文档,结合PPO优化,有效擦除用户定义的私有知识,保留公共知识,防御去匿名化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25906 2026-06-25 cs.CV cs.MM 新提交 82%

OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

OracleAnalyser:通过后训练的多模态大语言模型分析甲骨文的隐式语义

Zijia Song, Yelin Wang, Zhengyi Ma, Zitong Yu, Tianheng Wang, Jiahuan Zhang, Taorui Wang, Kaicheng Yu

机构 * National University of Defense Technology(国防科技大学) ShanghaiTech University(上海科技大学) Great Bay University(大湾区大学) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);preference optimization(abstract)

AI总结 提出OracleAnalyser推理框架,通过多阶段后训练和稳定焦点偏好优化算法,在3B参数模型上超越更大规模模型,实现甲骨文分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24994 2026-06-25 cs.LG cs.AI 新提交 76%

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

ExTra: 面向语言模型强化学习的探索性轨迹优化

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) SAP

专题命中 后训练与偏好优化 :language model(title);分类 cs.AI、cs.LG

AI总结 提出ExTra框架,通过新颖性奖励和熵引导前缀再生增强GRPO,在数学推理基准上提升pass@1约5%、pass@16约7%。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 73%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10913 2026-06-25 cs.AI cs.PL cs.SE 版本更新 70%

Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces

Shepherd: 一个为元代理提供形式化执行迹的运行时基座

Simon Yu, Derek Chong, Ananjan Nandi, Dilara Soylu, Jiuding Sun, Christopher D Manning, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。

Comments 50 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13814 2026-06-25 cs.IR 新提交 67%

TASR: Training-Free Adaptive Stopping for Iterative Retrieval

TASR:无需训练的迭代检索自适应停止规则

Adrian Kieback, Uyiosa Philip Amadasun, Aman Chadha, Aaron Elkins

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn)

AI总结 提出TASR,一种无需训练的迭代检索停止规则,通过重复答案检测和逻辑回归边际阈值减少冗余检索,在多种配置下保持高F1值并降低调用次数。

Comments 20 pages, 5 figures. Accepted at Agent4IR Workshop, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25451 2026-06-25 cs.LG cs.AI 新提交 62%

Learning with a Single Rollout via Monte Carlo Pass@k Critic

通过蒙特卡洛 Pass@k 评判器进行单次 rollout 学习

Fengdi Che, Yang Liu, Lei Yu, Meng Cao, Tong Che, Rupam Mahmood, Dale Schuurmans

机构 * University of Alberta(阿尔伯塔大学) BIGAI(北京通用人工智能研究院) University of Toronto(多伦多大学) McGill University, Mila(麦吉尔大学,米拉) Nvidia Research(英伟达研究院) Amii(阿尔伯塔机器智能研究所) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出单次 rollout 近端策略优化(SR-PPO),利用每个提示的一次 rollout 训练 token 级信用评判器,通过 Pass@k 成功概率提供更选择性学习信号,避免重复采样并改善信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19305 2026-06-25 cs.RO cs.AI cs.CV 版本更新 57%

PhyGile: Physics-Prefix Guided Motion Generation for Agile General Humanoid Motion Tracking

PhyGile: 面向敏捷通用人形运动跟踪的物理前缀引导运动生成

Jiacheng Bao, Haoran Yang, Yucheng Xin, Junhong Liu, Yuecheng Xu, Han Liang, Pengfei Han, Xiaoguang Ma, Dong Wang, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出PhyGile框架,通过物理前缀引导的机器人原生运动生成,结合课程混合专家训练和后训练,解决文本生成运动在机器人上物理不可行的问题,实现敏捷全身运动跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25706 2026-06-25 cs.RO 新提交 50%

Learning Asynchronous Upper-body Task-space Trajectory Tracking Policy for Humanoid Robots

学习人形机器人异步上肢任务空间轨迹跟踪策略

Yumeng Liu, Dongqi Wang, Jiyu Yu, Yijun Fan, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对规划与执行间的异步问题,提出异步上肢任务空间跟踪框架,通过教师-学生蒸馏初始化策略,结合滑动窗口全局奖励减少帧漂移,并利用MPC模块和自引导约束实现稀疏参考跟踪,仿真与硬件实验验证了低更新率下的优越性能。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏