arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-26 至 2026-06-26 共收录 270 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 25 篇

2512.07407 2026-06-26 cs.CL 版本更新 79%

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新 79%

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.AI

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17916 2026-06-26 cs.CV 版本更新 78%

EndoUFM: Utilizing Foundation Models for Monocular depth estimation of endoscopic images

EndoUFM:利用基础模型进行内窥镜图像的单目深度估计

Xinning Yao, Bo Liu, Bojian Li, Jingjing Wang, Jinghua Yue, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26578 2026-06-26 cs.AI 新提交 77%

EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling

EvoOptiGraph:基于图结构生成的弱点驱动协同进化优化建模

Qingcan Kang, Mingyang Liu, Xiaojin Fu, Shixiong Kai, Tao Zhong, Mingxuan Yuan

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 提出EvoOptiGraph框架,通过图结构表示混合整数线性规划并应用进化算子生成多样实例,结合监督微调和强化学习实现数据与模型的协同进化,显著提升优化建模的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25450 2026-06-26 cs.LG cs.CL 新提交 73%

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

泛化谱:一种评估学习算法的色谱方法

Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai

机构 * ByteDance Seed(字节跳动Seed) Hong Kong University of Science and Technology(香港科技大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出泛化谱框架,通过构建从精确回忆到跨语言实现转移等不同转移距离的测试变体,揭示算法从单个样本泛化到其他样本的程度,并应用于竞争编程任务评估不同学习范式。

Comments Accepted at ICML 2026. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21097 2026-06-26 cs.CL cs.LG 新提交 73%

GRAG: Generic Response-Augmented Generation Framework for Personalized Conversational Systems

GRAG:面向个性化对话系统的通用响应增强生成框架

Junfeng Liu, Christopher T. Symons, Ranga Raju Vatsavai

机构 * North Carolina State University(北卡罗来纳州立大学) Lirio, Inc.(Lirio公司)

专题命中 指令微调 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GRAG框架,通过离线通用响应解耦内容基础与个性化,使小模型在资源受限环境中专注于个性化注入,性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11061 2026-06-26 cs.LG cs.CL 版本更新 73%

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs

虚假奖励悖论:从机制上理解RLVR如何在LLMs中激活记忆捷径

Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Longyue Wang, Chenyang Lyu

机构 * University of Science and Technology of China(中国科学技术大学) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究RLVR中虚假奖励导致模型依赖记忆而非推理的机制,发现锚定-适配器电路,并通过因果干预验证其作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26942 2026-06-26 cs.CV 新提交 71%

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

TraMP-LLaMA: 基于解耦指令微调的生成式可解释性用于面部表情质量评估

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

机构 * School of Computer Science University of Bristol(布里斯托大学计算机科学学院) Translational Health Sciences University of Bristol(布里斯托大学转化健康科学学院) School of Computing and Communications Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 指令微调 :instruction tuning(title)

AI总结 提出TraMP-LLaMA多模态框架,融合外观和轨迹特征,采用解耦指令微调策略,联合预测严重度并生成结构化文本报告,在PFED5-plus数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26379 2026-06-26 cs.CV 新提交 71%

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

基于可微搜索的视觉基础模型层特定提示融合发现

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

机构 * UAB(阿拉巴马大学伯明翰分校) CMU(卡内基梅隆大学) Tulane(杜兰大学) UMKC(密苏里大学堪萨斯分校) UGA(佐治亚大学) ORNL(橡树岭国家实验室)

专题命中 指令微调 :foundation model(title)

AI总结 研究视觉提示微调中提示与图像令牌的融合方案,提出可微架构搜索方法联合优化可学习提示及其融合方式,在34个数据集上取得一致提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26987 2026-06-26 cs.CL cs.AI 新提交 62%

Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs

模型在哪里找到幸福?开源大语言模型中的情感向量

Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在开源模型中复现情感向量,发现效价几何结构在层间分布存在差异,且唤醒度编码受语料影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26620 2026-06-26 cs.LG cs.AI 新提交 62%

Discovering Millions of Interpretable Features with Sparse Autoencoders

利用稀疏自编码器发现数百万可解释特征

XinYang He, Wei Wang, Bing Zhao, Xuan Ren, WenBo Li, WeiXu Qiao, Hu Wei, Lin Qu

机构 * AI DATA, Alibaba Group Holding Limited(阿里巴巴集团控股有限公司 AI DATA) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Qwen3-Instruct SAE,在Qwen3指令微调模型系列上训练稀疏自编码器,通过激活级和模型级评估揭示稀疏性-保真度权衡,并展示其在拒绝行为引导中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26290 2026-06-26 cs.LG cs.AI 新提交 62%

SSM Adapters via Hankel Reduced-order Modeling: Injection Site Determines Task Suitability in Long-Context Fine-Tuning

通过Hankel降阶建模的SSM适配器:注入位置决定长上下文微调中的任务适用性

Omanshu Thapliyal

机构 * Hitachi America Ltd.(日立美洲有限公司)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Hankel降阶模型(HRM)适配器,一种基于SSM的残差模块,通过平衡截断初始化,在长上下文任务中优于LoRA,并支持FFT并行扫描。

Comments 14 pages, 12 figures, HiLD Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26112 2026-06-26 cs.CL cs.AI 新提交 62%

From Lexicon to AI: A Structured-Data Pipeline for Specialized Conversational Systems in Low-Resource Languages

从词汇到AI:低资源语言中专有对话系统的结构化数据流水线

Siddhant Hitesh Mantri, Dhara Gorasiya, Malhar Kulkarni, Pushpak Bhattacharya

机构 * NMIMS, Mumbai(NMIMS孟买分校) CFILT, IIT Bombay(印度理工学院孟买分校CFILT)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用专家编纂的词汇数据库(如印地语WordNet)生成指令对,微调12B参数语言模型,构建低资源语言专用对话系统,在教育任务中效果优于通用模型。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27091 2026-06-26 cs.CR cs.AI 新提交 57%

Inherited Circuits, Learned Semantics: How Fine-Tuning Creates Evasion Vulnerabilities Invisible to Standard Evaluation

继承的电路,学习的语义:微调如何创建标准评估不可见的规避漏洞

Ryan Fetterman

机构 * Cisco Talos(思科 Talos)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI

AI总结 研究微调如何引入安全分类模型的规避漏洞,通过因果干预定位继承电路,提出预部署监测方法,发现微调扩展了规避面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26618 2026-06-26 cs.CL 新提交 57%

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调

Phannet Pov, Sovandara Chhoun, Hyun Woo Park, Wan-Sup Cho, Saksonita Khoeurn

机构 * Department of Big Data, Chungbuk National University(Chungbuk National University大数据系) Institute of Digital Research and Innovation, Cambodia Academy of Digital Technology(柬埔寨数字技术研究院) Department of Management Information Systems, Chungbuk National University(Chungbuk National University管理信息系) BigData Labs Co., Ltd.(BigData Labs公司)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 针对高棉语和韩语,使用LoRA微调VoxCPM2模型,在仅训练0.19%-3.03%参数的情况下,高棉语MOS从3.85提升至4.23,而韩语无提升,表明适配主要帮助基础模型表现差的语言。

Comments 5 pages, 1 figure, 4 tables. IEEE conference format (IEEEtran)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02564 2026-06-26 cs.CV 版本更新 50%

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

VLMs 是视频推理的好老师:通过自适应测试时优化

Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan, Kun Gai, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 指令微调 :language model(abstract)

AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。

Comments Project Page: https://VLM-as-Teacher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 19 篇

2606.26583 2026-06-26 cs.CE 新提交 93%

Preference Optimization Drives Monoculture in LLM Prediction Markets

偏好优化导致LLM预测市场中的单一文化

James Begin, Brendan Gho, Suman Muppavarapu, Tyson Tsay, Atharva Mohan, Afnan Shaik, Ruizhe Li, Vasu Sharma, Archana Vaidheeswaran

专题命中 后训练与偏好优化 :LLM(title,title_cn);preference optimization(title,abstract);SFT(abstract,abstract_cn)

AI总结 研究发现,使用直接偏好优化(DPO)微调的LLM代理在预测市场中产生高度相关的错误,导致集体预测能力远低于独立代理数量,且该现象由偏好优化驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20632 2026-06-26 cs.CL cs.AI cs.CY 新提交 93%

Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior

后训练配方,而非模型家族,塑造多智能体LLM对话行为

Luyang Zhang, Jialu Wang, Fei Xue, Yi-Yun Chu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过大规模语料库和因子实验发现,后训练配方(如推理蒸馏)对多LLM对话行为(如回避性回答)的影响超过模型家族,表明模型家族不能完全代表对话多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26787 2026-06-26 cs.LG cs.AI cs.CL 新提交 91%

AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

AIGP:基于LLM的电商定价长期价值对齐框架

Chennan Ma, Yanning Zhang, Siqi Hong, Xiuchong Wang, Fei Xiao, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出AIGP框架,利用大语言模型结合领域知识与结构化数据,通过离线强化学习训练的长期价值评估器进行偏好优化,实现可解释的定价决策,在淘宝工厂的在线实验中GMV提升13.21%。

Comments Accepted by KDD 2026 Applied Data Science Track (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26671 2026-06-26 cs.AI 新提交 91%

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

NebulaExp-8B:基于全尺度消融研究的经验性后训练流程

Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

机构 * ZTE NebulaL0 Post-Training Team(中兴通讯NebulaL0后训练团队)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出NebulaExp透明后训练流程,基于Qwen3-8B-base,通过数据清洗、三阶段SFT和GRPO RL优化指令与推理分支,并探索OPD/MOPD替代RL,在8B模型上实现性能提升。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26917 2026-06-26 cs.LG cs.AI 新提交 90%

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

GEOALIGN: 用于鲁棒大语言模型强化学习的几何轨迹策展

Ting Zhou, Zhenqing Ling, Yiyang Zhao, Ying Shen, Daoyuan Chen

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对在线强化学习训练LLM时奖励噪声导致的不稳定性,提出GEOALIGN,通过检测并修正方向不一致的轨迹来稳定更新,提升最终性能并减少训练震荡。

Comments Accepted as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26899 2026-06-26 cs.AI 新提交 87%

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

基于扩散Transformer的生成式检索:度量有序序列训练与混合策略偏好优化

Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

机构 * Peking University(北京大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 针对模式保持的属性检索任务,提出MO-DiT+HPPO框架,通过度量有序训练和混合策略偏好优化,在八个领域分割中七个取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25524 2026-06-26 cs.AI cs.CL 新提交 86%

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点

Jaeyong Ko, Pilsung Kang, Yukyung Lee

机构 * Seoul National University(首尔大学) Boston University(波士顿大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交 82%

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26327 2026-06-26 cs.LG cs.AI 新提交 82%

EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning

EVOM:用于强化学习的演员-评论家架构的智能体元进化

Boyun Zhang, Chao Wang, Kai Wu

机构 * Xidian University(西安电子科技大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出EVOM框架,通过双层优化(内环低保真PPO训练权重,外环LLM设计智能体驱动元进化)自动搜索高性能演员-评论家架构,在Ant-v4和HalfCheetah-v4上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20657 2026-06-26 cs.AI cs.LG 新提交 81%

A-Evolve-Training: Autonomous Post-Training of a 30B Model

A-Evolve-Training: 30B模型的自主后训练

Zhan Shi, Bing He, Yisi Sang, Hanqing Lu, Benoit Dumoulin

机构 * A-EVO-Lab, Amazon(亚马逊A-EVO实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一个无需人工干预的自主后训练系统,对30B参数模型进行多轮训练,在NVIDIA排行榜上接近人类最佳成绩,并展示了系统能自主发现并修正指标误导问题。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27305 2026-06-26 cs.CV 新提交 75%

Sculpting NeRF Geometry: Human-Preference Fine-Tuning of a 3D-Aware Face GAN

雕刻NeRF几何:基于人类偏好的3D感知人脸GAN微调

Archer Moore, Mingming Gong, Liam Hodgkinson

机构 * School of Mathematics and Statistics, The University of Melbourne(墨尔本大学数学与统计学院)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);pretraining(abstract)

AI总结 提出直接对辐射场密度值进行人类偏好强化学习微调,无需网格或形状先验,显著改善3D人脸几何,在74.4%的成对比较中用户偏好微调后的几何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17314 2026-06-26 cs.CL cs.AI cs.LG 版本更新 75%

Weak-to-Strong Elicitation via Mismatched Wrong Drafts

通过不匹配的错误草稿实现弱到强的引导

Wei Deng

机构 * Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了通过较小较弱模型的不匹配错误草稿引导更强学习者的能力,发现这种策略在MATH-500和AIME 2025/2026等任务上表现优异,主要贡献是提出了一种有效的训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27291 2026-06-26 cs.LG 新提交 70%

Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

设计便携查询生成的奖励信号:工业语义职位搜索案例研究

Ping Liu, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Rajat Arora, Yunxiang Ren, Chunnan Yao, Dan Xu, Baofen Zheng, Wanjun Jiang, Andrii Soviak, Kevin Kao, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出RLAIF框架生成便携职位搜索查询,通过奖励塑造解决策略优化中的奖励黑客问题,实验表明稳健奖励设计比优化器选择更关键。

Comments Accepted to KDD 2026 Workshop on AI Agent for Information Retrieval (Agent4IR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07295 2026-06-26 cs.CV cs.AI cs.LG 版本更新 62%

Reconstruction Alignment Improves Unified Multimodal Models

重建对齐改进统一多模态模型

Ji Xie, Trevor Darrell, Luke Zettlemoyer, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。

Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏