Navigation-Informed Embeddings: Dense-Retriever Adaptation from Agent Search Traces
导航启发式嵌入:基于智能体搜索轨迹的密集检索器适配
专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出 NIE 方法,利用智能体检索轨迹无需额外标注即可适配密集检索器,在基准任务上提升了 Recall@20、长路径性能及 nDCG@10 指标,提供轻量适配通道。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
导航启发式嵌入:基于智能体搜索轨迹的密集检索器适配
专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出 NIE 方法,利用智能体检索轨迹无需额外标注即可适配密集检索器,在基准任务上提升了 Recall@20、长路径性能及 nDCG@10 指标,提供轻量适配通道。
UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体
机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)
专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI
AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性
Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io
DirMixE:利用层次化标签变异实现测试无关长尾识别
专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 DirMixE通过分层标签变异策略提升测试无关长尾识别性能,结合参数高效微调框架实现更稳定的模型泛化能力。
Comments Conference version: Zhiyong Yang, Qianqian Xu, Zitai Wang, Sicong Li, Boyu Han, Shilong Bao, Xiaochun Cao, and Qingming Huang. Harnessing Hierarchical Label Distribution Variations in Test Agnostic Long-tail Recognition. ICML, 56624-56664, 2024
用于参数高效通用视觉适配的自路由张量适配器
机构 * Indraprastha Institute of Information Technology Delhi(因德拉普拉斯信息技术学院德里分校)
专题命中 指令微调 :foundation model(abstract);分类 cs.LG
AI总结 提出自路由张量适配器(SRTA),无需外部门控网络即可实现样本特定适配,在多领域视觉分类基准上,以更少参数达到与MoE式PEFT基线相当或更优的平均准确率。
Comments Accepted at ECCV Workshop 2026 (Archival Track)
严重声学偏移下的原型修正迭代自监督流形去噪
机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) ; Vellore Institute of Technology(韦洛尔理工大学)
专题命中 指令微调 :foundation model(abstract);分类 cs.LG
AI总结 针对严重声学噪声下音频-文本基础模型的失效问题,提出无训练无数据源的TTA框架PRISM,在UrbanSound8K数据集上取得显著性能提升,还解决了复音陷阱问题。
Comments Accepted as a full paper at ACM CIKM 2026
基于基元语言的智能体AI晶体结构设计
专题命中 指令微调 :language model(abstract);分类 cs.LG
AI总结 该研究提出智能体AI框架MatEvolve,以基元语言设计晶体,在贫稀土永磁体设计中发现新结构原型的频率是生成模型的三倍以上,可揭示结构-性能关系。
RA-CAD:学习执行后批判的状态感知文本到CAD生成模型
专题命中 指令微调 :language model(abstract);分类 cs.AI
AI总结 该研究针对文本到CAD生成的反馈利用不足问题,提出RA-CAD智能体,通过生成-执行-批判-重写循环结合CCB、FAO优化,在CADFusion和Text2CAD上实现最优性能。
Comments 17 pages, 7 figures
高效通信的联邦微调
机构 * University of Washington(华盛顿大学) ; Technical University of Crete(希腊塞萨洛尼基技术大学)
专题命中 指令微调 :language model(abstract);分类 cs.LG
AI总结 本文提出FDA-Opt算法,解决联邦学习中参数通信频繁和刚性的难题,通过统一FDA和FedOpt方法,提升语言模型在下游NLP任务中的微调性能。
Comments CIKM 2026
潜意识操控:更强大的隐藏信号编码
机构 * Columbia University(哥伦比亚大学)
专题命中 指令微调 :language model(abstract);分类 cs.CL
AI总结 本文提出潜意识操控方法,通过训练转向向量增强隐藏信号传输,展示多词偏见传输、机制证据及高精度编码。
基于DINOv2的左室射血分数估计、整体纵向应变功能障碍分类及早期心脏毒性预测统一框架
专题命中 指令微调 :foundation model(abstract)
AI总结 本研究提出基于DINOv2的统一框架,结合LoRA与时序聚合等技术,实现LVEF估计、GLS功能障碍分类及早期心脏毒性预测,在多任务中取得良好性能,还引入专用模型优化LVEF估计。
Comments Accepted as an oral at the EchoRisk Challenge Workshop, MICCAI 2026
用图约束的多实例学习工作流分解全切片图像报告生成
机构 * Faculty of Technology, Natural Sciences and Maritime Sciences, University of South-Eastern Norway(东南挪威大学技术、自然科学与海洋科学学院) ; Center for Cancer and Blood Diseases, Vestfold Hospital Trust(西福尔信托医院癌症与血液疾病中心) ; Faculty of Biomedical Engineering, Silesian University of Technology(西里西亚工业大学生物医学工程学院)
专题命中 指令微调 :language model(abstract)
AI总结 该研究提出图约束的多实例学习分解框架,结合Virchow2嵌入与器官条件图,提升WSI报告生成性能,明确器官路由是域转移瓶颈,支持错误定位。
Comments Accepted at the MICCAI 2026 REG Challenge
MOSS-VL 技术报告
专题命中 指令微调 :language model(abstract)
AI总结 本研究提出开源视觉-语言模型MOSS-VL,通过全栈协同设计实现实时交互能力,在流式基准测试中表现优异,大幅领先同类开源模型,发布了相关检查点与代码。
Comments 22 pages. Project page: https://openmoss.ai/MOSS-VL/
大语言模型推理时的对抗性政治偏见缓解
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract)
AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。
SKILL:用于逻辑优化的自校正知识引导迭代大语言模型智能体
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对逻辑综合优化的挑战,提出SKILL智能体,结合多LLM推理与RL交互,经基准测试实现12.4%的PDA提升及86.3%的50万门级逻辑系统成功率。
能思考、对话更出色的语言模型
机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) ; Princeton University(普林斯顿大学)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)
AI总结 本文提出RLMT方法,将RLVR扩展至开放式任务,使语言模型生成长CoT推理,在多基准测试中优于RLHF,仅用少量提示训练的基础模型性能超多阶段后训练的指令微调模型
Comments COLM 2026; we release our code, data, and artifacts publicly at https://github.com/princeton-pli/RLMT
STAGE:面向多偏好大语言模型对齐的可控目标准入
机构 * Ant International(蚂蚁国际)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);RLHF(summary_cn,abstract);分类 cs.CL
AI总结 该研究针对多偏好LLM对齐的目标准入时机问题,提出稳定性引导的STAGE控制器,通过活动集扩展与探测排序等方法,在多偏好对齐任务中取得优于基线的自动评估结果,为RLHF提供新控制变量。
用米尔格拉姆范式测量大型语言模型对权威的服从性
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI
AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。
Comments 10 pages, 7 figures,
CAPO:面向大语言模型智能体的感知约束提示优化
机构 * Microsoft(微软)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。
Le Critique:用于大语言模型强化学习的特权值函数
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。
基于大语言模型的分层协调控制与感知延续性的策略学习
专题命中 后训练与偏好优化 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI
AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。
Comments 30 pages, 5 figures
PERO:面向加密流量分类的高效鲁棒预训练后 foundation 模型
机构 * National University of Defense Technology(国防科技大学)
专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.LG
AI总结 针对加密流量分类中鲁棒优化成本高的问题,提出PERO框架,通过轻量代理估计风险并选择高风险样本更新模型,在保持性能的同时降低了计算与内存成本。
Comments 16 pages, 6 figures, 6 tables, conference
为何摘要变得中立:人类反馈强化学习中情感漂移的策略归因
机构 * Instituto Politécnico Nacional (IPN)(墨西哥国立理工学院) ; Centro de Investigación en Computación (CIC)(计算机研究中心)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 本文针对RLHF引发摘要情感漂移的问题,提出Policy Attribution框架溯源漂移来源,验证了跨语言漂移特性,并提出感知情感的正则化技术以降低漂移,且相关代码将公开。
CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习
机构 * Sharif University of Technology(谢里夫理工大学) ; University of Tehran(德黑兰大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。
Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo
BridgeAlign:面向人文社科的偏好对齐框架
机构 * Alibaba Group(阿里巴巴集团) ; Ant Group(蚂蚁集团)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。
结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt University Medical Center(范德堡大学医学中心)
专题命中 后训练与偏好优化 :post-training(title);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。
Comments PIHF method paper
VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示
机构 * Peking University(北京大学) ; PrimeBot
专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL、cs.AI
AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。
Comments accepted by ACM MM 2026
学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法
机构 * University of Florida(佛罗里达大学) ; UC San Diego(加州大学圣迭戈分校) ; Northeastern University(东北大学) ; Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; Universität Innsbruck(因斯布鲁克大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。
Comments 14 pages, 2 figures
PEER:统一的过程-结果强化学习用于结构化共情推理
机构 * Shandong University(山东大学) ; Shandong Jianzhu University(山东建筑大学) ; Singapore Management University(新加坡管理大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。
伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理
机构 * Stony Brook University(石溪大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。
基于化学反馈的红外光谱合理分子结构解析研究
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Westlake University(西湖大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);分类 cs.LG
AI总结 针对现有分子结构解析模型预测结果不合理的问题,提出化学反馈驱动的FIRMPO框架,在三类红外数据集上显著提升了解析准确性。