arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 54 篇

2608.15956 2026-08-18 cs.AI 新提交 70%

Navigation-Informed Embeddings: Dense-Retriever Adaptation from Agent Search Traces

导航启发式嵌入:基于智能体搜索轨迹的密集检索器适配

Shrey Shah, Levent Ozgur

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出 NIE 方法,利用智能体检索轨迹无需额外标注即可适配密集检索器,在基准任务上提升了 Recall@20、长路径性能及 nDCG@10 指标,提供轻量适配通道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15930 2026-08-18 cs.AI cs.CV 新提交 70%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性

Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07780 2026-08-18 cs.LG cs.AI cs.CV 版本更新 62%

DirMixE: Harnessing Test Agnostic Long-tail Recognition with Hierarchical Label Variations

DirMixE:利用层次化标签变异实现测试无关长尾识别

Zhiyong Yang, Qianqian Xu, Sicong Li, Zitai Wang, Xiaochun Cao, Qingming Huang

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 DirMixE通过分层标签变异策略提升测试无关长尾识别性能,结合参数高效微调框架实现更稳定的模型泛化能力。

Comments Conference version: Zhiyong Yang, Qianqian Xu, Zitai Wang, Sicong Li, Boyu Han, Shilong Bao, Xiaochun Cao, and Qingming Huang. Harnessing Hierarchical Label Distribution Variations in Test Agnostic Long-tail Recognition. ICML, 56624-56664, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16384 2026-08-18 cs.CV cs.LG 新提交 57%

Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation

用于参数高效通用视觉适配的自路由张量适配器

Suraj Yadav

机构 * Indraprastha Institute of Information Technology Delhi(因德拉普拉斯信息技术学院德里分校)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 提出自路由张量适配器(SRTA),无需外部门控网络即可实现样本特定适配,在多领域视觉分类基准上,以更少参数达到与MoE式PEFT基线相当或更优的平均准确率。

Comments Accepted at ECCV Workshop 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15037 2026-08-18 cs.SD cs.LG 新提交 57%

Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

严重声学偏移下的原型修正迭代自监督流形去噪

Ashish Anand Shukla, Rini Smita Thakur, Aryan Das, Vinod K. Kurmi

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) Vellore Institute of Technology(韦洛尔理工大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 针对严重声学噪声下音频-文本基础模型的失效问题,提出无训练无数据源的TTA框架PRISM,在UrbanSound8K数据集上取得显著性能提升,还解决了复音陷阱问题。

Comments Accepted as a full paper at ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15900 2026-08-18 cond-mat.mtrl-sci cs.LG 新提交 57%

Crystal-structure design by agentic AI in a language of motifs

基于基元语言的智能体AI晶体结构设计

Dinh-Khiet Le, Minh-Quyet Ha, Hong-Phuc Vu-Dinh, Takashi Miyake, Hiori Kino, Hieu-Chi Dam

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 该研究提出智能体AI框架MatEvolve,以基元语言设计晶体,在贫稀土永磁体设计中发现新结构原型的频率是生成模型的三倍以上,可揭示结构-性能关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05714 2026-08-18 cs.AI 版本更新 57%

RA-CAD: Learning Post-Execution Critique for State-Aware Text-to-CAD Generation

RA-CAD:学习执行后批判的状态感知文本到CAD生成模型

Shuhao Yan, Changhao He, Peng Hu, Xi Peng

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 该研究针对文本到CAD生成的反馈利用不足问题,提出RA-CAD智能体,通过生成-执行-批判-重写循环结合CCB、FAO优化,在CADFusion和Text2CAD上实现最优性能。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04535 2026-08-18 cs.LG cs.DC 版本更新 57%

FDA-Opt: Federated Fine-Tuning via Dynamic Update Schedules

高效通信的联邦微调

Michael Theologitis, Vasilis Samoladas, Antonios Deligiannakis

机构 * University of Washington(华盛顿大学) Technical University of Crete(希腊塞萨洛尼基技术大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出FDA-Opt算法,解决联邦学习中参数通信频繁和刚性的难题,通过统一FDA和FedOpt方法,提升语言模型在下游NLP任务中的微调性能。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25783 2026-08-18 cs.CL 版本更新 57%

Subliminal Steering: Stronger Encoding of Hidden Signals

潜意识操控:更强大的隐藏信号编码

George Morgulis, John Hewitt

机构 * Columbia University(哥伦比亚大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文提出潜意识操控方法,通过训练转向向量增强隐藏信号传输,展示多词偏见传输、机制证据及高精度编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14750 2026-08-18 eess.IV cs.CV 新提交 50%

A Unified DINOv2-Based Framework for LVEF Estimation, GLS Dysfunction Classification, and Early Cardiotoxicity Prediction

基于DINOv2的左室射血分数估计、整体纵向应变功能障碍分类及早期心脏毒性预测统一框架

Xiaotong Zhang, Mingyue Cui, Qing Cao, Jingming Xia

专题命中 指令微调 :foundation model(abstract)

AI总结 本研究提出基于DINOv2的统一框架,结合LoRA与时序聚合等技术,实现LVEF估计、GLS功能障碍分类及早期心脏毒性预测,在多任务中取得良好性能,还引入专用模型优化LVEF估计。

Comments Accepted as an oral at the EchoRisk Challenge Workshop, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15353 2026-08-18 cs.CV 新提交 50%

Decomposing Whole Slide Image Report Generation with Graph-Constrained Multiple Instance Learning Workflows

用图约束的多实例学习工作流分解全切片图像报告生成

Antony Gitau, Martyna Borak, Bjørn-Jostein Singstad, Martin Paulson, Karl Thomas Hjelmervik, Ola Marius Lysaker, Veralia Gabriela Sanchez

机构 * Faculty of Technology, Natural Sciences and Maritime Sciences, University of South-Eastern Norway(东南挪威大学技术、自然科学与海洋科学学院) Center for Cancer and Blood Diseases, Vestfold Hospital Trust(西福尔信托医院癌症与血液疾病中心) Faculty of Biomedical Engineering, Silesian University of Technology(西里西亚工业大学生物医学工程学院)

专题命中 指令微调 :language model(abstract)

AI总结 该研究提出图约束的多实例学习分解框架,结合Virchow2嵌入与器官条件图,提升WSI报告生成性能,明确器官路由是域转移瓶颈,支持错误定位。

Comments Accepted at the MICCAI 2026 REG Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15045 2026-08-18 cs.CV 新提交 50%

MOSS-VL Technical Report

MOSS-VL 技术报告

Pengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen, Xingyang He, Huazheng Zeng, Jijun Cheng, Chenghao Wang, Xiaomeng Qian, Pengfei Wang, Zhan Huang, Shanqing Gao, Wei Huang, Longjun Cao, Wu Ran, Jie Liu, Changtai Zhu, Hongkai Wang, Yixian Tian, Chenghao Liu, Zhen Ye, Xinghao Wang, Botian Jiang, Guoguo Feng, Zhaoye Fei, Ruixiao Li, Mingshu Chen, Yang Gao, Qinyuan Cheng, Shimin Li, Xipeng Qiu

专题命中 指令微调 :language model(abstract)

AI总结 本研究提出开源视觉-语言模型MOSS-VL,通过全栈协同设计实现实时交互能力,在流式基准测试中表现优异,大幅领先同类开源模型,发布了相关检查点与代码。

Comments 22 pages. Project page: https://openmoss.ai/MOSS-VL/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 23 篇

2608.14629 2026-08-18 cs.CL cs.AI 新提交 93%

Inference-Time Mitigation of Adversarial Political Bias in Large Language Models

大语言模型推理时的对抗性政治偏见缓解

Tejaswi V. Panchagnula, Bruce Coburn, Bryce J. Dietrich, Robert X. Browning, Edward J. Delp, Fengqing Zhu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract)

AI总结 针对大语言模型的对抗性政治偏见漏洞,提出思维链提示与直接偏好优化等策略,其中递归自校正方法可显著提升模型的政治中立性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14579 2026-08-18 cs.AI 新提交 92%

SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization

SKILL:用于逻辑优化的自校正知识引导迭代大语言模型智能体

Rui Yang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对逻辑综合优化的挑战,提出SKILL智能体,结合多LLM推理与RL交互,经基准测试实现12.4%的PDA提升及86.3%的50万门级逻辑系统成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20357 2026-08-18 cs.CL 版本更新 92%

Language Models that Think, Chat Better

能思考、对话更出色的语言模型

Adithya Bhaskar, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出RLMT方法,将RLVR扩展至开放式任务,使语言模型生成长CoT推理,在多基准测试中优于RLHF,仅用少量提示训练的基础模型性能超多阶段后训练的指令微调模型

Comments COLM 2026; we release our code, data, and artifacts publicly at https://github.com/princeton-pli/RLMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16553 2026-08-18 cs.CL 新提交 90%

STAGE: Controlled Objective Admission for Multi-Preference LLM Alignment

STAGE:面向多偏好大语言模型对齐的可控目标准入

Yongqi Tong, Zhenyu Zhang, Ruirui Wang, Kewei Fu, Shaoqing Lin, Sijie Dong, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);RLHF(summary_cn,abstract);分类 cs.CL

AI总结 该研究针对多偏好LLM对齐的目标准入时机问题,提出稳定性引导的STAGE控制器,通过活动集扩展与探测排序等方法,在多偏好对齐任务中取得优于基线的自动评估结果,为RLHF提供新控制变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-18 cs.CR cs.AI 新提交 89%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 10 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16068 2026-08-18 cs.CL cs.AI 新提交 89%

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

CAPO:面向大语言模型智能体的感知约束提示优化

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

机构 * Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16739 2026-08-18 cs.LG 新提交 89%

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

Le Critique:用于大语言模型强化学习的特权值函数

Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

机构 * Mistral AI(米斯特拉尔人工智能公司) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15041 2026-08-18 cs.AI 新提交 89%

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

基于大语言模型的分层协调控制与感知延续性的策略学习

Changhong He, Jinda Gao, Xinkuan Liu, Le Zhang, Xizi Luo, Yu Mei

专题命中 后训练与偏好优化 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15504 2026-08-18 cs.LG stat.ML 新提交 88%

PERO: Efficient Robust Post-Training Foundation Models for Encrypted Traffic Classification

PERO:面向加密流量分类的高效鲁棒预训练后 foundation 模型

Wumei Du, Jiarong Wen, Kaiyu Zhang, Zi Yang, Yiqin Lv, Longfei Zhang, Dong Liang, Zheng Xie

机构 * National University of Defense Technology(国防科技大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对加密流量分类中鲁棒优化成本高的问题,提出PERO框架,通过轻量代理估计风险并选择高风险样本更新模型,在保持性能的同时降低了计算与内存成本。

Comments 16 pages, 6 figures, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15530 2026-08-18 cs.CL 新提交 84%

Why Summaries Turn Neutral: Policy Attribution for Sentiment Drift in Reinforcement Learning from Human Feedback

为何摘要变得中立:人类反馈强化学习中情感漂移的策略归因

Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova, Grigori Sidorov

机构 * Instituto Politécnico Nacional (IPN)(墨西哥国立理工学院) Centro de Investigación en Computación (CIC)(计算机研究中心)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文针对RLHF引发摘要情感漂移的问题,提出Policy Attribution框架溯源漂移来源,验证了跨语言漂移特性,并提出感知情感的正则化技术以降低漂移,且相关代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14791 2026-08-18 cs.AI 新提交 84%

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习

Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学) University of Tehran(德黑兰大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。

Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27366 2026-08-18 cs.CL 版本更新 84%

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16831 2026-08-18 cs.AI cs.CL 新提交 84%

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习

Minh-Ha Nguyen, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。

Comments PIHF method paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15284 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交 76%

VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示

Haolin Yang, Yuxing Long, Zihan Yang, Hao Dong

机构 * Peking University(北京大学) PrimeBot

专题命中 后训练与偏好优化 :prompting(title);分类 cs.CL、cs.AI

AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16072 2026-08-18 cs.LG cs.AI 新提交 73%

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法

Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun Fu, Nuno Vasconcelos, Yijiang Li

机构 * University of Florida(佛罗里达大学) UC San Diego(加州大学圣迭戈分校) Northeastern University(东北大学) Northwestern University(西北大学) Stanford University(斯坦福大学) Universität Innsbruck(因斯布鲁克大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09521 2026-08-18 cs.CL cs.AI 版本更新 73%

PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning

PEER:统一的过程-结果强化学习用于结构化共情推理

Yunxiao Wang, Meng Liu, Sicheng Zhao, Lizi Liao, Liqiang Nie

机构 * Shandong University(山东大学) Shandong Jianzhu University(山东建筑大学) Singapore Management University(新加坡管理大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 70%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16082 2026-08-18 cs.LG 新提交 70%

Towards Reasonable Molecular Structure Elucidation from Infrared Spectroscopy with Chemical Feedback

基于化学反馈的红外光谱合理分子结构解析研究

Yusen Tan, Hongyu Zhan, Hai-tao Yu, Changxi Chi, Wenjie Du, Jun Xia

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Westlake University(西湖大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);分类 cs.LG

AI总结 针对现有分子结构解析模型预测结果不合理的问题,提出化学反馈驱动的FIRMPO框架,在三类红外数据集上显著提升了解析准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏