arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1343 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 129 篇

2505.02299 2026-08-07 cs.LG cs.AI 版本更新 62%

ASAT: Adaptive Scoring and Thresholding with Human Feedback for Robust Out-of-Distribution Detection

ASAT:结合人类反馈的自适应评分与阈值方法用于鲁棒分布外检测

Daisuke Yamada, Harit Vishwakarma, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ASAT是结合人类反馈的人机协作框架,可实时更新评分函数与阈值,在静态条件下控制FPR并最大化TPR,非静态条件下适应分布漂移,在OpenOOD基准上性能优于现有方法。

Comments Published in TMLR (2026) with J2C Certification

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09842 2026-08-04 cs.LG cs.CL 版本更新 62%

From Direction to Magnitude: How Multimodal Instruction-Tuning Reorganizes the Geometric Encoding of Identity-Specifying Prompts in Transformer Hidden States

从方向到大小:多模态指令微调如何在Transformer隐藏状态中重新组织身份指定提示的几何编码

Jorge A. Castillo, Marco Torres Yévenes, Juan Carlos Lanas

机构 * Axis Dynamics SpA(轴动力公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 研究四种训练后模式的Transformer语言模型,通过五个几何指标比较三种提示条件,发现多模态指令微调会使身份编码从方向重组为大小,此重组特定于该模式,还定位了W_1作为方法贡献。

Comments 16 pages, 8 tables. Working draft v0.3. Uses Ollivier-Ricci curvature and edge-wise Wasserstein-1 as primary geometric statistic; four models (Gemma-4-E4B, Gemma-4-E4B-it, DeepSeek-R1-Distill-Qwen-7B, Qwen2.5-7B-Instruct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07343 2026-07-31 cs.CL cs.LG 版本更新 62%

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

个性化奖励基准:评估与人类对齐的个性化

Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出个性化奖励基准,用于评估奖励模型对个性化偏好的建模能力,发现现有模型在个性化任务中表现不佳,且该基准在下游任务中具有更高的预测相关性。

Comments Accepted to COLM 2026. Dataset: https://huggingface.co/datasets/QiyaoMa/Personalized-RewardBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21498 2026-07-29 cs.CL cs.AI 版本更新 62%

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

人工矫正:为什么大语言模型过度使用一种古典修辞格,以及如何缓解这一问题

Federico Boggia

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型过度使用矫正格修辞格的问题,基于模型与人类修辞风格差异及相关分类,提出用矫正格指数评分,通过测量发现校准错误,给出以LoRA适配器为中心的缓解技术、指令及适配器效果,强调校准到人类比率而非消除的重要性。

Comments 18 pages, 7 tables. v2: corrections to the classical sources (Quintilian, Cicero) and to several cited figures, and Appendix B corpus statistics aligned to the delivered dataset; measurements, results and conclusions unchanged. Data, code, and the trained LoRA adapter: https://federicoboggia.binatomy.com/pubblicazioni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07884 2026-07-29 cs.CL cs.AI 版本更新 62%

Contrastive Weak-to-strong Generalization

对比性弱到强泛化

Houcheng Jiang, Junfeng Fang, Jiaxin Wu, Tianyu Zhang, Chen Gao, Xiang Wang, Xiangnan He, Yang Deng

机构 * ustc(中国科学技术大学) nus(新加坡国立大学) zgc(中关村学院) smu(新加坡管理学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对弱到强泛化中弱模型输出噪声和偏差问题,利用隐式奖励与对比解码的联系,提出ConG框架,通过对比解码生成高质量样本,实现可靠能力转移等,经实证验证其有效性和通用性,推动了弱到强泛化及通向通用人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12447 2026-07-27 cs.LG cs.AI 版本更新 62%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11977 2026-07-16 cs.AI cs.CL 版本更新 62%

Optimization Is Not All You Need

优化并非你所需的全部

Minh Hua, Rita Raley

机构 * Scale AI(Scale人工智能公司) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究指出优化并非全部,以GPT - 2为例,通过追踪其预训练等环节的优化文化,发现优化程序虽能测文本可能性,但无法区分不可能性是错误还是创新,却在五年内获设定语言协议权威。

Comments This essay will be forthcoming in MFS Modern Fiction Studies, published by JHUP (Spring-Summer 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新 62%

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04773 2026-06-25 cs.LG cs.AI 版本更新 62%

Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning

分布偏好优化:大语言模型遗忘的细粒度视角

Kai Qin, Jiaqi Wu, Jianxiang He, Haoyuan Sun, Yifei Zhao, Xu Wang, Bin Liang, Yongzhe Chang, Cheng Li, Tiantian Zhang, Houde Liu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Jianghuai Advanced Technology Center(江淮先进技术中心) University of Technology Sydney(悉尼大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型遗忘中负偏好优化缺乏显式正信号的问题,提出分布偏好优化(DiPO),通过选择性放大或抑制模型高置信度输出logits构建偏好分布对,实现细粒度遗忘,在TOFU和MUSE基准上取得最优遗忘质量与模型效用的平衡。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 57%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00754 2026-08-11 cs.SE cs.LG 版本更新 57%

Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring

Themis: 训练鲁棒的多语言代码奖励模型以实现灵活的多标准评分

Indraneil Paul, Goran Glavaš, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(UKP实验室,德累斯顿理工大学及应用网络安全国家研究中心ATHENE)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出Themis-CodeRewardBench基准,评估多语言多标准代码奖励模型,训练了Themis-RM系列模型,展示了其在多语言迁移和多标准训练中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00997 2026-08-11 cs.CL 版本更新 57%

Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization

基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化

Gyuseok Lee, Wonbin Kweon, Zhenrui Yue, SeongKu Kang, Jiawei Han, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(高丽大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。

Comments COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03808 2026-08-06 cs.CV cs.LG 版本更新 57%

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

从暴力到语义洞察:基于LLM的性能引导数据转换设计

Usha Shrestha, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01715 2026-08-04 cs.AI 版本更新 57%

Distributionally Robust Listwise Preference Optimization

分布鲁棒列表偏好优化

Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 针对列表偏好排序标签不确定性,提出点态全变差鲁棒Plackett-Luce目标,将内层最大化简化为排序,在离线和在线设置中均具有理论保证,实验表明能保持干净标签性能并提升噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01350 2026-08-04 cs.CL 版本更新 57%

LLM Output Detectability and Task Performance Can be Jointly Optimized

大语言模型输出可检测性与任务性能可以联合优化

Koshiro Saito, Ryuto Koike, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心LLMC)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文提出PUPPET框架,通过强化学习优化大语言模型,使其输出更易检测且在下游任务中表现更优,实验表明其在长文问答、摘要和作文写作中均优于传统水印方法。

Comments 15 pages, 9 figures, 20 tables. Code: https://github.com/pakapaka333/PUPPET

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13434 2026-07-29 cs.CL 版本更新 57%

$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

$M^2PO$:用于机器翻译的多视角多对偏好优化

Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 研究针对机器翻译中主流方法受误导性奖励信号影响的问题,提出$M^2PO$框架,通过双视角机制和多对目标优化偏好,实验证明该框架能使模型性能提升,超越开源基线并接近专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14032 2026-07-28 cs.CL 版本更新 57%

RM-Distiller: Exploiting Generative LLM for Reward Model Distillation

RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏

Hongli Zhou, Hui Huang, Wei Liu, Chenglong Wang, Xingyuan Bu, Lvyuan Han, Fuhai Song, Muyun Yang, Wenhao Jiang, Hailong Cao, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。

Comments Accepted to IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20556 2026-07-27 cs.AI 版本更新 57%

KeySI: An Interaction Framework for Tuning Text Embeddings Based on Human Feedback

KeySI:基于人类反馈调整文本嵌入的交互框架

Yan Zhu, Y. Chen, Rebecca Faust

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究针对预训练语言模型调整难的问题,提出KeySI交互框架,通过基于关键词的概念规范实现特征级反馈,减少人工文档处理需求,经用户研究等评估,证明其能有效捕捉用户意图并改善嵌入对齐。

Comments Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14473 2026-07-16 cs.CL 版本更新 57%

AI Can Learn Scientific Taste

AI 可以学习科学品味

Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou, Weijie Ma, Zhiheng Xi, Hongji Chen, Xiaoran Liu, Qinyuan Cheng, Ming Zhang, Qiguang Chen, Weifeng Ge, Qipeng Guo, Tianlei Ying, Tianxiang Sun, Yining Zheng, Xinchi Chen, Jun Zhao, Ning Ding, Xuanjing Huang, Yu-Gang Jiang, Xipeng Qiu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出RLCF框架,通过社区反馈学习科学品味,使AI能提出高潜力研究想法,实验显示其优于现有模型并具备泛化能力。

Comments 46 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09570 2026-07-15 cs.CL cs.HC 版本更新 57%

UXBench: Benchmarking User Experience in AI Assistants

UXBench:AI助手中的用户体验基准测试

Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, Yuan Hua, Qi Zhu, Shuo Jiang, Chenxuan Ma, Yuanmeng Zhang, Jian Song, Minlong Peng, Di Liang, Davey Chen

机构 * Hong Kong Polytechnic University(香港理工大学) Tencent(腾讯)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出首个基于真实用户反馈的用户中心基准UXBench,包含三个任务和7400个测试实例,评估26个前沿语言模型,发现用户反馈预测是可学习的能力,并揭示了LLM作为评判者的系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06362 2026-07-14 cs.AI 版本更新 57%

Do Implicit Personalization and Explicit Styles Conflict? PsPLUG: A Lightweight Plug-in for Balancing Personalization and Style in Customized LLMs

隐式个性化与显式风格冲突吗?PsPLUG:用于在定制大语言模型中平衡个性化与风格的轻量级插件

Yutong Song, Jiang Wu, Shaofan Yuan, Chengze Shen, Jian Wang, Yu Wang, Nikil Dutt, Amir M. Rahmani

机构 * University of California, Irvine(加州大学伊文斯顿分校) TikTok Inc.(TikTok公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究个性化大语言模型中显式风格指令与隐式用户偏好冲突问题,提出轻量级插件PsPLUG,它能在考虑风格后学习用户特定残差并可调整个性化强度,实验证明其能更好平衡个性化与风格遵循,保留用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 57%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07533 2026-06-29 cs.AI 版本更新 57%

Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

联合奖励建模:将思维链内化以实现高效的视觉奖励模型

Yankai Yang, Yancheng Long, Hongyang Wei, Wei Chen, Tianke Zhang, Kaiyu Jiang, Haonan Fan, Changyi Liu, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出联合奖励建模(JRM),通过共享视觉-语言骨干联合优化偏好学习和语言建模,将生成模型的语义推理能力内化到判别表示中,实现快速准确评估,在MMRB2和EditReward-Bench上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26518 2026-06-26 cs.AI cs.HC 版本更新 57%

Human-AI Complementarity: A Goal for Amplified Oversight

人机互补:增强监督的目标

Rishub Jain, Sophie Bridgers, Lili Janzer, Rory Greig, Tian Huey Teh, Vladimir Mikulik

机构 * Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 针对AI输出的事实核查问题,结合AI评分与人类评分优于单独使用任一方法,但AI辅助类型影响信任度,为超越人类专家性能的AI系统监督提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00327 2026-06-25 cs.IR cs.AI 版本更新 57%

DynamicPO: Dynamic Preference Optimization for Recommendation

DynamicPO:基于推荐的动态偏好优化

Xingyu Hu, Kai Zhang, Jiancan Wu, Shuli Wang, Chi Wang, Wenshuai Chen, Yinhua Zhu, Haitao Wang, Xingxing Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Meituan(美团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出DynamicPO框架,通过动态边界负样本选择和双边距动态beta调整,解决偏好优化崩溃问题,提升推荐准确性。

Comments DASFAA 2026 Best Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新 57%

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01463 2026-06-15 cs.RO cs.AI cs.HC 版本更新 57%

Low-Burden LLM-Based Preference Learning: Personalizing Assistive Robots from Natural Language Feedback for Users with Paralysis

基于低负担LLM的偏好学习:通过自然语言反馈为瘫痪用户个性化辅助机器人

Keshav Shankar, Dan Ding, Wei Gao

机构 * Electrical and Computer Engineering(电气与计算机工程) Rehabilitation Science and Technology(康复科学与技术)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 针对严重运动障碍用户,提出一种低负担离线框架,利用大语言模型将非结构化自然语言反馈转化为确定性机器人控制策略,并通过职业治疗框架解码用户需求,显著降低用户负担。

Comments Accepted to IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08982 2026-06-10 cs.AI 版本更新 57%

Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

Baichuan-M4:面向持续照护的临床级医疗智能体系统

Aiyuan Yang, Canbin Piao, Chengfeng Dou, Da Pan, Dian Wang, Fan Yang, Fei Deng, Fei Li, Guangwei Ai, Hui Liu, Hongda Zhang, Jinyang Tai, Kai Lu, Lijun Liu, Linwei Chen, Linyu Li, Meiqing Guo, Peidong Guo, Qiang Ju, Rihui Xin, Shuai Wang, XinKai Ma, Xudong Chen, Yichuan Mo, Yijie Zhou, Leyi Pan, Yihe Luo, Zian Wang

机构 * Baichuan AI(百川智能) THUBPM Group, Tsinghua University(清华大学THUBPM课题组)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 提出Baichuan-M4临床级医疗大模型,通过统一运行时、持续照护强化学习框架和临床工具层三大支柱构建智能体系统,在多项医疗评估中取得领先结果,幻觉率降至3.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06114 2026-06-09 cs.AI 版本更新 57%

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

走向健康进化:探索人机交互在自我进化系统中的作用与机制

Dianxing Shi, Bowen Wang, Junqi He, Junhao Chen, Yuta Nakashima

机构 * The University of Osaka(大阪大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 提出ANCHOR框架,通过模拟人类监督的反馈机制,在自我进化系统中缓解能力退化与安全漂移,实验表明有限监督可显著提升安全性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01357 2026-06-09 cs.LG 版本更新 57%

Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning

你的自对弈算法其实是一个对抗性模仿者:通过模仿学习的视角理解LLM自对弈

Shangzhe Li, Xuchao Zhang, Chetan Bansal, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文通过将自对弈微调建模为模型与自身参数化的正则化隐式奖励玩家之间的极小极大博弈,统一了自对弈模仿与偏好对齐,并提出了基于χ²散度的新算法,在多种语言模型微调任务上优于现有方法。

Comments 26 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏