arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-10 至 2026-06-10 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2606.10078 2026-06-10 cs.IR 新提交 90%

Mult-DPO: Multinomial Direct Preference Optimization for Recommender Systems

Mult-DPO:用于推荐系统的多项直接偏好优化

Yaochen Zhu, Harald Steck, James McInerney, Aditya Sinha, Yinhan He, Nathan Kallus, Jundong Li

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract)

AI总结 针对推荐系统中集合级偏好(多个正项)的LLM对齐问题,提出Mult-DPO,通过可计算的多项式替代似然实现直接偏好优化,并证明其是边际化Plackett-Luce DPO损失的可计算上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10217 2026-06-10 cs.LG cs.CR 新提交 89%

Alignment Defends LLMs from Property Inference Attacks

对齐防御LLM免受属性推断攻击

Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(伯克利大学Simons研究所)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 提出基于对齐的防御方法,通过后训练调整模型输出分布,在不修改训练数据的情况下缓解属性推断攻击,并保持效用与机密性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09850 2026-06-10 cs.LG cs.CL 新提交 88%

Mechanistic Analysis of Alignment Algorithms in Language Models

语言模型中对齐算法的机制分析

Aarush Sinha, Ishan Garg, Veeraraju Elluru, Arth Singh, Kushal Garg

机构 * University of Copenhagen(哥本哈根大学) Independent(独立研究者) IIT Jodhpur(印度理工学院焦特布尔分校) NIT Agartala(印度国立理工学院阿加尔塔拉分校) Narris

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文通过层间线性探针、稀疏自编码器和交叉编码器,系统分析了六种偏好优化方法在语言模型中的内部机制,发现不同目标函数导致不同的表示几何变换,并揭示了行为对齐与内部结构变化的不一致性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10569 2026-06-10 cs.CL cs.AI 新提交 85%

Hidden Consensus:Preference-Validity Compression in Human Feedback

隐藏共识:人类反馈中的偏好有效性压缩

Dorcas Chia Ern Chua, Karen Myn Hui Lee, Jia Yue Tan, Zhen Xue Gue, Norzalena Abdul Hamid, Azima Binti Azmi, Keat Mei Yeong, Aizat Izyani binti Mujab, Hafsah Noor Azam, Chee Guo Khoo, Han Ying Lim, Chee Seng Chan

机构 * YTL AI Labs Universiti Malaya(马来亚大学) Monash University Malaysia(莫纳什大学马来西亚校区) Universiti Malaysia Sarawak(马来西亚沙捞越大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出偏好有效性压缩问题,即RLHF将多元有效反馈压缩为单一奖励目标,导致对齐测量偏差。通过马来西亚语料分析,79%的提示存在多个多数支持响应,表明多数聚合测量的是argmax可接受性而非多元对齐。

Comments 28 pages. When AI learns from human feedback, it forces a single "correct" answer, but sometimes multiple answers are all genuinely valid, and that nuance gets thrown away

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10860 2026-06-10 cs.CR cs.CL 新提交 84%

Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

训练LLM通过重力加权直接偏好优化强制执行多级指令层次结构

Lena S. Bolliger, Lena A. Jäger

机构 * Department of Computational Linguistics, University of Zurich, Switzerland(计算语言学系,苏黎世大学,瑞士)

专题命中 偏好对齐 :DPO(summary_cn,abstract);prompt injection(abstract);分类 cs.CL

AI总结 提出重力加权DPO(GW-DPO)方法,通过线性或双边调度加权冲突级别间的结构距离,结合层次分隔符和指令段嵌入,在Llama-3.1-8B-Instruct上提升多级指令优先级遵守率并降低过度拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11082 2026-06-10 cs.CL cs.CY 新提交 79%

The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

示播列效应:审计大型语言模型的跨语言分布偏斜

Hakan Mehmetcik

机构 * Kellogg Institute for International Studies, University of Notre Dame(凯洛格国际研究学院,圣约翰大学) Marmara University(马尔马拉大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究通过多智能体地缘政治兵棋推演,发现前沿LLM在跨语言条件下存在行为偏斜,且该效应依赖于模型架构与训练机制,而非西方起源模型的普遍属性。

Comments 25 pages, 2 figures, 6 tables, Research Article

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11050 2026-06-10 cs.MA cs.GT cs.SY eess.SY 新提交 67%

LLM-Mediated Demand Response Coordination in Smart Microgrids

LLM介导的智能微电网需求响应协调

J. de Curtò, I. de Zarzà

专题命中 偏好对齐 :RLHF(abstract,abstract_cn)

AI总结 针对智能微电网中产消者自愿合作的需求响应协调问题,提出一种结合博弈论与LLM叙事评估的混合决策架构,通过结构化指令实现33.3%的需求削减合作率,优于非结构化消息和基线。

Comments Accepted for publication in 18th International Conference on Sustainability in Energy and Buildings (SEB-26), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10953 2026-06-10 cs.AI cs.CV 新提交 57%

Architect-Ant: Editable Automatic Furnishing of Architectural Floor Plans

Architect-Ant: 可编辑的建筑平面图自动家具布置

Fedor Rodionov, Aleksandar Cvejic, Michael Birsak, John Femiani, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Miami University(迈阿密大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出基于微调视觉语言模型的可编辑自动家具布置框架Architect-Ant,通过领域特定语言编码布局并优化,生成符合建筑约束的合理布局。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10581 2026-06-10 cs.CL cs.SD eess.AS 新提交 57%

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models

ParaBridge: 弥合语音语言模型中的副语言感知与对话行为

Yuxiang Wang, Qinke Ni, Shengbo Cai, Wan Lin, Liqiang Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Hunyuan(腾讯混元) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司) Tsinghua University(清华大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

AI总结 提出ParaBridge,一种在线自我蒸馏方法,将推理阶段的副语言指令支架转化为稳定的模型行为,无需人工标注或外部奖励,显著提升语音语言模型对副语言线索的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2606.11046 2026-06-10 cs.CL 新提交 83%

Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models

推理是否保持对齐?关于大型推理模型的可信度研究

Prajakta Kini, Avinash Reddy, Souradip Chakraborty, Satya Sai Srinath Namburi GNVV, Furong Huang, Amrit Singh Bedi, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) University of Central Florida(中佛罗里达大学) University of Maryland College Park(马里兰大学帕克分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 研究通过监督微调、强化学习和蒸馏生成的推理模型在安全、偏见、隐私等六个可信度维度上是否保持对齐,发现推理模型常出现对齐退化,如毒性增加、刻板印象加剧等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10487 2026-06-10 cs.LG cs.AI 新提交 62%

Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs

早停早省:隐藏状态探针作为LLM输出流式审核的实用方案

Huizhen Shu, Xuying Li, Piao Xue

机构 * ModelOneAI yunshanai(云山AI)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出基于隐藏状态的轻量级词元级探针,在解码循环中实时检测不安全输出,无需额外前向传播,实现亚毫秒级安全审核,可提前中断或修改生成。

Comments Technical Report. 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09866 2026-06-10 cs.LG cs.AI 新提交 62%

Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

双人探戈:面向安全LLM微调的耦合任务-参考选择

Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出DualSelect框架,通过耦合任务与安全参考选择,在微调时保持安全对齐,提升安全评分至少5.10点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10321 2026-06-10 cs.LG cs.AI cs.RO math.OC 新提交 62%

Baseline-Free Policy Optimization for Neural Combinatorial Optimization

无基线的神经组合优化策略优化

Carlos S. Sepúlveda, Gonzalo A. Ruz

机构 * Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院) Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局) Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS)) Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出使用GRPO算法消除神经组合优化中的基线依赖,避免训练崩溃,在TSP和CVRP上达到接近POMO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10989 2026-06-10 cs.AI 新提交 57%

Null-Space Constrained Low-Rank Adaptation for Response-Specified Large Language Model Unlearning

零空间约束的低秩自适应用于指定响应的大型语言模型遗忘

Bocheng Ju, Jianhua Wang, Chengliang Liu, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University(北京交通大学智能交通信息安全与隐私保护北京市重点实验室) College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院) Institute of Computing Technologies, China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司计算技术研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出零空间约束响应指定遗忘框架,通过正交投影低秩参数化将LoRA更新限制在保留子空间的零空间内,在抑制遗忘知识的同时保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10334 2026-06-10 cs.AI 新提交 57%

Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts

通过视觉反馈的自蒸馏策略优化:连接代码与视觉工件

Haoyu Dong

机构 * Microsoft(微软)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出Visual-SDPO框架,利用渲染视觉反馈作为特权上下文,通过自蒸馏和视觉引导的代码信用加权优化代码生成视觉工件的质量,在图表、UI和幻灯片生成任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 安全训练 :safety(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09841 2026-06-10 cs.HC 新提交 50%

Human-Centered AI for Safe Shuttle Car Routing in Underground Room-and-Pillar Coal Mines Using Graph Neural Networks

面向人类中心的图神经网络安全穿梭车路径规划在房柱式地下煤矿中的应用

Bryant Pollard

专题命中 安全训练 :safety(abstract)

AI总结 针对地下煤矿低能见度、动态环境下的安全路径决策问题,提出基于图神经网络的人类中心AI决策支持系统,通过专家合成数据训练、浏览器界面部署及SHAP可解释性分析,提升任务完成率、响应速度和用户信任。

Comments 18 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2606.10571 2026-06-10 cs.CV cs.AI cs.CR 新提交 57%

Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction

通过代理特定偏差校正提高视觉-语言预训练模型上的对抗迁移性

Lijia Yu, Jiuxin Cao, Yuchen Qiang, Changhao Chen, Yifei Huang, Bo Liu

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 提出DeBias-Attack方法,通过梯度校正消除代理特定偏差,提高对抗样本在VLP模型间的迁移性,实验验证其在多种模型和任务上的有效性。

Comments 17 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2606.10525 2026-06-10 cs.CR cs.AI 新提交 83%

Assessing Automated Prompt Injection Attacks in Agentic Environments

评估智能体环境中的自动化提示注入攻击

David Hofer, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09935 2026-06-10 cs.CR cs.AI 新提交 79%

GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

GitInject: AI驱动的CI/CD流水线中的真实提示注入攻击

Jafar Isbarov, Umid Suleymanov, Ilia Shumailov, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工学院) AI Sequrity Company(AI安全公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出GitInject框架,在真实GitHub工作流中评估AI代理的提示注入漏洞,发现所有测试提供商均存在结构性风险,并给出最低成本防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2606.09859 2026-06-10 cs.LG cs.AI 新提交 81%

Mitigating Manifold Departure: Uncertainty-Aware Subspace Rectification for Trustworthy MLLM Decoding

缓解流形偏离:面向可信MLLM解码的不确定性感知子空间校正

Yingxuan Zhuang, Jingxiao Yang, Miao Pan, Cheng Tan, Yuxiang Cai, Siwei Tan, Chen Zhi, Xuhong Zhang, Jianwei Yin, Jintao Chen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :trustworthy(title);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出MGAP方法,通过SVD构建语言先验子空间并自适应衰减投影分量,在抑制幻觉的同时保持语义结构,优于现有解码基线。

Comments ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10216 2026-06-10 cs.LG cs.AI 新提交 76%

A Source Domain is All You Need: Source-Only Cross-OS Transfer Learning for APT Anomaly Detection via Semantic Alignment and Optimal Transport

一个源域足矣:基于语义对齐和最优传输的仅源域跨操作系统APT异常检测迁移学习

Sidahmed Benabderrahmanea, Petko Valtchev, James Cheney, Talal Rahwan

机构 * New York University, NYUAD, Division of Science, Computer Science Department(纽约大学,NYUAD,科学学院,计算机科学系) University of Quebec in Montreal, Computer Science Department, Montreal(魁北克大学蒙特利尔分校,计算机科学系,蒙特利尔) University of Edinburgh, School of Informatics, Edinburgh(爱丁堡大学,信息学院,爱丁堡)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI、cs.LG

AI总结 针对跨操作系统APT检测中目标域无标签的挑战,提出基于最优传输的仅源域异常评分框架,通过语义抽象和三种偏差通道实现零目标监督下的异常排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09856 2026-06-10 cs.CL cs.AI cs.LG stat.ML 新提交 67%

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

使用概率程序训练大型语言模型的归纳推理

Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于程序的后验训练(PPT)方法,利用LLM生成概率程序场景,通过推理产生分布目标,微调模型以提升归纳推理准确性、与人类判断的一致性及校准能力。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10475 2026-06-10 cs.MA cs.AI cs.CL 新提交 62%

Decoupling Thought from Speech: Knowledge-Grounded Counterfactual Reasoning for Resilient Multi-Agent Argumentation

思想与言语解耦:基于知识反事实推理的鲁棒多智能体辩论

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙技术大学计算机科学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出知识反事实推理(KG-CFR)双阶段架构,通过私有规划缓冲与公共执行层分离,在动态资源分配环境下将扰动后论证质量从0.694提升至0.822,并减少语义循环。

Comments Accepted for publication in the Proceedings of the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10777 2026-06-10 cs.LG 新提交 57%

Can we trust our models? Epistemic calibration in second-order classification

我们能信任我们的模型吗?二阶分类中的认知校准

Arthur Hoarau

机构 * Université de Lorraine, CentraleSupélec Loria, CNRS(洛林大学,中央理工-高等电力学院洛里亚实验室,法国国家科学研究中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 提出认知校准准则,衡量认知不确定性估计是否可靠,并证明其比经典校准更严格,通过EECE指标实验揭示不同不确定性量化方法的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2606.10796 2026-06-10 cs.CL cs.AI 新提交 62%

Dep-LLM: Training-Free Depression Diagnosis via Evidence-Guided Structured Multi-factor with Reliable LLM Reasoning

Dep-LLM:基于证据引导的结构化多因素与可靠LLM推理的无训练抑郁症诊断

Yiqing Lyu, Xianbing Zhao, Buzhou Tang, Ronghuan Jiang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, Guangdong, China(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Pengcheng Laboratory(鹏城实验室) Chinese People’s Liberation Army General Hospital, Beijing, China(中国人民解放军总医院)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练框架Dep-LLM,通过思维链多因素分析、置信度调制和协作预测,在冻结LLM上实现抑郁症诊断,超越零样本和微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09844 2026-06-10 cs.HC cs.AI 新提交 57%

The Interlocutor Effect: Why LLMs Leak More Personal Data to Agents Than Humans

对话者效应:为什么LLMs向智能体泄露的个人数据比向人类多

Faouzi El Yagoubi, Godwin Badu-Marfo, Ranwa Al Mallah

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 研究发现LLMs在与AI智能体对话时比与人类对话更易泄露个人身份信息,通过注意力抑制假说解释该现象,实验表明安全对齐注意力头在智能体交互中失活导致泄露增加23个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 16 篇

2606.11167 2026-06-10 cs.CL eess.AS 新提交 79%

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

全双工语音模型中的多面交互对齐

Atsumoto Ohashi, Neil Zeghidour, Alexandre Défossez, Eugene Kharitonov

机构 * Kyutai Gradium

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10061 2026-06-10 cs.CL 新提交 79%

BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

BenSyc: 孟加拉语上下文中大语言模型对话谄媚与人类对齐的基准测试

Kazi Noshin, Sajib Acharjee Dip, Ranat Das Prangon, Fardin Hassan Tamim, Syed Ishtiaque Ahmed, Liqing Zhang, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) BRAC University(BRAC大学) University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出BenSyc基准,基于孟加拉语社交数据构建五级标注集,评估15+模型在对话对齐分类与生成任务上的表现,发现前沿模型在区分共情与强化性认可上仍存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09890 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

PreAct-Bench:大语言模型中的预测性监控基准

Hainiu Xu, Italo Luis da Silva, Jiangnan Ye, Yuhao Wang, Wei Liu, Linyi Yang, Jonathan Richard Schwarz, Nicola Paoletti, Yulan He, Hanqi Yan

机构 * King’s College London(伦敦国王学院) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) Thomson Reuters Foundational Research(汤姆森路透基础研究) Imperial College London(伦敦帝国学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏