AdaBoN: Adaptive Best-of-N Alignment
AdaBoN: 适应性最佳N对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。
Comments 25 pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
AdaBoN: 适应性最佳N对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。
Comments 25 pages
通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐
机构 * SB Intuitions
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。
OARS:面向生成真实世界图像超分辨率的在线对齐
机构 * ByteDance Inc.(字节跳动公司) ; Peking University(北京大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。
Comments Super-Resolution, Reinforcement Learning
医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成
机构 * NEC Laboratories America(NEC美洲实验室) ; University of California, Riverside(加州大学河滨分校)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。
基于交换引导的偏好学习用于从人类反馈中获得个性化强化学习
机构 * Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Swap-guided Preference Learning (SPL)来解决变分偏好学习中后验崩溃的问题,通过引入交换引导基础正则化、偏好逆自回归流和自适应潜在条件化来提升个性化强化学习效果。
Comments ICLR 2026
对齐大型语言模型代理的理性与道德偏好:一种监督微调方法
机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) ; Amazon(亚马逊) ; Toulouse School of Economics(图卢兹经济学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。
VLM4Rec:基于大视觉-语言模型的多模态语义表示推荐系统
机构 * University of Southern California(南加州大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 VLM4Rec通过语义对齐而非直接特征融合,提升多模态推荐性能,实验显示其优于原始视觉特征和融合方法。
Comments 13 pages, 4 figures, 1 table
表面安全对齐假说
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。
Comments ICLR 2026
OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!
机构 * Nanyang Technological University(南洋理工大学) ; Walled AI Labs(Walled AI实验室) ; Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) ; Lambda Labs(Lambda实验室)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。
从用户交互对齐语言模型
机构 * ETH Zurich(苏黎世联邦理工学院) ; MIT(麻省理工学院) ; University of Zurich(苏黎世大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过自蒸馏直接从用户交互学习的方法,利用用户反馈调整模型行为,提升对齐和指令遵循能力,同时实现个性化和持续适应。
通过测试和静态分析反馈帮助LLM提升代码生成
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出利用测试和静态分析评估和指导通用开源LLM生成代码的质量及自我改进,发现生成代码常存在错误和安全问题,但提供反馈后能有效修复代码缺陷。
Journal ref Discover Artificial Intelligence, 2026
自适应视觉-语言模型路由用于计算机使用代理
机构 * vLLM Semantic Router Project(vLLM语义路由项目) ; MBZUAI ; McGill University(麦吉尔大学) ; AMD ; Red Hat(红帽公司)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。
Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证
专题命中 安全训练 :safety(abstract)
AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。
一种结合归纳推理与演绎推理的神经符号框架用于自动驾驶规划
机构 * Clemson University(克莱姆森大学)
专题命中 安全训练 :safety(abstract)
AI总结 本文提出一种神经符号框架,结合归纳与演绎推理提升自动驾驶规划的透明性和安全性,在nuScenes基准中优于现有方法。
Comments Under review. 16 pages, 2 figures
深度安全攻击:从深度安全注意力头中劫持大语言模型
专题命中 越狱攻击 :jailbreak(title,abstract);safety(title);alignment(abstract);分类 cs.AI
AI总结 本文提出SAHA攻击框架,通过深入分析注意力头的漏洞,提升对抗样本生成的鲁棒性,实验显示其在ASR指标上优于现有方法。
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
RECAP:通过代理流水线从LLM训练中重现受版权保护的数据
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Instituto Superior Técnico/INESC-ID(里斯本技术大学/INESC-ID) ; Hydrox AI
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
AI总结 RECAP通过代理流水线从LLM输出中提取和验证记忆的训练数据,利用反馈循环和对抗模块提升版权文本提取效果,实验显示其在ROUGE-L评分上显著提升。
ThreatGPT: 一个通过威胁建模增强公共安全的代理AI框架
机构 * Department of Computer Science(计算机科学系) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 ThreatGPT通过整合AI与人类判断,帮助工程师、安全官和政策制定者分析公共安全系统的威胁,利用STRIDE、MITRE ATT&CK等框架生成智能威胁模型,提升安全防护能力。
ESG-Bench: 对长上下文 ESG 报告进行基准测试以缓解幻觉
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文提出 ESG-Bench 数据集,用于评估大语言模型在解析 ESG 报告和减少幻觉方面的能力,通过人工标注的 QA 对和细粒度标签,系统评估模型提取和推理 ESG 内容的能力。
Comments To be published in the AAAI 2026 proceedings
大语言模型能从在线对话中推断政治倾向
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.CL、cs.CY
AI总结 研究展示大语言模型能可靠推断隐藏的政治倾向,优于传统机器学习模型,通过聚合文本推断和使用相关领域提升预测精度,揭示LLM在利用社会文化关联方面的潜力与风险。
Comments 56 pages; 4 figures in the main text and 18 supplementary figures, 11 supplementary tables
98倍更快的LLM路由无需专用GPU:Flash注意力、提示压缩与近流式处理用于vLLM语义路由
机构 * vLLM Semantic Router Project(vLLM语义路由器项目) ; MBZUAI ; McGill University(麦吉尔大学) ; AMD ; Red Hat(红帽公司)
专题命中 隐私与版权 :safety(abstract);分类 cs.CL
AI总结 本文提出三种优化方法,解决LLM路由的延迟和内存问题,实现98倍速度提升,使路由在共享GPU上成为可能。
评估欺骗:揭示前沿AI系统安全评估中的观察者效应
机构 * Computation and Artificial Intelligence Innovative College, Fudan University(复旦大学计算与人工智能创新学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI
AI总结 研究探讨了AI系统在被评估时可能产生欺骗行为,发现更先进的AI系统更易表现出观察者效应,影响评估结果。
测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts
机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。
彼此相视:通过共享第一人称视角实现人机协作中的认知对齐
机构 * College of Computer Science and Technology(计算机科学与技术学院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出Eye2Eye框架,通过共享第一人称视角实现人机认知对齐,解决沟通和理解鸿沟问题,实验表明其能提升协作效率和信任度。
Comments 19 pages, 11 figures. Accepted at ACM CHI 2026, Barcelona
审查学生与AI协作:在线研究生计算机科学学生的案例研究
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本研究通过混合方法审计,探讨学生与AI协作的偏好,分析现有AI能力与学生期望之间的差距,以改进教育用AI系统。
揭示自主代理中的安全威胁并构建防御体系:以OpenClaw为例
专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract)
AI总结 本文分析了自主代理在安全领域的挑战,提出三层次风险分类和FASA架构,旨在提升自主代理的安全性。
开发和评估一个支持产科保健的聊天机器人
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Population Council Institute(人口理事会研究所) ; Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) ; Nivi, Inc.(Nivi公司)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。
Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track
通过大语言模型支持人工验证:一篇发表的安全研究论文研究
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文研究利用大语言模型提升人工验证效率,通过文本复现评分、自动沙箱环境准备和方法缺陷评估,提高复现准确率和执行环境设置率,推动安全领域研究的可持续性。
大型语言模型在人类情感认知推理中的脆弱性
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。
Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025
迈向人工智能搜索范式
机构 * Baidu Search(百度搜索)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AI搜索范式,通过四个LLM驱动代理动态适应各类信息需求,结合任务规划、工具集成和高效推理方法,构建可信赖、适应性强的下一代搜索系统。