Improved Bounds for Private and Robust Alignment
私有和鲁棒对齐的改进界
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文从理论角度研究语言模型的私有和鲁棒对齐,通过建立离线与在线设置下的次优性差距上界,分析隐私与对抗性腐败的两种交互模式,并给出改进的界。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
私有和鲁棒对齐的改进界
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文从理论角度研究语言模型的私有和鲁棒对齐,通过建立离线与在线设置下的次优性差距上界,分析隐私与对抗性腐败的两种交互模式,并给出改进的界。
人机互补:增强监督的目标
机构 * Google DeepMind(谷歌DeepMind)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 针对AI输出的事实核查问题,结合AI评分与人类评分优于单独使用任一方法,但AI辅助类型影响信任度,为超越人类专家性能的AI系统监督提供启示。
东方躯体化,西方心理化?:探究临床基础下跨文化抑郁症状在LLMs中的表达
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Sungkyunkwan University(成均馆大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本研究测试大语言模型(LLMs)是否复现西方抑郁患者报告心理症状、东方患者报告躯体症状的文化模式,发现英语提示下模型未能复现,但东方语言提示改善部分对齐,原因在于模型对文化人物敏感性低及症状层级压倒文化线索。
Comments C3NLP workshop at ACL 2026
训练语言模型以使用Prolog作为工具
机构 * University of Southern Denmark(南丹麦大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。
Comments ACL 2026 Findings (change from last version: corrected year in this comment)
Qwen-Image-Bench:从生成到创造——文本到图像评估
机构 * Alibaba(阿里巴巴)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。
OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。
Vis-CoT:一种用于LLM思维链推理中交互式可视化和干预的人机协同框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 提出Vis-CoT框架,将线性思维链文本转换为交互式推理图,允许用户可视化逻辑流程、识别错误步骤并通过剪枝和嫁接进行干预,显著提升推理准确性和用户信任。
Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation
通过语音-文本对齐细化伪音频提示以实现基于LLM的ASR的纯文本领域适应
机构 * Kyoto University, Japan(京都大学,日本) ; LY Corporation, Japan(LY公司,日本)
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文提出通过语音-文本对齐细化伪音频提示的方法,以提升基于LLM的ASR在纯文本领域适应中的性能,实验表明该方法在整体错误率和词汇覆盖率上优于现有方法。
Comments Accepted at Interspeech 2026
隐喻是大推理模型跨领域失调的根源
机构 * The University of New South Wales(新南威尔士大学) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现训练数据中的隐喻会导致大推理模型在推理输出中出现跨领域失调,通过隐喻干预可显著改变失调程度,并设计出高精度检测器。
Comments 19 pages, 6 figures
基于随机注意力的小家族比对无训练蛋白质序列生成
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 提出随机注意力(SA)方法,利用现代Hopfield能量和Langevin动力学从少量序列中无训练生成蛋白质序列,在8个Pfam家族上实现低组成差异、新颖性和结构合理性。
语言学与人脑:计算神经科学的视角
机构 * Institute of AI and Robotics, College of Intelligent Robotics and Advanced Manufacturing, Fudan University(人工智能与机器人研究院,智能机器人与先进制造学院,复旦大学) ; Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) ; Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文从计算神经科学视角,通过建模、模拟和数据分析将语言层次动态结构转化为可测试神经模型,并利用深度学习和大语言模型探索语言处理的神经基础。
Journal ref Cognitive Neurodynamics, 2026
OmniRobotHome:一个多摄像头平台用于实时多对多人机交互
机构 * Seoul National University(首尔国立大学) ; RLWRLD
专题命中 其他安全 :safety(abstract)
AI总结 OmniRobotHome通过多摄像头和双Franka机械臂实现多对多人机协作的实时3D感知与协同动作,解决了近距离交互中的遮挡和状态变化问题,为多对多协作实验提供了可行平台。
Comments Project Page: https://junc0ng.github.io/omnirobothome
PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练
机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) ; National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)
专题命中 其他安全 :alignment(abstract)
AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。
面向机器的对称熵约束视频编码
专题命中 其他安全 :alignment(abstract)
AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。
Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)
EndoUFM:利用基础模型进行内窥镜图像的单目深度估计
机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) ; State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)
专题命中 其他安全 :safety(abstract)
AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。
Comments 12 pages