Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。
面向无约束红外分子结构解析的数据融合与对比对齐
机构 * University of Missouri(密苏里大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 本研究针对无约束红外分子结构解析的局限性,改进Transformer并引入MoE解码器与对比对齐损失,使Top-K预测准确率提升超10个百分点,拓宽了AI在分析化学的应用。
价值对齐中的个性化、角色设定与预测
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。
DICA:多模态大语言模型中的双指标引导对比对齐
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。
OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。
QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习
机构 * Alibaba Inc(阿里巴巴公司)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。
像人类一样听?语音语言模型中的语音象征与感知对齐
机构 * Graduate Institute of Communication Engineering National Taiwan University Taipei, Taiwan ; Graduate Institute of Electrical Engineering National Taiwan University Taipei, Taiwan ; Artificial Intelligence Center of Research Excellence National Taiwan University Taipei, Taiwan
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 研究语音语言模型是否有语音象征倾向,通过真实人类语音录音对比模型与人类数据,发现模型听觉判断与人类感知对齐差,错过声学线索,开放权重模型表现不佳,弱点在语音表示方式。
Comments Submitted to SLT 2026
VTaMo:用于手语翻译的视频-文本对齐模型
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ; ChatSign Technology(ChatSign科技)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。
Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026
Aleena:用于研究软件工程协作的对齐代理
机构 * eScience Institute(eScience研究院) ; University of Washington(华盛顿大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。
Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop
通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁
机构 * National Taiwan University(国立台湾大学) ; The University of California, Merced(加州大学默塞德分校)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。
Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback
SAD-LoRA:低秩知识蒸馏的谱对齐
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出SAD-LoRA方法用于低秩知识蒸馏,从数据加权学生空间参考更新中选择权重子空间,通过可微主角度损失训练,减少子空间错位,提升对齐效果,提高秩效率。
Comments ICML'26 workshop on CoLoRAI - The 2nd Workshop on Connecting Low-rank Representations in AI, 15 pages
通过运行时跟踪分析检测安全关键固件中的架构漂移
机构 * University of Naples Federico II(那不勒斯费德里科二世大学) ; Micron Technology, Inc(美光技术公司) ; DIETI
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。
Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)
LOPA:通过潜在序数原型对齐增强口语评估
机构 * National Taiwan Normal University(国立台湾师范大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。
跨语言推理的软令牌对齐
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 提出SOLAR方法,通过软令牌对齐跨语言表示,提升多语言推理准确率,尤其对低资源语言效果显著。
谓词重要性估计与解耦理由-分数蒸馏用于实体对齐
机构 * SungKyunKwan University(成均馆大学) ; NAVER
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 提出谓词重要性估计和解耦理由-分数蒸馏两个模块,通过谓词感知嵌入和蒸馏小语言模型提升知识图谱实体对齐性能,并利用分数与理由的不一致实现人机协同验证。
Comments 12 pages, 10 figures
更深并非总是更好:通过置信层解码缓解对齐税
机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。
TALAS:基于教师锚定的层对齐与自适应锐度感知最小化的嵌入蒸馏
机构 * Hanoi University of Science and Technology(河内科技大学) ; VNU University of Engineering and Technology(越南国立大学工程与技术大学) ; University of Oregon(俄勒冈大学) ; Monash University(莫纳什大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 提出TALAS框架,通过教师锚定机制仅蒸馏最终句子嵌入到学生上层,结合层对齐自蒸馏和自适应锐度感知最小化,在降低计算成本的同时提升句子嵌入蒸馏性能。
Comments ACL 2026
通过约束证据选择的主题到时间戳对齐
机构 * TU Dresden(德累斯顿工业大学) ; SpeechMind GmbH(SpeechMind 公司) ; Shamoon College of Engineering(沙蒙工程学院) ; ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 针对会议记录中主题到时间戳的对齐问题,提出将时间戳预测重构为约束时间候选选择,通过检索时间戳转录块并选择最佳候选而非生成时间码,显著提升召回率和解析输出数量。
编辑对齐:一种参与式方法,将编辑专业知识引入LLM介导的知识传播
机构 * Aarhus University(奥胡斯大学) ; University of Copenhagen(哥本哈根大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出“编辑对齐”作为参与式AI设计实践,通过设计工作坊让编辑参与重新对齐LLM接口至编辑标准,以维护公共知识机构的编辑职能。
Comments 14 pages
跨模态生物学语言模型的逻辑空间对比对齐
机构 * Biomedical Informatics and Data Science, Yale School of Medicine(耶鲁医学院生物医学信息学与数据科学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出LOGICA框架,在输出逻辑空间进行对比学习,通过门控跨模态适配器保留预训练似然接口,实现跨不同词汇表模型的上下文条件预测,在蛋白质-配体结合、TCR-肽活性和药物耐药性预测任务上超越现有方法。
基于膝关节X光片的隐式神经形状函数的无地标下肢对齐评估
机构 * Division of Informatics, Imaging and Data Sciences, The University of Manchester(曼彻斯特大学信息学、影像与数据科学部) ; Research Unit of Health Sciences and Technology, University of Oulu(奥卢大学健康科学与技术研究部) ; Medical Research Center Oulu, University of Oulu and Oulu University Hospital(奥卢大学与奥卢大学医院医学研究中心) ; Department of Trauma and Orthopaedics, Stockport NHS Foundation Trust, Stepping Hill Hospital(斯泰平希尔医院斯托克波特NHS基金会创伤与骨科) ; School of Health and Society, University of Salford(索尔福德大学健康与社会学院) ; School of Biological Sciences, The University of Manchester(曼彻斯特大学生物科学学院) ; Weill Cornell Medicine, Cornell University(康奈尔大学威尔康奈尔医学院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 提出隐式神经形状函数(INSF)方法,无需显式地标,通过编码解剖形状到潜在空间并直接回归临床对齐测量,实现自动化下肢对齐评估,性能与现有方法相当且易于扩展。
Comments Accepted to MICCAI 2026
融合并非一刀切:用于时间-事件建模的跨模态表示对齐
机构 * Arizona State University(亚利桑那州立大学) ; Mayo Clinic(梅奥诊所)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。
自引导:通过解码器流形对齐增强神经编解码器
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出自引导方法,通过轻量特征映射损失对齐解码器内部流形,在不改变推理过程下提升VQ-VAE神经语音编解码器重建质量,实现低比特率SOTA性能并支持4倍码本缩减。
Comments 20 pages, 9 figures, accepted to ICML 2026, demo website available at https://sgvqvae.github.io/sgvqvae-demo
ECA:面向开放图像到文本生成的高效持续对齐
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出ECA方法,通过混合查询模块、Fisher动态扩展和字典重放,实现无需旧数据的持续对齐,缓解灾难性遗忘,提升开放图像到文本生成的增量学习性能。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
哪种语音表示更匹配文本原生推理?帧率和表示对语音-文本对齐的研究
机构 * Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学) ; Tencent, China(腾讯) ; University of Surrey, United Kingdom(Surrey大学) ; Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) ; Hong Kong Baptist University, Hong Kong SAR(香港 Baptist大学) ; Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学) ; Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 研究语音与文本模态差异中的时间粒度不匹配问题,提出因子化FSQ和轻量非自回归音频LM头以降低帧率,发现4.17Hz帧率结合中间层表示对齐在语音问答中表现最佳。
Comments Accepted by Interspeech 2026 long paper
由谄媚诱导的突现性失调可通过对齐门控逆转
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 发现谄媚微调(被动同意用户错误观点)可诱导广泛且严重的突现性失调,并提出对齐门控方法,通过插入可学习门控来识别并抑制不安全表示,从而高效逆转失调。
Comments Code is available at https://github.com/stay1to0/Sycophancy_Emergent_Misalignment_and_Gated_attention_FT
基于大语言模型的时间序列预测的因果语义对齐
机构 * University of Science and Technology of China(中国科学技术大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出CVAformer框架,通过因果干预解耦变量中的动态和不变成分,消除对齐中的混杂偏差,在多种预测场景下达到或超越最先进性能。
安全是上下文相关的,而LLM评判者不是:应对评估者的刚性先验
机构 * University of Oxford(牛津大学) ; Cohere
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 研究LLM作为安全评判者时,对上下文信息的依赖性和对不同安全定义的可引导性,发现它们难以在上下文或安全定义与自身先验矛盾时调整评估。
作为人工智能-智能体对齐层次的基础市场设计
专题命中 其他安全 :alignment(title,abstract)
AI总结 研究探讨市场中人工智能-智能体对齐,提出将基础市场设计视为该对齐层次,通过对市场核心形式化建模,利用理论计算机科学严谨性构建透明盒模型,支持激励分析与机制设计,使期望行为受青睐,不良行为难维持。
Comments Accepted as at the EC'26 Workshop on Incentive-Based AI Alignment, co-located with the 27th ACM Conference on Economics and Computation, Rome, Italy, July 2026. This version is prepared for public dissemination following workshop acceptance
RefineAny3D:作为语义对齐的深度细化用于单目3D检测
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 其他安全 :alignment(title,abstract)
AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。