The Oracle's Gambit: A Game-Theoretic Framework for Responsible AI Release
神谕者的策略:负责任的人工智能发布的博弈论框架
专题命中 AI治理与伦理 :safety(abstract)
AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
神谕者的策略:负责任的人工智能发布的博弈论框架
专题命中 AI治理与伦理 :safety(abstract)
AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。
CoPersona: 面向鲁棒LLM个性化的协作人格图
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。
Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables
基于角色的多智能体模型用于生活实验室间气候适应讨论
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 提出一种模块化多层级智能体架构,整合基于动机的个体决策、社会影响网络和机构策略模块,以模拟气候治理中的复杂互动,支持情景探索。
Comments 4 pages, 1 figure, accepted as poster at the 21st annual Social Simulation Conference (SSC 2026)
探究LLM赋能的异议少数群体在权力不平衡群体决策中的支持:反驳与调解作为干预策略
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本研究开发了LLM赋能的异议少数支持系统,通过AI生成的反驳或AI调解消息来关注少数观点,实验发现反驳增强满意度但调解增加参与却降低心理安全感,揭示了参与与心理安全之间的支持悖论。
Comments Accepted at CSCW 2026
验证门控的智能工业多机器人系统任务状态治理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。
“一丝混乱与疯狂”:AI评估量表与评估改革工作
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。
Comments V2: Corrections of errata, additional limitations
谁赢得冲突?音频大模型中文本偏差的机制可解释性
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文通过机制分析揭示音频大模型中的文本主导偏差,发现文本路径主动抑制完整音频表征,并提出无训练干预方法back-patching以增强音频表征,缓解文本主导。
Comments Preprint
更快的代码,更深的债务?关于LLM辅助软件开发中技术债务及其早期迹象的多声部文献综述
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 通过104篇文献的多声部综述,发现LLM辅助开发放大传统技术债务(代码、设计、文档债务)并引入新债务(快速集成、提示、伦理、数据、来源债务),提出人机协同、提示工程等缓解策略,但缺乏标准化基准。
Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026
连接昼夜:基于协同提示与原型学习的无监督跨域重识别
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 提出无监督昼夜重识别框架,结合提示学习和原型表示学习,通过两阶段训练实现无标注跨域身份关联,性能媲美全监督方法。
如何避免辩论:通过双高效交互式证明实现可扩展的人工智能安全
机构 * MIT(麻省理工学院)
专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.LG
AI总结 研究如何避免人工智能模型间的辩论来实现安全验证,提出单证明者交互式证明,给出双高效单证明者交互式证明及论证,用于神谕辅助计算,表明无辩论时交互式验证也可行。
Comments ICML 2026
AISA:用于公路施工持续改进的AI安全助手框架
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 其他安全 :safety(title,abstract);AI safety(title);分类 cs.CL
AI总结 本研究提出AISA框架,基于LLM和文本嵌入模型实现公路施工事故分类、质量评分及相关数据检索,为未来智能体应用提供基础,在OIICS分类和事故检索等任务上取得优于随机水平的效果。
Comments 17 pages, 5 figures
抱歉,司机,恐怕我不能这么做:评估LLMs在汽车环境中的安全性
机构 * UKRI AI Centre for Doctoral Training in Safe Artificial Intelligence Systems (SAINTS)(英国研究理事会安全人工智能系统博士培训中心(SAINTS)) ; University of York(约克大学) ; Jaguar Land Rover(捷克·陆罗恩)
专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 本文从安全保证角度评估了将LLMs集成到汽车控制任务中的现有框架,指出其面临概念和具体挑战,并通过案例研究提出未来保障机制。
Comments Accepted at the Dependable AI in Embedded Systems (DAIES) Workshop at SAFECOMP 2026; 15 pages, 3 figures, 2 tables
基于梯度的任意语音识别模型的语音到文本对齐:从连接主义时间分类到语音大语言模型
机构 * Machine Learning and Human Language Technology Group, RWTH Aachen University(机器学习与人类语言技术组,亚琛工业大学) ; AppTek GmbH(AppTek公司)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究基于梯度的任意可微语音识别模型的语音到文本对齐方法,通过对教师强制令牌对数概率取梯度并解码,无需训练、改模型及对齐头,适用于各模型家族,在多模型上评估,结果显示该方法能产生可用对齐,有优有劣。
构建社会技术对齐的空间
机构 * Institute for Natural Language Processing, University of Stuttgart(语言处理研究所,斯图加特大学) ; Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思论坛,斯图加特大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出一个以人为中心的社会技术对齐框架,通过社会科学视角系统定义、论证和评估AI行为的合意性,并基于系统文献综述揭示当前对齐规范中的概念模糊问题。
Comments Preprint
超越表征对齐:基于大脑引导的语言模型实现稳健推理
机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室、智能科学与技术学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过fMRI信号增强大型语言模型推理能力,提出脑引导框架,在10个模型上实现最高13%的准确率提升。
ERAlign: 文本属性图上GNN与LLM的基于能量的表示对齐
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ERAlign框架,利用能量模型对齐GNN和LLM的表示,通过能量差异优化实现分布一致性,在8个数据集上取得最优性能。
Comments Accepted to ICML 2026
立场:我们需要实用的AI对齐方法来镜像人类推理
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 该论文提出需实用AI对齐方法镜像人类推理,指出认知对齐可提升AI可理解性与可信赖度,提出研究议程以缩小现有对齐方法与认知对齐需求的差距,助力用户信赖AI系统。
Comments Accepted in ICML 2026
多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。
EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型
机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) ; Shanghai Jiao Tong University(上海交通大学) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。
AI模型的语义对齐:概念坍缩、检查点动态与跨语言迁移
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究针对语言模型基准测试的难点,提出用拓扑方法将模型高维嵌入空间与可解释基线严格比较,以实现多模态对齐,追踪模型适应并测试跨语言短语理解。
Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) ; School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) ; MoAdata(MoAdata公司) ; University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。
罗生门对齐
机构 * Faculty of Engineering, University of Porto(波尔图大学工程学院) ; Artificial Intelligence and Computer Science Lab (LIACC)(人工智能与计算机科学实验室(LIACC)) ; Fraunhofer AICOS Portugal(弗劳恩霍夫葡萄牙人工智能与计算机科学中心) ; BrightFactory(光明工厂) ; LIACS, Leiden University(莱顿大学LIACS) ; School of Computing and Mathematical Sciences, University of Waikato(怀卡托大学计算与数学科学学院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 提出罗生门对齐(RA)评估模型功能相似性,引入几何视角,提出几何RA,通过90多个数据集实验分析,表明几何与分布对齐提供不同互补视角,RA可用于模型选择等多用途。
MemSFT:使用外部参数内存减轻对齐代价
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 研究针对大语言模型应用于特定领域产生的对齐代价问题,提出MemSFT方法,通过参数内存解耦领域专业化与主干参数更新,经多领域多模型评估,能提升领域性能且通用性能下降小,实现通用与专业能力解耦。
Comments 33 pages, 11 figures, 13 tables
IRIS:来自冻结语言模型的可重复使用身份表示用于实体对齐
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 研究实体对齐问题,传统方法语义理解不足,基于LLM的方法未形成稳定身份空间。提出IRIS框架,从冻结LLM提取上下文表示构建实体签名,形成共享空间实现跨图谱对齐,在多个基准测试中取得良好成绩。
Comments 9 pages, 1 figure, 3 tables
关于自改进在线大语言模型对齐的收敛性
机构 * The University of Hong Kong(香港大学) ; Yale University(耶鲁大学) ; Purdue University(普渡大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 针对SAIL算法收敛性分析缺失的问题,提出SAIL-RevKL正则化目标,证明其满足PL条件并实现近线性样本复杂度,在MuJoCo和LLM对齐任务上优于原始SAIL。
Comments Accepted at UAI 2026
更新的几何:词汇规模下的Fisher对齐
机构 * Sideplane AI
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 针对共享词汇的LLM家族,提出FisherSketch方法,通过核均值嵌入的余弦相似度估计Fisher对齐,实现词汇规模下的高效源选择,并揭示激活、误差及耦合因素。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306. 64 pages total (main paper plus appendix), 4 figures, 29 tables
SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识
机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) ; Alibaba Group, China(阿里巴巴集团)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 针对低资源语言在稀疏MoE架构中路由不一致的问题,提出SARA框架,利用对称JS散度约束对齐多语言输入与高资源语义锚点的路由分布,提升低资源语言性能。
注意头:多模态大语言模型的拓扑表示对齐
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ; University of Pisa(比萨大学) ; AMD Silo AI
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 提出头级表示对齐(HeRA)方法,在注意力头级别强制跨模态对齐,通过对比目标匹配局部拓扑结构,选择对齐最差的头进行训练,有效提升视觉任务性能并减少幻觉。
MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言
机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) ; Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。
Comments Preprint. Under review
跨语言迁移中语言相关性与任务对齐的解耦
机构 * Haverford College(哈弗福德学院) ; Brown University(布朗大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 通过微调大语言模型并在闪语族与非闪语族语言上评估零样本阅读理解,发现跨语言迁移主要提升任务格式对齐而非语言特定知识。