On the Undecidability of Artificial Intelligence Alignment: Machines that Halt
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
Comments Submitted for the Scientific Reports AI Alignment Collection
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
Comments Submitted for the Scientific Reports AI Alignment Collection
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
Comments Accepted as Findings of ACL 2024. Our code and data is available at https://github.com/yizhongw/llm-temporal-alignment
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
Comments Published in Transactions on Machine Learning Research (TMLR). The code is released at https://github.com/Haoxiang-Wang/Compositional-Feature-Alignment
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
Comments Accepted for publication at NIPS 2016. [v2] Corrected convolutional results for feedback-alignment. [v3,v4,v5] Corrected theorem and proof
多智能体分布式协调控制:发展与方向
专题命中 其他安全 :alignment(summary_cn,abstract)
AI总结 本文综述了分布式协调控制的发展,重点讨论了共识与编队控制,结合图论分析,并简要回顾了 rendezvous/alignment、swarming/flocking 和 containment control 等相关问题,最后探讨了实际应用中的研究方向。
Comments 28 pages, 8 figures
探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。
CAVE:面向视频时序定位的能力感知视觉边界证据对齐
机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 针对视频时序定位中视觉证据与时间戳错位的问题,提出CAVE方法,通过边界证据奖励、轻量级热身及性能感知门控,在公开基准上验证了有效性。
对齐存在幻想问题
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 该研究指出指令微调AI因不理解人类认知过程会产生幻想交互,剥夺用户任务自主权,进而提出需重新思考对齐研究,优化交互中认知责任分配并规划了相关研究议程。
Comments 10 pages, 2 figures
Journal ref ICLR 2026 Workshop HCAIR
单神经元模加法中傅里叶对齐的一个反例
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 该研究针对MAIS-O60问题构造反例,证明单神经元模加法训练中傅里叶对齐不成立,且失效情况在多种条件下普遍存在。
Comments 18 pages
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
Journal ref Proc. of Conference on AI Music Creativity (AIMC) 2026
基于ASRS报告的可追踪LLM生成航空系统运行安全分析危险场景
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 该研究针对航空系统运行安全分析,提出AI辅助方法结合ASRS报告,用LLM生成可追踪危险场景,通过进化溯因优化混合变体,经评估验证了模型与提示对生成场景有效性的影响。
对比扩散对齐:用于可控生成的结构化潜在学习
机构 * Department of Psychiatry, Weill Cornell Medicine, New York, NY, USA(威立·科林斯医学中心精神科) ; Department of Psychiatry, Stanford University, Stanford, CA, USA(斯坦福大学精神科) ; Department of Neuroscience, University of Connecticut School of Medicine, Farmington, CT, USA(康涅狄格大学医学院神经科学系)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 ConDA通过对比学习在扩散模型中学习结构化潜在空间,实现可控生成和动态解释。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026
用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。
Comments Submitted to EMNLP 2026
CIGTSurv:结合局部原型关联与全局特征对齐的临床信息引导三模态生存预测
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 本研究针对临床信息未充分利用及多模态异质性问题,提出CIGTSurv框架,结合局部原型关联与全局特征对齐机制,在五个TCGA癌症队列上取得生存预测SOTA性能。
Comments Accepted at MICCAI 2026
基于轻量级专家混合与本征图像对齐的内窥镜可泛化深度估计增强方法
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出自监督框架EndoMINI,结合低秩专家混合与本征图像对齐,在多内窥镜数据集上实现了更优的可泛化深度估计性能。
Comments Accepted by MICCAI 2026 @ The Efficient Medical AI (EMA4MICCAI) Workshop (Oral Presentation)
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
Comments 5 pages
SIGMA: 通过自回归对比学习实现的结构不变生成分子对齐用于化学语言模型
机构 * School of Computing, University of Connecticut(康涅狄格大学计算学院) ; Institute for Artificial Intelligence, University of Georgia(佐治亚大学人工智能研究所) ; Institute of Hydrobiology, Chinese Academy of Sciences(中国科学院水生生物研究所)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 本文提出SIGMA方法,通过自回归对比学习解决分子序列生成中的结构不一致问题,提升生成效率与结构多样性。
Comments 9 pages, 2 figures, and 4 tables
持久卷积:用于AI对齐测试和语义空间表征的拓扑框架
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。
Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)
超越特征与结构对齐:学习图基础模型的可迁移传播知识
机构 * Tianjin University(天津大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 针对现有图基础模型忽略可迁移传播知识单元与传播模式异质性的局限,本文提出ProGFM,通过传播关系原型库学习跨域可迁移传播知识,在多跨域场景下实现更优泛化性能。
保真度≠安全性:轻度压缩的大语言模型通过所有无数据质量防护,但在智能体执行中生成指令中不存在的流程步骤
专题命中 其他安全 :safety(title,abstract);分类 cs.CL
AI总结 该研究发现轻度压缩LLM虽通过困惑度、MMLU等无数据质量防护,但在智能体执行SOP时会生成指令外流程步骤,提出基于压缩误差双轴统计量的无数据筛查方法以保障智能体安全。
基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性
专题命中 其他安全 :safety(title,abstract);分类 cs.AI
AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。
面向无约束红外分子结构解析的数据融合与对比对齐
机构 * University of Missouri(密苏里大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 本研究针对无约束红外分子结构解析的局限性,改进Transformer并引入MoE解码器与对比对齐损失,使Top-K预测准确率提升超10个百分点,拓宽了AI在分析化学的应用。
价值对齐中的个性化、角色设定与预测
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。
DICA:多模态大语言模型中的双指标引导对比对齐
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。
训练驱动的表征几何模块化预测语言模型中的脑对齐
机构 * School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) ; Tsinghua Laboratory of Brain and Intelligence, Tsinghua University, Beijing, China(脑与智能实验室,清华大学,北京,中国) ; School of Basic Medical Sciences, Tsinghua University, Beijing, China(基础医学学院,清华大学,北京,中国) ; Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 本研究通过训练驱动的表征几何模块化,发现语言模型中的低复杂度模块能更准确预测人类大脑语言网络活动,揭示了表征平滑对神经样语言处理的作用。
Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48 (2026), 167-174
完全自动化经济的协调
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 从完全自动化经济角度探讨经济理论,回顾康托罗维奇的主体定理,分析发现主体对经济的管理存在协调漏洞,经济管理与人类价值观因主体动机和价格脱节而产生分歧。
OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。
QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习
机构 * Alibaba Inc(阿里巴巴公司)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。
人工智能对齐放大了种族、性别和残疾在招聘决策中的作用
专题命中 其他安全 :alignment(title,abstract);分类 cs.CY
AI总结 研究探讨语言模型在招聘决策中是否使用人口统计数据,发现对女性和黑人候选人有优势,对残疾候选人有劣势,且对齐过程放大了这些差异。
像人类一样听?语音语言模型中的语音象征与感知对齐
机构 * Graduate Institute of Communication Engineering National Taiwan University Taipei, Taiwan ; Graduate Institute of Electrical Engineering National Taiwan University Taipei, Taiwan ; Artificial Intelligence Center of Research Excellence National Taiwan University Taipei, Taiwan
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 研究语音语言模型是否有语音象征倾向,通过真实人类语音录音对比模型与人类数据,发现模型听觉判断与人类感知对齐差,错过声学线索,开放权重模型表现不佳,弱点在语音表示方式。
Comments Submitted to SLT 2026