Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
全局进化引导:通过跨层一致性精炼激活引导控制
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
全局进化引导:通过跨层一致性精炼激活引导控制
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。
VL-KGE:视觉-语言模型与知识图谱嵌入的结合
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。
Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material
Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)
通过语言引导预训练学习可迁移的传感器模型
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 SLIP通过语言引导预训练学习可迁移的传感器模型,整合对比对齐与传感器条件标注,支持不同时间分辨率和输入长度,实现跨领域任务的高效性能。
在物理基础模型中tokenizer预训练的价值
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了在物理基础模型中预训练tokenizer对准确性和效率的影响,发现领域内预训练可显著提升模拟性能,并引入灵活的时空压缩操作以适应多样化的下游任务。
Comments 16 pages, 4 figures. Workshop paper at ICLR 2026 AI & PDE
通过参数和数据高效适应实现草稿模型的高效对齐
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Shanghai Innovation Institute(上海创新研究院) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI)) ; University of Science and Technology of China (USTC)(中国科学技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出高效草稿适应框架EDA,通过解耦架构、数据再生策略和样本选择机制,实现草稿模型在特定领域微调时的高效适应,降低训练成本并提升推测解码性能。
Comments 10 pages
从空间到动作:在空间先验基础上构建视觉-语言-动作模型
机构 * ByteDance Seed(字节跳动种子) ; NUS(新加坡国立大学) ; NTU(国立技术大学) ; THU(清华大学) ; SMU(南方大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。
Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/
GateLens: 一种增强推理能力的LLM代理用于汽车软件发布分析
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI
AI总结 GateLens是一种基于LLM的代理,通过引入关系代数作为中间表示,提升复杂表格数据分析的效率与准确性,适用于汽车软件发布分析领域。
IronEngine:迈向通用AI助手
机构 * NiusRobotLab(尼乌斯机器人实验室)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 IronEngine通过统一编排核心实现通用AI助手,具备多阶段流程、智能工具路由和高效执行能力,适用于个人助手和自动化框架。
Comments Technical Report
IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划
机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。
衡量人工智能研发自动化
机构 * GovAI ; University of Oxford(牛津大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。
注意力的引力场:位置相关性的幂律解释
机构 * Edward Zhang 1(Edward Zhang)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出注意力引力场概念,通过解耦位置编码与语义嵌入优化模型架构,展现其与万有引力定律的一致性,推动注意力机制的解释与模型优化研究。
用科学论文增强表示
机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子工程与信息学院,米兰理工学院) ; Osservatorio Astronomico di Roma, INAF(罗马天文台,INAF) ; AstroAI, Center for Astrophysics | | Harvard & Smithsonian(AstroAI,哈佛与史密松尼天体物理中心) ; Center for Computational Astrophysics, Institute for Advanced Study/The Flatiron Institute(计算天文学中心,高级研究院/Flatiron研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种对比学习框架,通过将X射线光谱与科学文献中的领域知识对齐,提升多模态表示的性能,并在天体物理领域实现了显著的变量估计改进。
Comments Accepted at the 2nd Workshop on Foundation Models for Science (ICLR 2026)
蛋白质语言模型中的推理时间毒性缓解
机构 * Laboratory of Applied Artificial Intelligence (LIAA), Institute of Computer Sciences (ICC), CONICET - Universidad de Buenos(应用人工智能实验室(LIAA)、计算机科学研究所(ICC)、CONICET - 布宜诺斯艾利斯大学) ; AI Safety Argentina (AISAR)(阿根廷人工智能安全(AISAR)) ; Goodfire ; APOLO Biotech(APOLO生物技术)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LDA方法,通过放大logit差异在推理阶段缓解蛋白质语言模型的毒性生成问题,同时保持生成质量。
知识图谱与超图变换器与仓库注意力和基于旅程的角色传输
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种结合句子和结构化数据的模型,通过仓库注意力和基于旅程的角色传输实现语言和知识表示的分离,并支持多任务学习。
Comments 9 pages
TATRA: 无需训练的实例自适应提示法通过重述与聚合
机构 * Jagiellonian University(雅盖隆大学) ; IDEAS Research Institute(IDEAS研究机构)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。
下一步嵌入预测使世界模型更强大
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 NE-Dreamer通过时间转换器预测下一步嵌入,无需解码器即可在复杂环境中提升基于模型的强化学习性能。
频谱调节:面向分布覆盖和上下文可引导性的后训练
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。
Comments ICLR 2026
通过动态重要性估计增强解码时的个性跟随以用于角色扮演代理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种基于理论的动态重要性估计方法,通过加权奖励引导解码提升角色扮演代理在动态场景中的个性跟随能力。
Comments ICLR 2026
GlassMol:通过概念瓶颈模型实现可解释的分子属性预测
机构 * Northwestern University(西北大学) ; AbbVie(阿比维)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 GlassMol通过自动化概念整理和LLM引导的概念选择,解决分子属性预测中的可解释性与性能权衡问题。
残差连接与因果偏移:揭示变换器中的结构性不一致
机构 * IMT Atlantique, Lab-STICC, UMR CNRS 6285, Brest, France(IMT Atlantique,Lab-STICC,CNRS 6285研究所,布列塔尼,法国) ; Sony Europe Ltd. Stuttgart Technology Center, EUREC, Germany(索尼欧洲有限公司,斯图加特技术中心,EUREC,德国)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究揭示了自回归变换器中残差连接与因果偏移的结构性不一致,并提出基于残差衰减的轻量级缓解方法,通过实验验证其有效性。
控制税:保持AI受控的成本
机构 * EPFL(瑞士联邦理工学院) ; MATS
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出控制税概念,通过理论框架量化控制成本,评估语言模型在对抗性环境下的安全性,并开发优化的监控策略以平衡安全与成本效益。
代理反学习:当大语言模型代理遇见机器反学习
机构 * Center for Medical Artificial Intelligence, Shandong University of Traditional Chinese Medicine(山东中医药大学中医人工智能中心) ; School of Software, Shandong University(山东大学软件学院) ; School of Medical Information Engineering, Shandong University of Traditional Chinese Medicine(山东中医药大学医学信息工程学院) ; Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SBU框架,通过同步双更新协议实现参数与记忆路径的联合反学习,有效减少敏感信息痕迹并保持数据保留质量。
Comments 9 pages, 6 figures, 6 tables
分位数优势估计:稳定LLM推理的RLVR
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 通过分位数优势估计方法,稳定RLVR训练过程,提升LLM推理性能。
面向任务的小型语言模型加速
机构 * Amazon(亚马逊)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TASC框架,通过任务自适应序列压缩方法提升小型语言模型的推理效率,同时保持任务性能。
自适应相关加权内在奖励用于强化学习
机构 * Institute for Artificial Intelligence(人工智能研究所) ; VNU-University of Engineering and Technology(越南工程与技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 ACWI通过自适应相关加权内在奖励机制提升稀疏奖励强化学习中的探索效率和样本效率。
Hello-Chat: 向真实社交音频交互迈进
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。
潜在自我反思:模型可以检测先前概念注入
机构 * ACS Research, CTS, Charles University(ACS研究机构、CTs、查尔斯大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 Qwen 32B模型能检测并识别先前注入的概念,通过提供准确的AI自我反思机制信息可显著提升检测效果,同时提高注入概念间的互信息。
Comments 28 pages, 17 figures. Submitted to ICML 2026. Workshop version submitted to ICLR 2026 Workshop on Latent and Implicit Thinking
Search-P1: 基于路径的奖励塑造用于稳定且高效的代理RAG训练
机构 * Tencent(腾讯)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 Search-P1通过路径中心奖励塑造提升代理RAG训练的稳定性和效率,实现7.7个百分点的准确率提升。
MINAR: 图神经网络中神经算法推理的机制可解释性
机构 * Pacific Northwest National Laboratory, Richland, WA(太平洋西北国家实验室) ; Halıcıoğlu Data Science Institute, University of California, San Diego, San Diego, CA(哈利奇奥格鲁数据科学研究所,加州大学圣地亚哥分校) ; Department of Computer and Information Science, University of Pennsylvania, Pennsylvaina, PA(计算机与信息科学系,宾夕法尼亚大学) ; Department of Mathematics, University of Washington, Seattle, WA(数学系,华盛顿大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 MINAR是一种用于图神经网络中神经算法推理的机制可解释性工具,通过归因修补方法发现电路,揭示训练过程中的电路形成和剪枝机制。
面向常规和罕见OR事件可控视频合成
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Technical University Munich(慕尼黑技术大学) ; Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种可控视频合成框架,用于生成手术室中常规和罕见事件,以支持环境智能模型的发展。
Comments Accepted to IPCAI 2026 and submitted to IJCARs