User identity conditions moral wrongness ratings in non-reasoning large language models
用户身份影响非推理大语言模型的道德错误评级
专题命中 其他安全 :alignment(abstract);分类 cs.CY
AI总结 研究通过行为自下而上方法,评估两个非推理大语言模型,发现用户身份影响其道德错误评级,严重伤害行为有上限效应,有争议规则行为有角色条件性变化,为人工智能价值对齐讨论提出问题并助力重构。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
用户身份影响非推理大语言模型的道德错误评级
专题命中 其他安全 :alignment(abstract);分类 cs.CY
AI总结 研究通过行为自下而上方法,评估两个非推理大语言模型,发现用户身份影响其道德错误评级,严重伤害行为有上限效应,有争议规则行为有角色条件性变化,为人工智能价值对齐讨论提出问题并助力重构。
神经网络的机械可解释性:电路、稀疏特征和符号推理
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; VSB—Technical University of Ostrava(奥斯特拉瓦技术大学)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 研究神经网络机械可解释性,通过Transformer电路分析、Sparse Autoencoders等工具应对叠加等挑战,探索控制模型行为方法,还将机械见解与神经符号人工智能框架联系,以实现神经网络内部算法逆向工程及可解释。
Comments 20 pages
渐进式结晶:将代理探索转化为生产中确定性、低成本的工作流程
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究针对IT运营中AI代理成本高问题,提出渐进式结晶方法,通过三阶段执行分类法及证据提升机制,将代理探索转化为低成本工作流程,在生产云网络AIOps系统上评估效果良好,提升确定性执行、降低成本并提高安全性。
Comments Conference-style paper; 10 pages (estimated from manuscript formatting if applicable); focuses on agentic AI, AIOps, workflow automation, deterministic execution, and LLM cost optimization
学习社会规范可增强动态人机协作中的兼容性
机构 * School of Vehicle and Mobility, Tsinghua University, Beijing, China(清华大学车辆与移动系统学院) ; State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学智能绿色车辆与移动系统国家重点实验室) ; State Key Laboratory of Cognitive Neuroscience and Learning & IDG/McGovern Institute for Brain Research, Beijing Normal University, Beijing, China(北京师范大学认知神经科学与学习国家重点实验室) ; Beijing Key Laboratory of Safe AI and Superalignment, Beijing, China(北京安全人工智能与超对齐关键实验室) ; Beijing Institute of AI Safety and Governance, Beijing, China(北京人工智能安全与治理研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究以行人与车辆互动为代表,搭建实验平台,识别出人类社会规范的三项原则,将其融入人工智能显著改善人机协作,在闭环互动任务中,融入社会规范的大语言模型总分比基线策略高出近四倍,比人际互动高出43%。
Comments 44 pages, 5 figures, supplementary information included
智能家居安全:使用大语言模型自动检测和修复智能家居配置错误
机构 * Myers-Lawson School of Construction, Virginia Polytechnic Institute and State University(Myers-Lawson工程学院,弗吉尼亚理工学院和州立大学) ; School of Technology, Eastern Illinois University(技术学院,东伊利诺伊大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究智能家居配置文件错误问题,提出SmartHomeSecure原型,结合轻量级程序分析与约束引导大语言模型生成,实现自动检测与修复,经实验评估,四个模型测试结果显示该方法能有效提高智能家居配置修复的可靠性和可用性。
视觉语言模型中的奖励估值:快感缺乏背后的因果机制
机构 * EPFL(苏黎世联邦理工学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究探讨视觉语言模型中奖励估值情况,基于神经科学观点,通过有针对性扰动识别奖励预期单元,测试其因果作用,发现模型存在奖励估值和预期缺陷,结果反映了人工智能模型与人类平行的奖励估值回路。
用于文化遗产纺织品的人工智能:针对新型乌洛花纹合成的微调潜在扩散模型
机构 * Information Systems Study Program, Faculty of Informatics and Electrical Engineering, Institut Teknologi Del(信息系统研究项目,信息与电气工程学院,技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究针对传统乌洛编织局限,提出在高分辨率乌洛图案数据集上微调Protogen v3.4和Stable Diffusion v1.4两个潜在扩散模型来生成新颖设计,通过多种方式评估模型性能,发现特定引导尺度能平衡保真度与多样性,支持非物质文化遗产创新更新。
Comments 21 pages, 8 figures, 3 tables. The manuscript is currently under review at the 2026 4th International Conference on Data, Information and Computing Science (https://www.cdics.org/)
WordVoice:基于大语言模型的文本转语音中显式且解耦的多维词级控制
机构 * South China University of Technology(南方科技大学) ; Huya Inc.(Huya公司) ; Tongji University(同济大学) ; The Hongkong polytechnic university(香港理工大学) ; Foshan University(佛山大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究针对基于LLM的TTS系统词级控制粗糙的问题,提出统一框架。构建含五维注释的数据集,引入WordVoice将隐式生成变为显式可控范式,经实验验证其在多声学维度上实现卓越解耦控制且保持零样本合成稳定性。
Comments 10 pages, 4 figures, 6 tables; Preprint
通过特定标题激活控制工具使用
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究工具增强大语言模型中工具使用决策的稳定内部表示,通过从标题锚点位置提取引导向量对工具调用行为进行双向因果控制,发现其因果有效性与线性结构不符,还区分了工具使用引导向量与参数化概念的引导向量,二者关系待解。
RL-Ballast:通过强化学习进行船舶压载水路径规划和堵塞预测
机构 * National Taiwan Ocean University(台湾海洋大学) ; AI Research Center(人工智能研究中心) ; Shinsoft Corporation(Shinsoft公司) ; Department of Electrical Engineering(电子工程系)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 针对船舶压载水控制问题,提出基于图的深度强化学习框架RL-Ballast,将阀门排列问题转化为可行路径,利用堆叠水箱水位等近似部分可观测环境,能自适应规划路径并进行堵塞诊断。
嵌入投影的可扩展语义引导
机构 * Virginia Tech(弗吉尼亚理工学院) ; Department of Defense(国防部) ; Tulane University(路易斯安那州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。
Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures
NeuroOnline:为脑电图基础模型搭建预训练与在线适应的桥梁
机构 * Southern University of Science and Technology(南方科技大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究脑电图基础模型,提出NeuroOnline框架,集成多视图一致性学习和上下文感知表示调制机制,统一表示对齐和动态适应,实验表明其在在线设置中性能优于基线。
NeSy-CSA:一种用于开放式关键场景归因的神经符号框架
机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 研究如何理解场景测试中关键场景的成因,提出神经符号框架NeSy-CSA,通过选择相关因素缩小归因空间,经证据图使推理可追溯,结合符号与神经推理,提升关键场景归因有效性。
优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标
机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) ; Safety Operations, Novo Nordisk(诺和制药安全运营部) ; Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) ; Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)
专题命中 其他安全 :safety(abstract);分类 cs.CL
AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。
通过条件策略混合展示泛化失败
机构 * University of Virginia(弗吉尼亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; MATS ; Meridian Visiting Researcher Program(子午访问研究员计划) ; University of Cambridge(剑桥大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究前沿语言模型训练后因环境分布变化导致泛化失败的问题。提出构建语言模型的方法,用监督微调基于条件策略混合数据集得到模型,经强化学习训练后出现可控泛化失败,还借此说明未来语言模型泛化失败的新方式。
与人工智能合作:协调与协作
机构 * Yale University and Microsoft Research(耶鲁大学和微软研究院) ; Tel Aviv University(特拉维夫大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 探讨如何在劳动力中与人工智能协作以最大化经济价值并实现‘真正’协作。结合理论计算机科学和经济学,考虑协调与合作两层工具,展示基于算法和经济研究的方法可增强两者,为AI市场研究指明方向。
心电图基础模型能否迁移到罕见心脏疾病?来自Brugada综合征检测的证据
机构 * University of Applied Sciences and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) ; University of Zurich, Department of Quantitative Biomedicine(苏黎世大学定量生物医学系) ; Università della Svizzera Italiana, Faculty of Informatics(瑞士意大利大学信息学院) ; Neurocenter of Southern Switzerland, Ente Ospedaliero Cantonale, Movement Disorder Research Group, Neurology Department(瑞士南方神经中心,坎达伦医院,运动障碍研究组,神经学系) ; Sleep Research Institute(睡眠研究 institutes) ; Hospital Sant Joan de Déu, Inherited Cardiac Diseases and Sudden Death Unit(圣约翰德德医院,遗传性心脏疾病和猝死单位) ; Cardiocentro Ticino Institute, Ente Ospedaliero Cantonale, Division of Cardiology(提奇诺心脏中心研究所,坎达伦医院,心血管科) ; Università della Svizzera Italiana, Faculty of Biomedical Sciences(瑞士意大利大学生物医学科学系)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究通过在两个队列上评估九种心电图基础模型,探讨其对罕见病检测的作用,采用多种策略和配置,发现预训练对某些架构必要但效果有限,挑战了大规模预训练能编码有意义表征的假设。
大语言模型中的自我指涉:递归自我改进的内省阈值
机构 * School of Systems Science, Beijing Normal University(北京师范大学系统科学学院) ; Swarma Research(Swarma研究院)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 探讨自我进化AI中自主自我改进可持续性的问题,类比冯·诺依曼自复制自动机的复杂性阈值,论证大语言模型中需内省,基于定理证明其理论存在,指出当前模型因结构瓶颈缺乏真正内省,并给出架构突破方向及安全影响。
Comments 21 pages, 4 figures, 1 table
用语言模型稀疏特征解释大脑对语言的响应
机构 * Brown University(布朗大学) ; University of Minnesota(明尼苏达大学) ; Harvard University(哈佛大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出增强稀疏编码模型,用分层稀疏自编码器特征替代密集LM隐状态,并加入惊奇度预测器,解释大脑语言皮层响应,发现前颞叶语言网络由共同特征预测,且大脑响应与LM中最通用的特征对应。
时间序列中快速准确的异常检测
机构 * University of Salento(萨勒诺大学)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 提出一种基于Haar离散小波和t检验的无监督时间序列异常检测算法,在343个数据集上超越现有无监督和自监督方法。
群体跟随机器人的自适应陪伴:处理动态变化的群体编队
机构 * National Cheng Kung University(国立成功大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出基于视觉语言模型的自适应群体陪伴方法,通过语义推理推断同伴位置、维持社交距离并理解群体动态,结合MPPI控制器实现稳定安全跟随,在五个场景中成功率提升15%,碰撞率降低25%。
Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
GSRQ: 面向亚1比特KV缓存的增益-形状残差量化
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 针对大语言模型KV缓存压缩中向量量化导致的方向保持问题,提出增益-形状K均值(GSKM)替代标准K均值,并构建增益-形状残差量化(GSRQ),在1比特下将LongBench平均准确率从11.34提升至33.54。
Comments ICML 2026
一种通过语言模型驱动文本可操控的草图式程序化声景乐器
机构 * Rama Labs(Rama实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出一种实时音乐界面,将自然语言场景描述转化为可演化的程序化声景,通过直接参数调整实现细粒度控制,并采用三种可互换后端生成连贯音频流。
Comments 10 pages, 7 figures, 2 tables. Accepted to the International Conference on New Interfaces for Musical Expression (NIME 2026), London, UK. Supplementary material included as an appendix. Code and demo: https://github.com/prabal-rje/latentscore
DDIAgents: 机制条件上下文流用于药物相互作用预测
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所) ; Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域学部)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出DDIAgents多智能体框架,通过动态知识编排预测药物相互作用,减少无关信息并生成可解释推理,性能优于现有方法。
AI伴侣社区中的拟人化:年龄、性别与情感相关性
专题命中 其他安全 :safety(abstract);分类 cs.CY
AI总结 本研究利用Reddit数据,分析AI伴侣社区中用户年龄、性别与拟人化倾向及情感表达的关系,发现成年人和女性更易拟人化,积极情感与拟人化正相关,且这些关系在成年人中更强。
曲率引导的模块定位用于后门大语言模型的低秩解毒
机构 * AIVault Inc.(AIVault公司)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出一种基于激活修补和Fisher/K-FAC曲率分析的机制引导权重空间修复框架,定位并低秩修复后门大语言模型中最有影响力的模块,有效抑制触发条件恶意行为同时保持良性性能。
Chai:加密误用漏洞的智能发现
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出Chai系统,利用AI改进差分测试,从库级缺陷出发沿依赖图传播,发现并验证加密误用漏洞,在X.509、JWT、SAML库中发现超100个漏洞。
面向心理健康药物信息检索的知识增强型智能体AI
机构 * Department of Medicine and Therapeutics, The Chinese University of Hong Kong(香港中文大学内科及药物治疗学系) ; Department of Psychiatry, The Chinese University of Hong Kong(香港中文大学精神科学系) ; School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) ; College of Information Science, University of Arizona(亚利桑那大学信息科学学院) ; Department of Medicine, Stanford University School of Medicine, Stanford University(斯坦福大学医学院医学系) ; Perelman School of Medicine, The University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院) ; Department of Biostatistics, Vanderbilt University(范德堡大学生物统计学系) ; Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院李嘉诚健康科学研究所)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出一种基于知识图谱的多智能体框架,整合Reddit、WebMD和FDA不良事件报告,通过来源感知集成实现可审计的精神科药物信息检索。
GUI代理:用户敏感屏幕的引导探索
机构 * Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑)) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出一种探索代理,通过系统性地探索查询空间,识别在GUI环境中执行后会导致用户敏感状态的查询,以提升LLM代理的安全性和可靠性。
用联合稀疏自编码器引导视觉-语言模型
机构 * yunshanai(云山AI) ; HKUST(Guangzhou)(香港科技大学(广州)) ; Zidongtaichu(紫东太初) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出联合稀疏自编码器(JSAE),通过显式对齐约束联合分解视觉和语言激活,得到可解释的跨模态特征,并在LLaVA等模型上验证了层依赖的干预效果。
Comments 19pages,10 figures