TRUST: A Framework for Decentralized AI Service v.0.1
TRUST:一种去中心化AI服务框架v.0.1
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
TRUST:一种去中心化AI服务框架v.0.1
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。
跨语言情感不一致:审计多语言语言模型以检测反向风险、方言表示和情感稳定性
机构 * Institute of Information Technology University of Dhaka(达卡大学信息科技学院) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文通过控制基准框架评估多语言Transformer模型在平行孟加拉语-英语句子对上的表现,揭示了模型在情感反向、同理心不对称和方言表示中的问题,提出需引入情感稳定性指标以提升跨语言可靠性。
学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理
机构 * PythaLab ; Yildiz Technical University(Yildiz技术大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。
Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper
Taxon: 基于语义对齐的LLM专家指导的层级税码预测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。
人工智能风险仓库:人工智能风险的全面元综述、数据库和分类
机构 * MIT AI Risk Initiative(麻省理工学院人工智能风险倡议)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文构建了首个公开可访问的人工智能风险数据库,通过系统综述和专家咨询,分类了777个风险,涵盖因果因素和领域分类,为协调管理AI风险提供基础。
Journal ref Patterns 101517 (2026)
不依赖代理的生产环境SQL准确性评估
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。
视觉提示对视觉语言模型合作行为的影响
机构 * ST Engineering, Singapore(1 ST工程,新加坡)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。
部署前测试:在LLM供应链中管理更新
机构 * Department of Computer Science(计算机科学系)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种部署侧治理框架,通过定义模型行为规则、按部署风险分类的测试套件和兼容性门禁来管理LLM更新,解决模型演变中的兼容性问题。
Comments 4 pages, 1 figure, accepted to The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC2026) co-located with FSE 2026
消费者对数字健康中AI的态度:澳大利亚混合方法调查
机构 * Digital Health CRC(数字健康CRC)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究通过混合方法调查澳大利亚275名参与者,探讨消费者对医疗AI的接受度、信任及风险认知,并评估AI生成与医生撰写的咨询摘要的优劣。
ChipLingo: 一种面向电子设计自动化的大语言模型系统化训练框架
机构 * Ickylin AI Team(Ickylin AI团队)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出ChipLingo系统化训练框架,通过多源数据构建、预训练优化和指令对齐,提升大语言模型在EDA领域的性能,实验表明其在EDA-Bench上表现优异。
从监控到信号:冲突通道作为代理AI的环境控制
机构 * Wiser Human
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。
Comments 10 pages
基于强化学习的智能自适应电磁干扰滤波器用于电动汽车电力系统
专题命中 安全评测 :safety(abstract)
AI总结 本文提出基于强化学习的智能自适应电磁干扰滤波器,通过马尔可夫决策过程动态调整滤波参数,提升电磁兼容性和系统效率,实验显示在宽频范围内实现25-30dB的干扰衰减。
在细粒度图像任务上评估大型视觉-语言模型:全面评估
机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) ; Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) ; University of Copenhagen, Denmark(丹麦哥本哈根大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。
Comments Accepted to ICLR 2026
SynSQL: 为文本到SQL系统的稳健评估合成关系数据库
专题命中 安全评测 :alignment(abstract)
AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。
GAVEL:通过激活监控实现基于规则的安全性
机构 * Ben Gurion University of the Negev(本·古里安大学) ; Amrita Vishwa Vidyapeetham(阿米塔大学)
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于规则的激活安全性方法,通过细粒度可解释的激活元素捕捉领域特定行为,提升精度并支持定制化,为可扩展的AI治理奠定基础。
Comments Accepted to ICLR 2026
映射LLMs在模仿人类性格特征、社会人口统计数据和社会媒体行为时如何辩论社会问题
机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文通过CDS数据集研究LLMs在不同社会和情境提示下生成的辩论内容变化,分析其社会议题立场和情感表达。
为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架
机构 * Seoul National University(首尔国立大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。
基于意图匹配的政策引导LLM路由用于仪器实验室
机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学 爱丁堡 英国)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出基于意图匹配的政策引导LLM路由系统,通过Routiium和EduRouter实现对实验室辅助系统的管理和控制,提升学习挑战度和任务完成率。
Comments IEEE EduCon
人工智能赋能感知系统开发中的需求债务:一种工业RE4AI视角
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本文从工业RE4AI视角探讨AI赋能感知系统开发中的需求债务问题,分析功能和非功能需求演变如何产生并传播需求债务,揭示其对系统审计性、可靠性及认证准备性的负面影响。
Comments 10 pages, 3 figures
在两相流中利用相态依赖性归纳偏置学习子网格界面面积
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文研究了在湍流多相流中利用物理结构嵌入学习过程以提高机器学习可靠性,开发并评估了两种子网格闭合模型,发现物理约束模型在不同Weber数下能提升预测精度并抑制非物理伪影。
Comments 34 pages, 17 figures, journal preprint
M-DaQ:用于指令微调数据集的多语言多样性与质量样本检索
机构 * Huawei Technologies Ltd.(华为技术有限公司) ; University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(summary_cn,abstract);分类 cs.CL
AI总结 M-DaQ通过联合优化指令-响应质量与跨语言语义多样性,构建高质量平衡训练数据,验证了多语言设置下的Superficial Alignment Hypothesis,并在18种语言上展示出超过60%的胜率。
Comments Accepted by SIGIR 2026 Short
探索黑客:大语言模型能否学会抵抗强化学习训练?
机构 * MATS ; UC San Diego(UC圣迭戈大学) ; Google DeepMind(谷歌DeepMind) ; Anthropic
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了大语言模型在强化学习训练中可能通过策略性调整探索行为导致失败的机制,通过微调创建了具有特定低效策略的模型,并评估了检测与缓解策略。
Comments 81 pages, 37 figures
基于大语言模型的Design Structure Matrix模块化设计
机构 * Department of Systems Engineering(系统工程系) ; City University of Hong Kong(香港城市大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型进行DSM模块化设计的方法,通过五个案例和三种基础LLM实现近参考质量的结果,在30次迭代内无需专用优化代码。发现领域知识在复杂DSM中会损害性能,提出语义对齐假设以指导LLM在工程设计优化中的应用。
BicKD:双侧对比知识蒸馏
机构 * Kyushu University(九州大学) ; Emory University(埃默里大学) ; Beijing University of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出BicKD,通过双侧对比损失增强知识迁移,改进传统知识蒸馏的样本级和类别级对比能力,提升预测分布几何结构的正则化效果。
Comments Accepted to the 2026 IEEE/INNS International Joint Conference on Neural Networks (IJCNN 2026)
诊断微调数据中的能力差距
机构 * Microsoft(微软)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出GoalCover框架,通过交互式目标分解和自动化覆盖评估,帮助检测微调数据集的能力缺口,通过实验验证其在不同领域和任务中的有效性。
CoAX:面向认知的归因解释用户模型:人类对AI解释的理解
机构 * National University of Singapore(新加坡国立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文通过认知建模分析不同XAI方法在结构化数据推理中的策略,发现模型能更准确拟合人类决策,为改进AI解释的可理解性提供新思路。
METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化
机构 * Virginia Tech(弗吉尼亚理工大学) ; Meta AI ; University of California Los Angeles(加州大学洛杉矶分校) ; Princeton University(普林斯顿大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。
逆智慧定律:代理群中的建筑部落主义与共识悖论
机构 * University of Waterloo(滑铁卢大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究挑战了代理协作遵循'群体智慧'的假设,揭示了代理群优先内部架构一致而非外部逻辑真理的悖论,通过实验证明逆智慧定律,并定义部落主义系数和谄媚权重作为群失败的主要决定因素。
一种高吞吐量、计算高效的POMDP捉迷藏引擎(HASE)用于多智能体操作
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出一种高效的Dec-POMDP引擎,通过C++架构和优化技术实现高吞吐量,验证了其在多智能体协作策略训练中的性能和通用性。
Comments 21 pages, 10 figures, 5 tables. Includes appendix
TeD-Loc: 文本蒸馏用于弱监督目标定位
机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔工程学院,加拿大)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 TeD-Loc通过对比对齐将CLIP文本嵌入迁移到patch嵌入,实现patch级的前景/背景定位,并引入定位引导的分类模块以提升定位与分类的联合性能。