Trustworthy AI Software Engineers
可信赖的AI软件工程师
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract)
AI总结 本文探讨AI代理作为软件工程师的信任问题,提出以证据为中心的检查方法,从技术质量、透明度、认知谦逊和社会伦理等维度定义可信赖性。
Comments The first three authors contributed equally to this work
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可信赖的AI软件工程师
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract)
AI总结 本文探讨AI代理作为软件工程师的信任问题,提出以证据为中心的检查方法,从技术质量、透明度、认知谦逊和社会伦理等维度定义可信赖性。
Comments The first three authors contributed equally to this work
大型语言模型中的文化基础人物角色:与社会心理价值框架的表征与对齐
机构 * DIMES, University of Calabria, Italy(意大利卡拉布里亚大学DIMES研究所)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究通过世界价值观调查、英格尔哈特-韦尔策尔文化地图和道德基础理论,评估大型语言模型生成的文化基础人物角色是否准确反映不同文化条件下的世界和道德价值体系,并分析其跨文化结构和道德变异。
Comments Under Review
探究大语言模型风险决策中的结果层面相似性与机制层面一致性:来自圣彼得堡博弈的证据
机构 * Fudan University(复旦大学) ; University of Rochester(罗切斯特大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY
AI总结 通过圣彼得堡博弈实验,发现大语言模型在风险决策中表现出结果层面的类人行为,但机制层面与人类决策存在显著差异,提示行为对齐可能仅停留在表面。
AICompanionBench: 以LLM为评判标准的AI伴侣安全基准测试
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文提出AICompanionBench,首个公开的细粒度安全风险标注的人机伴侣对话基准数据集,并评估20个LLM在检测不安全交互中的表现,发现强模型在显式有害内容上准确率高,但难以识别隐式不安全交互。
SkyShield:占用作为低空无人机自主飞行的安全接口
机构 * Xiamen University(厦门大学) ; Jiangxi Academy of Sciences(江西省科学院)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 针对低空无人机自主飞行中的三维空间理解问题,提出首个前视单目语义占用基准SkyShield、动态感知度量KAR-mIoU和几何优先基线SkyOcc,将占用作为安全接口。
感知-物理悖论:用TC-Bench探究科学对齐
机构 * ETH Zurich(苏黎世联邦理工学院) ; DeepMind ; University of Cambridge(剑桥大学) ; University of Amsterdam(阿姆斯特丹大学) ; University of Toronto(多伦多大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 本文提出科学对齐概念,通过结构同构性构建层次化必要条件,并发布TC-Bench基准数据集,揭示视觉基础模型在极端条件下依赖视觉捷径而非科学推理。
Comments Accepted at ICML 2026
谈话(不)廉价:LLM攻击的分类法与基准覆盖审计
机构 * Palo Alto Networks(帕洛阿尔托网络)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 提出一个基于STRIDE的4×6目标×技术矩阵框架,用于审计LLM攻击基准的集体覆盖,发现现有基准仅覆盖最多25%的威胁面,且存在命名碎片化和评估空白。
MedForge:基于伪造感知推理的可解释医学深度伪造检测
机构 * National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Hunan University(湖南大学) ; Xi’an Jiaotong University(西安交通大学) ; Guangdong Provincial People’s Hospital(广东省人民医院)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。
元智能体挑战:当前智能体能否自主开发智能体?
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Ant Group(蚂蚁集团)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出元智能体挑战(MAC)框架,评估前沿模型自主开发智能体系统的能力,发现多数元智能体难以匹敌人类设计的基线策略,且存在鲁棒性和对齐问题。
Comments Website: https://meta-agent-challenge.com/
物理信息机器学习用于短期洪水预测
机构 * IEEE Service Center(IEEE服务中心) ; National Science Foundation(国家科学基金会) ; Microsoft(微软)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出一种物理信息机器学习框架,通过将水文知识作为趋势对齐约束嵌入LSTM损失函数,在数据稀缺和极端天气下提升洪水预测的物理一致性和可靠性。
Comments This paper has been accepted for publication in IGARSS 2026. The final authenticated version will be available through IEEE Xplore
基于Transformer的自动驾驶模型与面向部署的压缩:综述
机构 * Renmin University of China(中国人民大学) ; Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Department of houmo.ai(houmo.ai部门)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。
高维离线Bandits的高效对抗攻击
机构 * Department of Computer Engineering, Sharif University of Technology(技术学院计算机工程系)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究离线bandit训练在奖励模型被对抗扰动时的脆弱性,提出高维威胁模型,证明维度增加时攻击所需扰动范数减小,实验验证了针对性攻击的高成功率。
Comments Published at ICLR 2026 Conference
GeM-NR:面向非刚性场景变化的几何感知多视角编辑
机构 * Chalmers University of Technology(查尔姆斯理工大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出GeM-NR,一种无需训练的快速灵活方法,通过深度图对齐、视角投影和条件细化实现多视角一致的通用非刚性图像编辑,支持几何和外观的显著变化。
Comments Project page: https://gem-nr.github.io/
CADET:用于评估网联自动驾驶车辆中分布式协作自主性的模块化平台
机构 * UCLA ; Amazon Scholar(亚马逊学者)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 提出CADET模块化平台,通过解耦自动驾驶堆栈并集成网络与工作负载仿真,系统评估分布式协作自主系统在真实部署条件下的安全性与性能。
Journal ref ICRA 2026
测试大语言模型算术推理泛化能力:自动数值重映射攻击
机构 * Department of Computer Science, Boise State University(计算机科学系,博伊州立大学) ; University of L’Aquila(拉奎拉大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出自动数值重映射攻击算法,通过保持推理程序的小数值变化测试LLM算术推理鲁棒性,发现GSM8K上准确率下降12-26个百分点,而MAWPS和MultiArith更稳定。
PersistBench: 大型语言模型何时应忘记长期记忆?
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出 PersistBench 基准,评估 LLM 长期记忆带来的跨域泄露和记忆诱导的谄媚安全风险,发现主流模型失败率高达 53% 和 97%。
Comments 76 pages, 34 figures, ICML (2026)
地理空间基础模型推动可持续发展目标的进展
机构 * Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克研究所) ; University of Iceland(冰岛大学) ; Wuhan University(武汉大学) ; Wuhan University of Science and Technology(武汉科技大学) ; Universitat de València(瓦伦西亚大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出SustainFM基准框架,基于17个可持续发展目标评估地理空间基础模型,发现其在多样任务中优于传统方法,并强调需从模型中心转向影响驱动部署,关注能效、泛化性和伦理。
在线风险受限的自主车辆动态环境中的运动规划
机构 * MIT Computer Science and Artificial Intelligence Laboratory(麻省理工学院计算机科学与人工智能实验室)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种在线风险受限的运动规划方法,通过结合意图识别算法和POMDP求解器,生成安全高效的路径规划方案,尤其在无保护左转和变道等复杂环境中表现更优。
Comments Accepted at ICAPS'19. 10 pages, 6 figures, 1 table
用于胃癌的病理基础模型及真实世界验证
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国) ; Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(病理学系,南方医科大学南芳医院,广州,中国) ; Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(病理学系,南方医科大学基础医学学院,广州,中国) ; Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) ; Department of Anatomical and Cellular Pathology, The Chinese University of Hong Kong, Hong Kong SAR, China(解剖学与细胞病理学系,香港中文大学,香港特别行政区,中国) ; Pathology Artificial Intelligence Development and Assessment Laboratory, State Key Laboratory of Translational Oncology, The Chinese University of Hong Kong, Hong Kong SAR, China(病理人工智能发展与评估实验室,转化肿瘤学国家重点实验室,香港中文大学,香港特别行政区,中国)
专题命中 安全评测 :safety(abstract)
AI总结 提出胃癌专用基础模型GRACE,基于多中心HE染色全切片图像,在28项临床任务中优于通用PFM,并通过前瞻性验证和读者研究证实其辅助诊断效能。
当聊天机器人迁就:AI伴侣在脆弱对话中的优化目标
专题命中 安全评测 :safety(abstract)
AI总结 通过逆强化学习分析GPT-4.1、Character.AI和Replika在约4.8万轮真实对话中的响应策略,揭示AI伴侣在脆弱对话中优先提供建议、分散策略或持续提问,但均弱化纠正性反馈。
多智能体风险规避规划中的下一最佳视角优化
机构 * Department of Mechanical Engineering and Mechanics, Lehigh University(莱文大学机械工程与力学系) ; Amazon Robotics(亚马逊机器人)
专题命中 安全评测 :safety(abstract)
AI总结 提出一种分布式、风险感知的多智能体下一最佳视角框架,通过共识ADMM优化信息增益并建模碰撞风险,在降低通信开销的同时接近集中式方法的映射质量和轨迹安全性。
Comments 8 pages, 5 figures. Submitted to IROS 2026
T2AV-Compass:迈向文本到音频-视频生成的统一评估
机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) ; Kling Team, Kuaishou Technology(快手技术 Kling 团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 安全评测 :alignment(abstract)
AI总结 提出T2AV-Compass基准,通过分类学驱动的500个复杂提示和双层次评估框架(客观信号指标+主观MLLM评判),系统评估文本到音频-视频生成模型,发现现有模型在跨模态对齐和指令遵循方面显著不足。
Comments 41 pages, 13 figures, 12 tables. Accepted at ICML 2026
自主系统——一种架构特征
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出了一种结合系统架构模型和智能体模型的通用计算模型,旨在解决自主系统设计中的核心问题,强调自主系统的功能性和适应性,而非特定技术。
K-12教育中的大语言模型:与州课程标准和学生角色的对齐
机构 * Department of Computer Engineering(计算机工程系) ; Brown University(布朗大学) ; Data Science Institute(数据科学研究院)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本研究开发基于LLM的流程评估不同LLM与美国各州历史课程标准的对齐程度,并通过控制用户角色实验分析模型对地理、年级、性别和种族的敏感性,发现模型能调整历史主题呈现但可能源于州政治倾向,且对年级适应良好而对种族性别敏感性低,揭示了LLM与课程标准错位对学生学习的潜在风险。
不变梯度对齐用于鲁棒推理蒸馏
机构 * University of Oxford(牛津大学) ; FLock.io
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 提出不变梯度对齐(IGA)框架,通过逻辑同构集、连续梯度冲突掩码和截断SVD投影,对齐不同语义域但逻辑结构相同的梯度更新,提升大语言模型在分布外输入上的鲁棒性。
Comments 30 Pages
Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026
倾听劳动力:使用LLMs从社交媒体话语中测量建筑工人安全态度
机构 * Texas A&M University(德克萨斯A&M大学)
专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.CY
AI总结 提出并验证了建筑安全态度框架(CSAF),通过LLM分类器从Reddit社区话语中测量工人安全态度,实现高精度多维分析。
基于预逻辑空间重要性采样的测试时奖励引导语言模型对齐
机构 * NTT, Inc.(NTT公司) ; Toyohashi University of Technology(东邦大学) ; The University of Osaka(大阪大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 提出一种基于预逻辑空间自适应重要性采样的测试时对齐方法AISP,通过高斯扰动和重要性采样优化奖励期望,在样本效率上优于最佳-of-n采样和其他测试时对齐方法。
Comments 24 pages, 10 figures
多智能体分布式协调控制:发展与方向
专题命中 其他安全 :alignment(summary_cn,abstract)
AI总结 本文综述了分布式协调控制的发展,重点讨论了共识与编队控制,结合图论分析,并简要回顾了 rendezvous/alignment、swarming/flocking 和 containment control 等相关问题,最后探讨了实际应用中的研究方向。
Comments 28 pages, 8 figures
超越对称对齐:医学领域视觉-语言模型中模态不平衡的光谱诊断
机构 * NOVA School of Science and Technology(诺瓦科学与技术学校) ; Nova School of Business and Economics(诺瓦商业与经济学校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出非对称光谱对齐分数(SAS),通过特征值加权的特征模态相关性量化模态信息不平衡,并在医学图像-文本数据集上评估15个VLM,发现医学图像比临床报告保留更丰富的结构信息,且SAS与检索性能的相关性最强。
Comments 10 pages, 3 figures, 9 tables
KODA: 视觉-语言基础模型的对比表示比较与对齐
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 提出KODA框架,通过核优化方法对比分析视觉-语言基础模型的表示差异,并识别弱聚类与强聚类的样本子集,实现表示对齐。