Evaluating Interactivity: Toward Automated Assessment of AI-Generated Explorable Explanations
评估交互性:迈向AI生成的可探索解释的自动化评估
专题命中 安全评测 :alignment(abstract)
AI总结 提出EE-Eval框架,将交互性形式化为有限状态机,通过图度量和嵌入比较评估AI生成可探索解释的结构与语义相似性,优于现有基线。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
评估交互性:迈向AI生成的可探索解释的自动化评估
专题命中 安全评测 :alignment(abstract)
AI总结 提出EE-Eval框架,将交互性形式化为有限状态机,通过图度量和嵌入比较评估AI生成可探索解释的结构与语义相似性,优于现有基线。
人工智能用于软件架构:文献综述与未来之路
专题命中 安全评测 :trustworthy(abstract)
AI总结 通过系统文献综述,识别AI在软件架构中应用的14个主题领域和6个AI特有挑战,并基于实证访谈提出五大战略支柱的研究路线图。
Comments 37 pages, accepted for publication in TOSEM
重构与地外自主性的AGI对抗
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。
理解大型语言模型中的审查:从机制到治理
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。
手术室中用于质量保证的人工智能
机构 * Fondazione Policlinico Universitario Agostino Gemelli IRCCS(阿戈斯蒂诺·杰梅利大学综合医院基金会IRCCS) ; Institute of Image-Guided Surgery, HU-Strasbourg(斯特拉斯堡大学医院图像引导外科研究所) ; University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,法国国家科学研究中心,法国国家健康与医学研究院,ICube实验室,UMR7357) ; Scialytics SAS(Scialytics SAS公司)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出AI赋能的手术质量保证框架,利用手术视频数据实现术中质量持续评估与改进,并讨论了关键挑战。
humancompatible.detect: 一个用于检测AI模型偏见的Python工具包
机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出humancompatible.detect工具包,通过最大子组差异和子采样∞距离方法解决传统方法在可扩展性和可计算性上的挑战,提供易用的API和多个示例。
Comments 6 pages, 5 figures
Journal ref SoftwareX 35, 102827 (2026)
探究LLM赋能的异议少数群体在权力不平衡群体决策中的支持:反驳与调解作为干预策略
专题命中 AI治理与伦理 :safety(abstract)
AI总结 本研究开发了LLM赋能的异议少数支持系统,通过AI生成的反驳或AI调解消息来关注少数观点,实验发现反驳增强满意度但调解增加参与却降低心理安全感,揭示了参与与心理安全之间的支持悖论。
Comments Accepted at CSCW 2026
验证门控的智能工业多机器人系统任务状态治理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。
关于自改进在线大语言模型对齐的收敛性
机构 * The University of Hong Kong(香港大学) ; Yale University(耶鲁大学) ; Purdue University(普渡大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 针对SAIL算法收敛性分析缺失的问题,提出SAIL-RevKL正则化目标,证明其满足PL条件并实现近线性样本复杂度,在MuJoCo和LLM对齐任务上优于原始SAIL。
Comments Accepted at UAI 2026
LOPA:通过潜在序数原型对齐增强口语评估
机构 * National Taiwan Normal University(国立台湾师范大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。
基于全局邻域对齐哈希的无监督数据高效跨模态检索
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) ; College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) ; VinUniversity(Vin大学)
专题命中 其他安全 :alignment(title,abstract)
AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。
利用知识图谱和大语言模型自动化因果规范生成
机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。
邪恶光谱:优化器如何放大或抑制涌现性失调
机构 * Astra Fellows Program(Astra Fellows 项目) ; University of Cambridge(剑桥大学) ; Durham University(杜伦大学) ; University of Toronto(多伦多大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究优化器选择对LLM涌现性失调的影响,发现优化器导致7倍失调率差异,Muon通过隐式正则化奇异值分布保持对齐,谱正则化可缓解失调。
临床前组织病理学中的毒性评估:基于类别感知马氏距离的已知和新型异常检测
机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) ; Boehringer Ingelheim Pharma GmbH and Co.(勃林格殷格翰制药有限公司) ; Boehringer Ingelheim GmbH(勃林格殷格翰公司)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出基于AI的异常检测框架,利用类别感知马氏距离和LoRA微调DINOv2,在啮齿动物肝脏全切片图像中识别健康组织、已知病理和分布外异常,实现像素级检测,降低假阴性和假阳性率。
Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架
机构 * UNIST(蔚山科学技术院) ; LinqAlpha ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Florida(佛罗里达大学) ; Blackstone(黑石集团) ; Hanwha Life(韩华生命)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。
Comments 17 pages, 5 figures, 12 tables
DDIAgents: 机制条件上下文流用于药物相互作用预测
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所) ; Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域学部)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出DDIAgents多智能体框架,通过动态知识编排预测药物相互作用,减少无关信息并生成可解释推理,性能优于现有方法。
AI伴侣社区中的拟人化:年龄、性别与情感相关性
专题命中 其他安全 :safety(abstract);分类 cs.CY
AI总结 本研究利用Reddit数据,分析AI伴侣社区中用户年龄、性别与拟人化倾向及情感表达的关系,发现成年人和女性更易拟人化,积极情感与拟人化正相关,且这些关系在成年人中更强。
曲率引导的模块定位用于后门大语言模型的低秩解毒
机构 * AIVault Inc.(AIVault公司)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出一种基于激活修补和Fisher/K-FAC曲率分析的机制引导权重空间修复框架,定位并低秩修复后门大语言模型中最有影响力的模块,有效抑制触发条件恶意行为同时保持良性性能。
机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解
专题命中 其他安全 :alignment(abstract)
AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。
Comments 13 pages, 15 figures
AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)
专题命中 其他安全 :alignment(abstract)
AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。
Comments 21 pages, 10 figures and 8 tables
基于失败的深度强化学习智能体测试方法
专题命中 其他安全 :safety(abstract)
AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。
Comments 22 pages
AC3S: 面向3D感知合成数据生成的自适应条件控制
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学) ; College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)
专题命中 其他安全 :alignment(abstract)
AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。
Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/
CasaMaestro:用于房屋级3D重建的多视角全景图
机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)
专题命中 其他安全 :alignment(abstract)
AI总结 提出CasaMaestro模型,仅需20-50张稀疏多视角室内全景图,即可直接预测度量深度和相机位姿,实现全屋快速点云重建,是首个支持房屋级重建的多视角全景模型。
Comments Accepted to ECCV2026
REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配
机构 * Tsinghua University(清华大学) ; Southern University of Science and Technology(南方科技大学) ; Beihang University(北京航空航天大学) ; Zhejiang University(浙江大学)
专题命中 其他安全 :alignment(abstract)
AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。
通过感知验证自训练提升视觉-语言模型的推理能力
机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) ; IBM Research(IBM研究院)
专题命中 其他安全 :alignment(abstract)
AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。
Comments Accepted at The European Conference on Computer Vision 2026
MetricHMSR:基于单目图像的度量人体网格与场景恢复框架
机构 * Tsinghua University(清华大学) ; Beijing Normal University(北京师范大学) ; Beihang University(北京航空航天大学)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。
基于关节角度运动图像与令牌-补丁后期交互的细粒度运动检索
机构 * Aalto University(阿尔托大学) ; Fudan University(复旦大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 其他安全 :alignment(abstract)
AI总结 提出一种可解释的关节角度运动表示,结合预训练视觉Transformer和令牌级后期交互机制,实现文本与3D运动之间的细粒度对齐,在HumanML3D和KIT-ML上超越现有方法。
PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新
机构 * KDDI Research, Inc.(KDDI研究所)
专题命中 其他安全 :alignment(abstract)
AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。
Comments Accepted to ECCV 2026
SysVCoder: 一种LLM驱动的系统级设计系统性生成框架
专题命中 其他安全 :alignment(abstract)
AI总结 提出SysVCoder框架,通过两阶段生成流水线、规则对齐机制和领域特定检索增强生成策略,提升Verilog系统级设计的生成质量与效率,在功能正确性上优于现有方法。
Comments This paper is accepted at APPT'26