AgentCanary: A Security Evaluation Framework for Autonomous AI Agents in Real Executable Environments
AgentCanary:真实可执行环境中自主AI智能体的安全评估框架
专题命中 安全评测 :safety(abstract)
AI总结 提出AgentCanary框架,通过正交风险分类、高保真执行环境和轨迹多维度评估,解决现有安全评估中风险覆盖碎片化、环境静态低保真及指标单一粗粒度的问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
AgentCanary:真实可执行环境中自主AI智能体的安全评估框架
专题命中 安全评测 :safety(abstract)
AI总结 提出AgentCanary框架,通过正交风险分类、高保真执行环境和轨迹多维度评估,解决现有安全评估中风险覆盖碎片化、环境静态低保真及指标单一粗粒度的问题。
DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估
机构 * University of California, Berkeley(加州大学伯克利分校) ; Roblox Corporation(Roblox公司)
专题命中 安全评测 :alignment(abstract)
AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。
Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face
CORRECT: 多智能体系统中基于知识迁移的浓缩错误识别
专题命中 安全评测 :alignment(abstract)
AI总结 提出CORRECT框架,利用在线缓存蒸馏错误模式,实现轻量级、免训练的错误定位,在多智能体系统中提升错误识别效率,并在七个应用上取得最高19.8%的步骤级错误定位提升。
涌现对齐与伦理人格的可投射性
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究微调大语言模型在窄任务上如何引发广泛对齐行为,通过宪法AI方法赋予模型伦理人格,发现窄对齐可投射到未训练类别,并提出对齐策略应评估可投射性。
基于化学诱导契合的表征对齐用于分子关系学习
机构 * Wuhan University of Technology(武汉理工大学) ; Yonsei University(延世大学) ; Hubei Key Laboratory of Transportation Internet of Things(湖北省交通运输物联网重点实验室) ; Dalian University(大连大学)
专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.LG
AI总结 提出ReAlignFit方法,通过引入化学诱导契合的归纳偏置动态对齐子结构表征,并利用子图信息瓶颈优化高化学功能兼容性的子结构对,以提升分子关系学习在化学空间偏移数据上的稳定性。
Comments Accepted by SIGKDD2026 AI for Science Track
大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Purdue University(普渡大学) ; Meta ; Apple(苹果公司) ; Wright State University(怀特州立大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY、cs.LG
AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。
ERAlign: 文本属性图上GNN与LLM的基于能量的表示对齐
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ERAlign框架,利用能量模型对齐GNN和LLM的表示,通过能量差异优化实现分布一致性,在8个数据集上取得最优性能。
Comments Accepted to ICML 2026
反馈对齐在自蒸馏中的作用
机构 * Gensyn
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过自蒸馏提升语言模型性能时,反馈与模型推理的结构对齐是关键因素,步级对齐批评比二元奖励或参考解更有效。
Comments Accepted to the ICML 2026 Workshop on RL from World Feedback (RLxF)
IDEAL: 深度对齐实现离散表示自编码器
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Innovation Institute(上海创新研究院) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 其他安全 :alignment(title,abstract)
AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。
Comments Code is available at https://github.com/Row11n/IDEAL
RespiraMFM:一种用于呼吸道疾病识别的对比音频-语言对齐多模态基础模型
机构 * The Ohio State University(俄亥俄州立大学) ; University of Southern California(南加州大学) ; University of Chicago(芝加哥大学)
专题命中 其他安全 :alignment(title,abstract)
AI总结 提出RespiraMFM多模态基础模型,通过对比音频-文本对齐策略整合呼吸音与临床信息,在监督和零样本任务中分别提升AUROC 9.15%和20.98%。
Comments ACL 2026 Main Conference
意见对齐与环境反馈的非局部建模:空间聚集与非共识模式
专题命中 其他安全 :alignment(title,abstract)
AI总结 提出一个注意力介导反馈的空间意见动力学模型,通过非局部对齐与注意力场耦合,推导出非局部对流-交叉扩散系统,分析显示注意力反馈扩大非共识聚类参数区间,促进空间异质性。
SARA: 语义自适应关系对齐用于视频扩散模型
机构 * Tencent Hunyuan(腾讯文英)
专题命中 其他安全 :alignment(title,abstract)
AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。
一种用于缓和AGI竞赛的庇古匹配机制
专题命中 其他安全 :alignment(abstract);safety(abstract)
AI总结 提出一种正式机制,通过监管者-匹配者促进AGI竞赛参与者资源合作,征收庇古税并投资于对齐研究,在连续时间期权框架下推导参与条件和最优活动水平。
因果集成智能体:基于LLM引导的专家重加权的层次化因果发现
机构 * The University of Melbourne(墨尔本大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Peking University(北京大学) ; Adelaide University(阿德莱德大学) ; Hong Kong Baptist University(香港浸会大学) ; The University of Sydney(悉尼大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出因果集成智能体(CEA)框架,通过线性意见池聚合不同层次的统计因果发现结果,并利用大语言模型(LLM)作为元裁判在决策边界附近动态重加权专家,从而构建更准确完整的因果图。
人机协调区域:设计具有代理性AI的人机协同体验框架
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY
AI总结 提出人机协调框架,通过显著性、参与度和活动三个维度定义协调区域,并提供输入分类、协调曲线和设计模式,用于生成、分析和沟通人机交互体验。
HANDOFF: 通过蒸馏互补教师实现人形机器人任务空间全身控制
机构 * California Institute of Technology(加州理工学院) ; The Institute for Human & Machine Cognition(人机认知研究院)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出HANDOFF框架,通过多教师KL蒸馏和上下文门控机制,将全身运动跟踪、行走和跌倒恢复三个专家策略融合为混合专家学生策略,实现基于紧凑显式接口的全身控制,在Unitree G1上达到先进的速度跟踪性能并扩展了操作工作空间。
Comments 22 pages, 9 figures, Project page: https://lzyang2000.github.io/HANDOFF/
Falcon-X:面向异构多变量建模的时间序列基础模型
机构 * Ant Group(蚂蚁集团)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对现有时间序列基础模型在语义对齐和关系表达上的局限,提出Falcon-X,通过将变量映射到统一潜在原型空间,利用统一原型差分注意力机制对齐异构变量,并在共享空间中通过潜在实体注意力进行跨变量交互,实现零样本结构迁移,在GIFT-Eval和fev-bench基准上取得最先进预测性能。
缩小零样本HAR中的模态差距:基于IMU数据的对比训练与可分性优化原型
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 针对IMU基零样本人体活动识别中的模态差距问题,提出对比训练与描述性原型结合的方法,在PAMAP2数据集上实现73.2%准确率和0.583宏F1,并指出宏F1更适合作为评估指标。
Comments 17 pages, 7 figures
利用混合专家和动态下采样增强基于多语言大模型的语音识别
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出基于投影器的LLM-ASR框架,通过混合专家架构提升跨语言适应性,并利用连续整合-触发机制实现动态下采样和模态对齐,实验表明该方法显著超越强基线模型。
Comments Accepted by ICASSP 2026
Journal ref ICASSP (2026),18807-18811
Self-EmoQ: 基于Plutchik引导的价值规划驱动流式情感TTS
机构 * Geely AI Lab(地平线人工智能实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出一种情感规划框架,通过强化学习训练LLM模块,在文本生成前确定情感,以驱动流式TTS,结合Plutchik情感理论进行混合奖励,实验表明在情感确定和响应质量上优于基线。
Comments Accepted to ACL 2026 Findings
通过角度-范数分解的激活引导的几何解释
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; Queen Mary University of London(女王玛丽大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文通过控制实验分离角度和径向分量,发现概念主要编码在角度结构中,但范数对引导的稳定性和下游效应至关重要,建议将激活引导参数化为可解释的角度和径向分量。
对自动化工作流中智能体错位的冷静审视
机构 * University of Virginia(弗吉尼亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Utah(犹他大学) ; University of Notre Dame(圣约翰大学) ; George Washington University(乔治华盛顿大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文研究多智能体系统中的新兴错位问题(称为智能体错位),通过贝叶斯框架分析其成因,并提出基于证据的智能体对齐范式(AEA)来纠正错位行为,从而提升协作可靠性。
基于语义ID的推理增强生成式推荐
机构 * National University of Singapore(国立新加坡大学) ; University of Science and Technology of China(中国科学技术大学) ; Tencent Inc.(腾讯公司)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出SIDReasoner两阶段框架,通过增强语义ID与语言的对齐和结果驱动的强化优化,实现无需大量推理标注的有效推理,提升生成式推荐的准确性、可解释性和跨领域泛化能力。
Comments Accepted by KDD 2026
AnimaSpark: 一种用于任意3D对象动画的前馈方法
机构 * Bytedance(字节跳动)
专题命中 其他安全 :alignment(abstract)
AI总结 提出AnimaSpark管道,通过将带骨骼的3D模型渲染为多层图像表示,输入视频生成模型,再提取2D关键点运动并提升至3D空间,实现类别无关的3D动画生成,在文本-运动对齐、运动质量和计算效率上优于现有方法。
基于视觉语言模型的海岸线几何定位
机构 * The University of Waikato(怀卡托大学) ; The University of Auckland(奥克兰大学)
专题命中 其他安全 :alignment(abstract)
AI总结 提出将海岸线提取视为几何边界定位任务,基于GeoChat-7B/LLaVA-1.5架构构建CoastlineVLM-7B模型,直接预测折线而非分割掩码,在几何指标上优于传统分割方法。
草图到布局:面向约束感知的模块化光生物反应器合成的人本计算代理
机构 * Qrafty Technology Inc.(Qrafty技术公司) ; University of Michigan(密歇根大学)
专题命中 其他安全 :alignment(abstract)
AI总结 提出一种计算框架,将用户草图转化为模块化光生物反应器立面布局,通过约束满足问题(CSP)求解器实现近实时合成,并引入弱监督藻类健康监测管道,实现碳中性和自主维护。
Comments 13 pages, 6 figures
CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化
机构 * Nanjing University(南京大学) ; LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) ; East China Normal University(华东师范大学) ; Nanjing University of Science and Technology(南京理工大学) ; Central South University(中南大学)
专题命中 其他安全 :alignment(abstract)
AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。
Comments Accepted to ACL 2026 Main