Compatibility of Face Embeddings Across Deep Neural Networks
人脸嵌入在不同深度神经网络模型间是否兼容?
机构 * Michigan State University(密歇根州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究探讨不同深度神经网络模型在人脸嵌入空间中的几何结构,发现低容量线性映射能显著提升跨模型人脸识别与验证性能,表明人脸身份编码的表征收敛。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
人脸嵌入在不同深度神经网络模型间是否兼容?
机构 * Michigan State University(密歇根州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究探讨不同深度神经网络模型在人脸嵌入空间中的几何结构,发现低容量线性映射能显著提升跨模型人脸识别与验证性能,表明人脸身份编码的表征收敛。
先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体
机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。
Comments Accepted by the CVPR 2025 Embodied AI Workshop
数字孪生的因果证伪
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本研究针对安全关键场景下数字孪生的准确性评估问题,提出仅需独立同分布观测轨迹数据的通用统计因果证伪方法,将其应用于Pulse生理引擎脓毒症建模,采用MIMIC-III数据集验证,可应对数据混杂问题。
Comments Accepted for publication in the Journal of Machine Learning Research (JMLR)
MUGEN:用于高效运动理解与生成的统一框架
机构 * Florida State University(佛罗里达州立大学) ; Texas Christian University(得克萨斯基督教大学) ; University of Miami(迈阿密大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。
Skill-RAG: 通过隐藏状态探测与技能路由实现故障状态感知的检索增强
机构 * University of Michigan(密歇根大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Rutgers University(罗格斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; New Jersey Institute of Technology(新泽西理工学院) ; TU Darmstadt(图腾斯大学) ; Wake Forest University(威克森林大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出Skill-RAG框架,通过轻量级隐藏状态探测器和基于提示的技能路由器,在检索失败时诊断原因并选择四种技能(查询重写、问题分解、证据聚焦、退出)纠正查询-证据错位,显著提升多轮检索后困难案例的准确性。
CHIME:基于DIMM-PIM的高效长上下文注意力-全连接分离式推理方案
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 CHIME是首个集成DIMM-PIM的AFD系统,通过无气泡流水线等技术解决同步问题,实现最高5.15倍于HBM-PIM方案的LLM推理加速。
迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南
机构 * FAIR, Meta(Meta FAIR研究院) ; Reality Labs, Meta(Meta Reality Labs) ; University of Oxford(牛津大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。
Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/
RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。
Comments Under submission
MM-ISTS: 基于多模态视觉-文本大语言模型的不规则采样时间序列预测
机构 * East China Normal University Shanghai China ; Centre for Artificial Intelligence ; Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Hong Kong China ; Department of Computing, The Hong Kong Polytechnic University Hong Kong China ; East China Normal University ; Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences ; Department of Computing, The Hong Kong Polytechnic University
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 MM-ISTS利用多模态视觉-文本大语言模型,通过双阶段编码机制提升不规则采样时间序列预测的性能。
LLMs难以衡量区分不同水平学生的题目:阅读理解评估中题目区分度研究
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of Maryland(马里兰大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本研究评估42个LLM在零样本设置下预测题目区分度的能力,发现直接预测与人类校准的区分度相关性弱(最高Spearman 0.152),基于CTT的响应校准相关性有限(0.241),表明LLM尚不能可靠捕捉题目区分度。
人工智能辅助降低坚持性并损害独立表现
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究发现人工智能辅助虽短期提升表现,但降低用户坚持性并损害独立完成任务的能力,尤其在数学推理和阅读理解等任务中表现显著。
学习诊断和纠正错误:大型语言模型中的道德敏感性获取
机构 * University of Mississippi(密西根州立大学) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学) ; AWS AI Labs(AWS AI实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Qualcomm(高通) ; Michigan State University(密西根州立大学) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。
可修正性转换:构建接受更新的目标
机构 * University of Toronto(多伦多大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究提出一种可修正性转换方法,可在不牺牲性能的情况下将几乎任何目标转换为可修正版本,能诱导AI产生可修正行为,为AI安全提供了关键的可修正目标方案。
哪种模态起决定作用?多模态大语言模型的反事实模态归因
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。
Comments 9 pages, 5 figures
VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs
机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) ; Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) ; McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。
Comments 16 pages, 5 figures
解构词汇空间中的MLP神经元权重
机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文提出ROTATE方法,通过优化神经元权重旋转以最大化词汇空间的峰度,解构MLP神经元权重,揭示词汇通道,提升语言模型可解释性。
Comments Accepted at COLM 2026
跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。
Comments 14 pages, preprint
CANDLE: 基于轻量级编码器的阿拉伯语字符级噪声去重
机构 * Abjad Ltd.(阿布贾有限公司) ; SDAIA - NCAI(SDAIA-国家人工智能 institute)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出CANDLE系统,利用连接主义时间分类(CTC)对阿拉伯语文本中的字符重复进行去重,无需手工规则或词典,在三个基准上达到5.37%的句子错误率,并通过知识蒸馏实现3倍深度缩减。
ARGen:基于情感强化的生成增强方法用于基于视觉的动态情绪感知
机构 * Fudan University(复旦大学) ; East China Normal University(华东师范大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出ARGen框架,通过情感语义注入和自适应强化扩散阶段,解决野外动态表情识别中的数据稀缺问题,提升情绪感知的生成质量和识别性能。
快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; OPPO Research Institute(OPPO研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。
基于OpenStreetMap的领域自适应方法:为遥感VLMs的领域适应
机构 * INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里德斯』)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出OSMDA方法,利用OpenStreetMap数据生成自标注数据,无需人工标注或强外部模型,通过细调基础VLM实现遥感领域适应,经10个基准测试显示其在文本生成任务中达到SOTA,且训练成本更低。
面向联网自动驾驶车辆多智能体协同决策的拓扑增强多智能体强化学习
机构 * School of Automotive Studies, Tongji University(同济大学汽车学院)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文针对连续环境多智能体协同决策的维度灾难问题,提出TPE-MARL算法,通过游戏拓扑张量与双内在奖励机制优化,在CAV协同决策任务中实现接近最优性能与零样本泛化能力。
Comments 26 pages, 24 figures
MolSight: 一种用于统一化学图像理解的图感知视觉语言模型
机构 * Renmin University of China(中国人民大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。
Role-Agent: 通过双角色演化引导LLM智能体
机构 * University of Science and Technology of China(中国科学技术大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。
Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress
PEMANT:面向旅行的个性化多智能体谈判
机构 * Department of Civil and Costal Engineering, University of Florida(佛罗里达大学土木与海岸工程系)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出PEMANT框架,结合行为理论与多智能体谈判,改进家庭旅行决策建模,提升预测能力。
ELISA:一种可解释的混合生成式AI代理,用于单细胞组学中的表达基础发现
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 ELISA结合表达嵌入、语义检索和LLM解释,提供交互式单细胞发现,优于CellWhisperer,尤其在基因签名查询中表现突出。
我们要玩一场游戏吗?用于开放式兵棋推演的语言模型
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。
Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)
从发现到设计:将概念作为大语言模型的设计轴
机构 * Tel Aviv University(特拉维夫大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 该研究针对大语言模型概念级结构依赖事后发现而非设计的问题,提出将概念作为设计轴,划分设计空间维度并分析现有模式,推动转向设计带显式概念表示的大语言模型。
用于结构和语义一致的模拟到真实翻译的小波相位扩散
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究模拟到真实翻译中弥合合成与真实域外观差距并保持结构语义一致的问题,提出小波相位扩散方法,通过双树复小波包变换域操作及低频随机化,在未配对数据训练,提升了图像和视频翻译的真实感与一致性。
Comments Project Page: https://kit-mrt.github.io/Wavelet-Phase-Diffusion/
EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。