Morphology-Conditioned World Model for Cross-Embodiment Quadrupedal Locomotion
迈向基于形态条件的四足世界模型
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本文提出一种基于形态条件的四足世界模型,通过整合物理形态编码器和奖励归一化器,实现跨形态的零样本泛化,解决传统隐式系统识别的适应滞后问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
迈向基于形态条件的四足世界模型
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本文提出一种基于形态条件的四足世界模型,通过整合物理形态编码器和奖励归一化器,实现跨形态的零样本泛化,解决传统隐式系统识别的适应滞后问题。
重新思考推理SFT中的泛化:对优化、数据和模型能力的条件分析
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文研究推理SFT的泛化问题,发现泛化受优化动态、训练数据和模型能力共同影响,指出短训练检查点可能低估泛化能力,数据质量和结构及模型能力均影响泛化效果,且推理提升与安全下降存在不对称性。
Comments Accepted by COLM 2026
面向全归纳图神经网络的结构交互图上的神经消息传递
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究提出SIGIL框架,通过结构交互图和关系消息传递网络实现图特征的统一表示,可用于全归纳链接预测,还能统一多种图基础模型设计范式。
Comments 7 pages, 1 figure in the main body. 12 pages, 5 figures in appendix. Submitted to AAAI 2027 (main track) and currently under review
从氛围到代码——再回到氛围:生成式人工智能在设计意图形成中的词汇振荡
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究生成式人工智能工具下设计意图的形成,通过五位设计师设计着陆页英雄板块的过程,以词汇粒度为视角,发现设计师存在词汇振荡,不匹配促使其反思,还定位了人工智能及模糊性的作用。
Comments Author's original version (as submitted, February 2026). This article has been accepted for publication in International Journal of Human-Computer Interaction, published by Taylor & Francis
聚焦推理,推断出异常:通过贝叶斯推理引导的聚焦VLM推理实现高速公路视频远场异常检测
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Key Laboratory of Big Data & Artificial Intelligence in Transportation, Ministry of Education(教育部交通运输大数据与人工智能重点实验室) ; Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence (2018)(北京市交通数据挖掘与具身智能重点实验室)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文提出VIBES框架,通过贝叶斯推理引导的聚焦VLM推理,解决远场目标异常检测中的注意力稀释和计算成本问题,提升检测准确性和实时效率。
大规模行为推断:动机与信念系统之间的根本不对称性
机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。
Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H
Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)
IndexTTS 2.5 技术报告
机构 * Bilibili Inc.(哔哩哔哩公司)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 IndexTTS 2.5通过四方面改进提升了多语言支持、推理速度和合成质量,实现了更广泛的语言覆盖和情感语调复制。
Comments 11 pages, 4 figures
人机协作中的缩放悖论
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本研究构建分析模型,发现人机协作中存在缩放悖论:人类高估AI能力时,更大的AI规模会降低系统性能、加剧企业利润损失,企业可通过成本内部化等策略管理偏差,AI缩放需结合人机交互管理。
生成式AI对系统管理领域专业能力路径与绩效感知的意外影响
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文通过对14名IT从业者的半结构化访谈,揭示GenAI压缩系统管理传统专业能力路径、重置绩效预期引发双速文化与生产力愧疚感等意外影响,引发相关领域对专业能力发展等问题的思考。
分层声学-语义建模:全双工口语语言模型的模态分离与语义连贯
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Center for Language, Intelligence and Machines, Shenzhen Loop Area Institute, Shenzhen(深圳环智中语言、智能与机器中心) ; School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究全双工口语语言模型受模态干扰问题,提出Lychee-FD框架及分层参数分离策略,通过实验验证该方法能有效提升模型性能,在语音智能和交互流畅性上取得显著进步,且不影响推理效率。
Comments 22 pages, 9 figures
人脸嵌入在不同深度神经网络模型间是否兼容?
机构 * Michigan State University(密歇根州立大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究探讨不同深度神经网络模型在人脸嵌入空间中的几何结构,发现低容量线性映射能显著提升跨模型人脸识别与验证性能,表明人脸身份编码的表征收敛。
先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体
机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。
Comments Accepted by the CVPR 2025 Embodied AI Workshop
数字孪生的因果证伪
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本研究针对安全关键场景下数字孪生的准确性评估问题,提出仅需独立同分布观测轨迹数据的通用统计因果证伪方法,将其应用于Pulse生理引擎脓毒症建模,采用MIMIC-III数据集验证,可应对数据混杂问题。
Comments Accepted for publication in the Journal of Machine Learning Research (JMLR)
MUGEN:用于高效运动理解与生成的统一框架
机构 * Florida State University(佛罗里达州立大学) ; Texas Christian University(得克萨斯基督教大学) ; University of Miami(迈阿密大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。
Skill-RAG: 通过隐藏状态探测与技能路由实现故障状态感知的检索增强
机构 * University of Michigan(密歇根大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Rutgers University(罗格斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; New Jersey Institute of Technology(新泽西理工学院) ; TU Darmstadt(图腾斯大学) ; Wake Forest University(威克森林大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出Skill-RAG框架,通过轻量级隐藏状态探测器和基于提示的技能路由器,在检索失败时诊断原因并选择四种技能(查询重写、问题分解、证据聚焦、退出)纠正查询-证据错位,显著提升多轮检索后困难案例的准确性。
CHIME:基于DIMM-PIM的高效长上下文注意力-全连接分离式推理方案
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 CHIME是首个集成DIMM-PIM的AFD系统,通过无气泡流水线等技术解决同步问题,实现最高5.15倍于HBM-PIM方案的LLM推理加速。
迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南
机构 * FAIR, Meta(Meta FAIR研究院) ; Reality Labs, Meta(Meta Reality Labs) ; University of Oxford(牛津大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。
Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/
RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。
Comments Under submission
MM-ISTS: 基于多模态视觉-文本大语言模型的不规则采样时间序列预测
机构 * East China Normal University Shanghai China ; Centre for Artificial Intelligence ; Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Hong Kong China ; Department of Computing, The Hong Kong Polytechnic University Hong Kong China ; East China Normal University ; Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences ; Department of Computing, The Hong Kong Polytechnic University
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 MM-ISTS利用多模态视觉-文本大语言模型,通过双阶段编码机制提升不规则采样时间序列预测的性能。
LLMs难以衡量区分不同水平学生的题目:阅读理解评估中题目区分度研究
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of Maryland(马里兰大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本研究评估42个LLM在零样本设置下预测题目区分度的能力,发现直接预测与人类校准的区分度相关性弱(最高Spearman 0.152),基于CTT的响应校准相关性有限(0.241),表明LLM尚不能可靠捕捉题目区分度。
人工智能辅助降低坚持性并损害独立表现
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究发现人工智能辅助虽短期提升表现,但降低用户坚持性并损害独立完成任务的能力,尤其在数学推理和阅读理解等任务中表现显著。
学习诊断和纠正错误:大型语言模型中的道德敏感性获取
机构 * University of Mississippi(密西根州立大学) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学) ; AWS AI Labs(AWS AI实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Qualcomm(高通) ; Michigan State University(密西根州立大学) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。
可修正性转换:构建接受更新的目标
机构 * University of Toronto(多伦多大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究提出一种可修正性转换方法,可在不牺牲性能的情况下将几乎任何目标转换为可修正版本,能诱导AI产生可修正行为,为AI安全提供了关键的可修正目标方案。
哪种模态起决定作用?多模态大语言模型的反事实模态归因
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。
Comments 9 pages, 5 figures
VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs
机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) ; Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) ; McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。
Comments 16 pages, 5 figures
解构词汇空间中的MLP神经元权重
机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文提出ROTATE方法,通过优化神经元权重旋转以最大化词汇空间的峰度,解构MLP神经元权重,揭示词汇通道,提升语言模型可解释性。
Comments Accepted at COLM 2026
跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。
Comments 14 pages, preprint
CANDLE: 基于轻量级编码器的阿拉伯语字符级噪声去重
机构 * Abjad Ltd.(阿布贾有限公司) ; SDAIA - NCAI(SDAIA-国家人工智能 institute)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 提出CANDLE系统,利用连接主义时间分类(CTC)对阿拉伯语文本中的字符重复进行去重,无需手工规则或词典,在三个基准上达到5.37%的句子错误率,并通过知识蒸馏实现3倍深度缩减。
ARGen:基于情感强化的生成增强方法用于基于视觉的动态情绪感知
机构 * Fudan University(复旦大学) ; East China Normal University(华东师范大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出ARGen框架,通过情感语义注入和自适应强化扩散阶段,解决野外动态表情识别中的数据稀缺问题,提升情绪感知的生成质量和识别性能。
快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; OPPO Research Institute(OPPO研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。