Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation
超越事后解释:通过概率中介迈向玻璃箱AI
机构 * Manuele Leonelli(曼努埃尔·莱奥内利)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
超越事后解释:通过概率中介迈向玻璃箱AI
机构 * Manuele Leonelli(曼努埃尔·莱奥内利)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。
教方法而非答案:用于多模态策略优化的特权辅导蒸馏
机构 * Tianjin University(天津大学) ; Beijing Institute of Technology(北京理工大学) ; Singapore Management University(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaomi Inc(小米公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。
MOSS-Audio 技术报告
机构 * OpenMOSS Team(开放MOSS团队)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出统一音频-语言模型 MOSS-Audio,通过 DeepStack 跨层特征注入和时间标记实现语音、环境声和音乐的理解,在音频字幕、时间感知问答、时间戳转录和音频推理任务上取得强性能。
多模态大语言模型中通过CoRe头的功能稀疏性机制洞察
机构 * Soochow University(苏州大学) ; Peking University(北京大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI
AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。
面向沉浸式视频角色扮演的奖励分解强化学习
机构 * Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; School of Information Engineering, Beijing Institute of Graphic Communication(北京印刷学院信息工程学院) ; Ant International, Ant Group(蚂蚁集团国际部) ; Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 提出EBM-RL框架,通过奖励分解的强化学习优化视频角色扮演中的视觉感知、推理与生成过程,提升场景一致性与角色真实性。
SalsaAgent: 一种用于交互式舞蹈生成的多模态具身语言模型
机构 * Simon Fraser University(西蒙弗雷泽大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 提出SalsaAgent语言模型,通过非语言运动令牌传递和两阶段令牌到扩散管道,生成与人类领舞者及音乐背景交互的全身萨尔萨舞蹈动作。
Comments Project page: https://pjyazdian.github.io/Salsa-Agent
grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations
机构 * Virginia Tech(弗吉尼亚理工学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 本文研究了AI生成的安全解释中语义对齐的问题,通过VEXA测试平台验证了词汇基础与语义风险对齐之间的差距,发现即使解释在词汇上显得合理,其语义解释可能削弱检测器的意图风险评估。
在安全对齐的连续视觉指令微调中实现和谐参数适应
机构 * Hefei University of Technology(合肥工业大学) ; Tsinghua University(清华大学) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文研究了在安全对齐的连续视觉指令微调中如何平衡安全性和任务性能,提出了一种名为和谐参数适应(HPA)的后训练框架,通过参数分区、平衡选择和正交调整来缓解遗忘问题。
TrajTok: 学习轨迹令牌以实现更好的视频理解
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; Apple(苹果公司) ; Woven by Toyota, Inc(丰田纺织公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 提出TrajTok,一种端到端视频令牌化模块,通过隐式时空聚类生成对象轨迹令牌,提升视频理解效率与性能。
Comments CVPR 2026
当图标记沉没:图语言模型的机制分析
机构 * University of Virginia(弗吉尼亚大学) ; Capital One
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
AI总结 本文通过分析图语言模型中图标记的内部行为,发现激活层面的显著性与图信息利用之间存在解耦,揭示了现有图标记构建、放置和对齐机制的局限性。
Follow-Your-Preference++:重新思考图像修复中的偏好对齐
机构 * Zhejiang University(浙江大学) ; The University of Tokyo(东京大学) ; Tsinghua University(清华大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文从基本原理出发,通过直接偏好优化框架和公开奖励模型构建偏好数据,系统研究了图像修复中的偏好对齐问题,发现奖励模型存在偏差但可通过集成缓解,并在标准指标、大视觉语言模型评估和人类评估上显著超越先前最先进模型。
Comments 23 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2509.23082
在历史文本上预训练语言模型
机构 * University of Waterloo(多伦多大学) ; Vector Institute(向量研究所) ; AIML, Adelaide University(AIML,阿德莱德大学) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Oxford Centre for Economic and Social History, University of Oxford(牛津大学经济与社会史中心) ; Department of Computer Science, University College London(伦敦大学学院计算机科学系)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出TypewriterLM,一个仅在1913年前英文文本上训练的7.24B历史语言模型,通过构建TypewriterCorpus语料库、引入词汇基础指令微调框架和History-Event基准套件,解决数据质量、时间泄漏、训练和评估等挑战。
面向细粒度概念瓶颈模型的概念级注意力机制
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 提出概念级注意力机制(CoAt-CBM),通过可学习概念视觉查询和概念对比优化,实现自适应细粒度图像-概念对齐,解决预训练偏差和概念互斥问题,显著提升性能。
Comments Withdrawn by authors for revision and improvement
通过协同注意力重建内容以提升多模态嵌入质量
机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Baidu Inc.(百度公司)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG
AI总结 提出CoCoA预训练范式,通过重构注意力流和基于EOS的重建任务,利用协同注意力优化多模态嵌入,使模型将输入语义压缩到<EOS>令牌中,从而提升嵌入质量。
CREward:一种类型特定的创造力奖励模型
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Sogang University(首尔大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 提出首个类型特定的创造力奖励模型CREward,通过几何、材质和纹理三个轴评估创造力,并应用于创造力评估、可解释创造力及创意样本获取。
Comments Accepted to CVPR 2026
一种基于NLP的课程-劳动力市场对齐框架:模式约束的LLM抽取、ESCO锚定的语义匹配和多维差距量化
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出一个四阶段NLP框架,通过模式约束的LLM抽取、ESCO语义匹配、仲裁协议和验证机制,实现课程与劳动力市场的对齐,并量化多维供需差距。
Comments 53 pages, 9 figures, 4 tables
基于BERT和图神经网络的历史知识图谱构建
机构 * Shandong Management University(山东管理大学) ; Maria Curie-Sklodowska University(玛丽·居里-斯洛多夫斯卡大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 本文提出结合BERT和图神经网络的高层架构,从历史文本中提取实体和关系,构建知识图谱,在精度、召回率和F1分数上优于传统方法和深度学习基线。
Comments 9 pages, 4 figures
RoleCDE:角色扮演代理中的角色-对齐权衡的基准测试与缓解
机构 * School of Information, Renmin University of China(中国人民大学信息学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 针对角色扮演代理在角色特定价值与对齐约束冲突时的决策问题,提出首个基准RoleCDE,通过认知困境场景评估角色-场景基础、价值冲突解决和决策倾向,发现“角色价值解耦”现象,并基于RoleCDE的微调有效缓解该问题。
Comments 23pages
T-CLIP:面向对比语言-图像预训练的热感知
机构 * Indian Institute of Technology Delhi, India(印度理工学院德里分校) ; NVIDIA AI Technology Center, India(NVIDIA AI技术中心) ; Jawaharlal Nehru University, India(贾瓦哈拉尔·尼赫鲁大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 针对CLIP无法对齐热图像与文本描述的问题,提出物理感知的热描述数据集IR-Cap和解耦双LoRA框架T-CLIP,实现场景级和对象级热理解,在跨模态检索任务上超越所有基线。
Comments 34pages (including references and appendix), 13 figures
EGOSTREAM: 面向第一人称视角的流式情景记忆诊断基准
机构 * Department of Mathematics and Computer Science(数学与计算机科学系) ; University of Catania(卡塔尼亚大学)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
AI总结 提出EGOSTREAM基准,通过七种认知维度和答案有效期窗口,诊断流式视频中模型的情景记忆能力,并评估多种记忆管理机制。
FastSLM:用于高效长语音自适应的层次时间抽象
机构 * OKESTRO ; Sejong University(世宗大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI
AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。
Comments Title updated
SPM-Bench:面向扫描探针显微镜的大型语言模型基准测试
机构 * Alibaba Group(阿里巴巴集团)
专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI
AI总结 提出SPM-Bench,一个全自动数据合成管道和严格评估指标(SIP-F1),用于测试LLMs在扫描探针显微镜领域的推理能力,并首次量化模型“个性”。
通过打破尾部对齐改进CLIP适应:用于源无关跨域小样本学习
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, Wuhan, China(华中科技大学计算机科学与技术学院) ; Institute of Artificial Intelligence, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 针对CLIP在跨域小样本学习中的性能下降问题,提出自适应尾头对齐策略(ATHA),通过有选择地削弱低相似度图像令牌的对齐来减少过拟合,在四个基准上取得最优结果。
Comments Accepted by ICML 2026
源语言锚定的语义强化学习用于低资源目标语言生成
机构 * Minzu University of China(中国民族大学) ; Ant Group(蚂蚁集团) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; South China University of Technology(华南理工大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出源语言锚定的语义强化学习(SG-SRL),通过跨语言语义奖励模型利用源语言单语数据,结合轻量级恢复阶段解决奖励黑客问题,在低资源目标语言生成中提升语义锚定和事实覆盖。
EvoMD-LLM:学习反应分子动力学中物种进化的语言
机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院) ; Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出EvoMD-LLM框架,将反应分子动力学轨迹离散化为符号时间序列,通过时间脚手架机制使自回归大语言模型学习物种组成演化,在多项时间预测任务上优于基线模型,并能生成可解释性预测。
Comments 17 pages, ACL Findings
ProgVLA:进度感知的机器人操作技能学习
机构 * NAVER LABS(NAVER实验室) ; NAVER LABS Europe(NAVER实验室欧洲)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 提出ProgVLA,一种紧凑的视觉-语言-动作模型,通过显式表示任务进度和两阶段Perceiver重采样机制,在有限计算和内存下实现长序列多模态处理,并在多任务操作基准上达到或超越大模型性能。
DebFilter: 消除隐藏在值中的偏见
机构 * School of Integrated Technology, BK21 Graduate Program in Intelligent Semiconductor Technology(整合技术学院,智能半导体技术BK21研究生项目)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 提出DebFilter,一种轻量级、无需训练的方法,通过调整交叉注意力中的值分量来纠正文本到图像扩散模型中的社会偏见,实现推理时偏差缓解。
Comments 8 pages, 7 figures, supplementary material included, CVPR 2026
Tool Forge:一种用于受控代理执行的携带验证的工具链
机构 * Next Moca Global, Inc.(Next Moca全球公司)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 本文提出 Tool Forge,一种将自然语言能力意图转换为经过验证、沙盒验证、编目工具制品,并通过令牌高效路由层暴露给代理的工具链,解决了代理执行中工具层缺乏治理和验证的问题。
Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/nextmoca/tool-forge
FAST-GOAL: 快速高效的全局-局部对象对齐学习
机构 * Department of Virtual Convergence, Graduate School of Advanced Imaging Science, Multimedia & Films (GSAIM), Chung-Ang University(虚拟融合系,高级影像科学研究生院,多媒体与电影系(GSAIM), Chung-Ang 大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 提出FAST-GOAL微调方法,通过全局-局部语义对齐增强CLIP处理长文本的能力,包括快速局部图像-句子匹配和基于token相似性的学习,并在GLIT100k数据集上训练,在长/短描述数据集上均取得显著提升。
Comments 21 pages, 8 figures, IEEE/TIP 2026 accepted
World-R1:通过强化学习为文本到视频生成注入3D约束
机构 * Zhejiang University(浙江大学) ; Microsoft Research(微软研究院) ; Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。
Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1