Multi-modal machine learning analysis of GaSe molecular beam epitaxy growth conditions
GaSe分子束外延生长条件的多模态机器学习分析
专题命中 多模态评测 :multi-modal(title)
AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
GaSe分子束外延生长条件的多模态机器学习分析
专题命中 多模态评测 :multi-modal(title)
AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。
GarmentSketch:大规模草图到时尚基准
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。
Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch
ContactWorld: 视觉-触觉世界模型中什么对接触丰富操作至关重要
机构 * School of Industrial Engineering, Purdue University(普渡大学工业工程学院) ; Department of Mechanical Engineering, Texas A&M University(德克萨斯农工大学机械工程系)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)
AI总结 通过12项接触丰富操作任务,发现空间结构化和时间连续的表征(如点云)能显著提升规划成功率,且触觉传感的有效性依赖于跨模态表征兼容性。
Comments 32 pages, 12 figures, supplementary material included
消失深度:基于正弦深度预处理的预训练RGB编码器通用深度适配器训练
机构 * Fraunhofer IPK(弗劳恩霍夫研究所) ; TU-Berlin(技术大学柏林)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出自监督训练方法,为预训练RGB编码器添加深度适配器,结合正弦深度编码实现通用鲁棒的深度特征提取,在分割、姿态估计和深度补全等下游任务中提升基线性能,SUN-RGBD分割达56.05 mIoU。
Comments Accepted to IntelliSys 2026
CisTransCell:通过基因功能、调控控制和细胞上下文进行单细胞扰动预测
机构 * [q-bio.GN]
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 提出CisTransCell框架,结合调控序列和编码序列先验与细胞表达状态,建模扰动响应级联,实现零样本单细胞扰动预测。
特征空间平面搜索器:一种通用领域自适应框架,兼顾可解释性与计算效率
机构 * School of Mathematics and Institute for Artificial Intelligence, Harbin Institute of Technology, China(数学学院和人工智能研究院,哈尔滨工业大学,中国) ; School of Earth and Space Sciences, Institute for Artificial Intelligence, Peking University, China(地球和空间科学学院,人工智能研究院,北京大学,中国)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 提出特征空间平面搜索器(FPS),通过冻结特征编码器并利用特征空间几何模式优化决策边界,实现高效、可解释的领域自适应,在多个基准上达到竞争性能。
生物医学拉曼光谱的机器学习:从光谱采集到临床转化
机构 * National Institute of Research and Development for Biological Sciences(罗马尼亚生物科学研究院) ; University of Bucharest(布加勒斯特大学) ; University of Turku(图尔库大学)
专题命中 多模态评测 :multimodal(abstract)
AI总结 综述机器学习在生物医学拉曼光谱全流程中的应用,包括预处理、诊断分类、可解释性分析及临床转化障碍,强调标准化与鲁棒验证的必要性。
Comments 52 pages, 2 figures
MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Meituan(美团)
专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL
AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。
Comments Working in progress
SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击
专题命中 多模态Agent :cross-modal(title,abstract)
AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。
用于自动化高中成绩单处理的多智能体AI系统:大规模协作文档分析
机构 * University of South Carolina(南卡罗来纳大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 提出一个多智能体AI系统,通过三个专业智能体协作,自动处理不同格式的高中成绩单,以GPA提取作为协调信号,实现96.7%的准确率和每份45秒的处理速度。
电子商务欺骗性界面下的Web Agent安全基准测试
机构 * AAII, University of Technology Sydney(悉尼科技大学AAII) ; University of Liverpool(利物浦大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL
AI总结 提出WebDecept框架,在电子商务环境中注入七种常见欺骗性界面模式,测试多模态Web Agent的安全性,发现当前Agent极易受骗且提示约束不足。
Comments Accepted to ACL 2026
基于大语言模型的AI智能体系统及其工业应用
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。
Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted
RepFusion:利用多模态先验在表示空间中进行去噪
机构 * Meta AI ; New York University(纽约大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。
Comments Project Page: https://xichenpan.com/repfusion
X-OPD:面向语音大语言模型能力对齐的跨模态在策略蒸馏
机构 * Tencent Hunyuan(腾讯文心) ; Zhejiang University(浙江大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 提出X-OPD框架,通过跨模态在策略蒸馏对齐语音LLM与文本LLM的能力,利用文本教师模型评估语音模型的轨迹并提供令牌级反馈,显著缩小复杂任务性能差距。
Comments Accepted by Interspeech 2026
上下文感知的模态-拓扑协同对齐用于多模态属性图
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出CoMAG框架,通过任务自适应可靠上下文学习和模态保持的跳令牌对齐,统一处理图任务和模态任务,在保持稀疏边线性复杂度的同时提升结构预测、跨模态匹配和图条件生成性能。
可解释的阿尔茨海默病诊断:基于区域脑专家的多模态融合
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出MREF-AD多模态区域专家融合模型,采用混合专家框架将各模态脑区域视为独立专家,通过门控网络学习个性化融合权重,实现可解释的AD诊断。
Comments Published at IEEE ICHI 2026
CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; Tianjin University(天津大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL
AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。
Comments Submitted to EMNLP 2026
3D-RFT:基于视频的3D场景理解的强化微调
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 提出3D-RFT框架,将可验证奖励的强化学习(RLVR)扩展到视频3D感知与推理,通过直接优化评估指标(如3D IoU和F1分数)提升性能,4B模型超越8B模型。
Comments Accepted at ICML 2026. Project page: https://3d-rft.github.io/
自监督遥感视觉模型如何迁移到下游任务?
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究六种代表性自监督地理空间基础模型(GeoFMs)在下游任务中的迁移表现,发现模型排名随任务和适应设置变化,中间层特征比最终层更相关,且解码器设计等适应设置影响与模型选择相当。
三模态胶质瘤表示对齐通过体积对比学习
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 提出GLORIA框架,通过Gramian对比损失对齐组织病理、基因表达和MRI三模态特征,用于胶质瘤分级和生存预测,在132例患者数据上优于双模态基线。
一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择
机构 * Hikvision Research Institute(海康威视研究院) ; Peking University(北京大学) ; East China Normal University(华东师范大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。
Comments Accepted by CVPR 2026 (highlight)
ShearFuse-UNet: Hadamard、DCT和Shearlet变换融合用于次日野火蔓延预测
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; US Forest Service, Pacific Wildland Fire Science Laboratory(美国林务局太平洋野火科学实验室)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 提出ShearFuse-UNet,一种轻量级深度学习模型,通过融合WHT、DCT和Shearlet变换分支,在U-Net编码器中实现多模态卫星数据的次日野火蔓延预测,以267k参数达到0.596 F1分数,优于ResNet18 U-Net。
MiniMax 稀疏注意力
机构 * MiniMax ; Peking University(北京大学) ; NVIDIA(英伟达) ; Zhejiang University(浙江大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。
Comments 30 pages, 14 figures
子令牌路由用于KV缓存压缩
机构 * Futurewei Technologies(未来智科)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 提出子令牌路由方法,在保留令牌内对值向量分组并选择性保留,与令牌级压缩互补,在LLM和VLM中提升压缩性能。
Comments 17 pages, 8 tables, 2 figures
基于注意力的缺失模态鲁棒预测模型
机构 * Simon Fraser University(西蒙菲莎大学) ; RBC Borealis
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出一种基于条件变分自编码器和Transformer的多模态模型,通过注意力机制学习统一固定维度的表示,在训练和推理中处理缺失模态,在人类轨迹预测和机器人操作预测任务上优于现有方法。
Comments Work originally done in 2023
PCR-CA: 基于对比对齐的并行码本表示用于多类别应用推荐
机构 * Microsoft Suzhou China(微软苏州中国) ; Microsoft Beijing China(微软北京中国) ; Microsoft Redmond WA USA(微软雷德蒙德华盛顿州美国)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出PCR-CA框架,通过并行码本VQ-AE模块学习多类别应用的离散语义表示,结合对比对齐损失和双注意力融合,提升CTR预测,尤其对长尾应用效果显著。
Comments Accepted by KDD 2026, oral
多模态X射线ptychography与荧光重建的联合变分框架
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出一种联合变分框架,整合X射线ptychography和荧光重建,通过共享空间变量解决非线性逆问题,提升稳定性和重建精度。
Comments Keywords: inverse problems, x-ray imaging science, ill-posedness, joint reconstruction. This work is sponsored by NSF DMS-2338904
观察同步在线学习中教师的工具性教学编排:基于视频会议轨迹的多模态网格
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 提出一种基于视频会议轨迹的多模态观察网格,用于分析同步在线教学中教师的工具性教学编排,识别沟通手势、姿势、眼神和数字工具管理中的可观察指标。
Journal ref 18th International Conference on Computer Supported Education, May 2026, Benidorm, France. pp.1774-1781
一种面向企业数据库工作负载感知根因分析的多模态机器学习框架
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 提出多模态机器学习框架,结合工作负载特征、系统遥测和操作信号,利用LightGBM等模型实现数据库根因分析,提升可解释性和自动化水平。
Comments 8 pages, 4 figures
LoMC: 路由基础模型中拒绝抑制的局部多方向校正
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 其他多模态 :multimodal(abstract)
AI总结 提出LoMC方法,通过支持门控干预框架在路由MoE和混合MoE模型中实现紧凑的拒绝抑制,提升非拒绝目标响应行为并保持通用能力。