arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-15 至 2026-06-15 共收录 63 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2606.13900 2026-06-15 cond-mat.mtrl-sci 新提交 71%

Multi-modal machine learning analysis of GaSe molecular beam epitaxy growth conditions

GaSe分子束外延生长条件的多模态机器学习分析

Mingyu Yu, Isaiah A. Moses, Wesley F. Reinhart, Stephanie Law

专题命中 多模态评测 :multi-modal(title)

AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 70%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13877 2026-06-15 cs.RO 新提交 67%

ContactWorld: What Matters in Vision-Tactile World Models for Contact-Rich Manipulation

ContactWorld: 视觉-触觉世界模型中什么对接触丰富操作至关重要

Zhiyuan Zhang, Pokuang Zhou, Kaidi Zhang, Adeesh Desai, Temitope Amosa, Davood Soleymanzadeh, Jiuzhou Lei, Minghui Zheng, Yu She

机构 * School of Industrial Engineering, Purdue University(普渡大学工业工程学院) Department of Mechanical Engineering, Texas A&M University(德克萨斯农工大学机械工程系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 通过12项接触丰富操作任务,发现空间结构化和时间连续的表征(如点云)能显著提升规划成功率,且触觉传感的有效性依赖于跨模态表征兼容性。

Comments 32 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19947 2026-06-15 cs.CV cs.AI 版本更新 62%

Vanishing Depth: Training Generalized Depth Adapters with Sinusoidal Depth Preprocessing for Pretrained RGB Encoders

消失深度:基于正弦深度预处理的预训练RGB编码器通用深度适配器训练

Paul Koch, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫研究所) TU-Berlin(技术大学柏林)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出自监督训练方法,为预训练RGB编码器添加深度适配器,结合正弦深度编码实现通用鲁棒的深度特征提取,在分割、姿态估计和深度补全等下游任务中提升基线性能,SUN-RGBD分割达56.05 mIoU。

Comments Accepted to IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13713 2026-06-15 q-bio.GN cs.AI 新提交 57%

CisTransCell: Single-Cell Perturbation Prediction via Gene Function, Regulatory Control, and Cellular Context

CisTransCell:通过基因功能、调控控制和细胞上下文进行单细胞扰动预测

Wei Zhang, Xun Jiang, Yuesi Xi, Ming Tang

机构 * [q-bio.GN]

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 提出CisTransCell框架,结合调控序列和编码序列先验与细胞表达状态,建模扰动响应级联,实现零样本单细胞扰动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18693 2026-06-15 cs.CV 版本更新 57%

Feature-Space Planes Searcher: A Universal Domain Adaptation Framework for Interpretability and Computational Efficiency

特征空间平面搜索器:一种通用领域自适应框架,兼顾可解释性与计算效率

Zhitong Cheng, Yiran Jiang, Yulong Ge, Yufeng Li, Zhongheng Qin, Rongzhi Lin, Jianwei Ma

机构 * School of Mathematics and Institute for Artificial Intelligence, Harbin Institute of Technology, China(数学学院和人工智能研究院,哈尔滨工业大学,中国) School of Earth and Space Sciences, Institute for Artificial Intelligence, Peking University, China(地球和空间科学学院,人工智能研究院,北京大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出特征空间平面搜索器(FPS),通过冻结特征编码器并利用特征空间几何模式优化决策边界,实现高效、可解释的领域自适应,在多个基准上达到竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14169 2026-06-15 cs.LG 新提交 50%

Machine Learning for Biomedical Raman Spectroscopy: From Spectral Acquisition to Clinical Translation

生物医学拉曼光谱的机器学习:从光谱采集到临床转化

Bogdan Oancea, Ana Maria Seciu-Grama, Nicoleta Siminea, Laura Mihaela Stefan, Alice Stoica, Joel Sjoberg, Marian Necula, Ana-Maria Prelipcean, Corneliu Ovidiu Vrancianu, Eduard Milea, Andrei Păun, Ion Petre, Mihaela Păun

机构 * National Institute of Research and Development for Biological Sciences(罗马尼亚生物科学研究院) University of Bucharest(布加勒斯特大学) University of Turku(图尔库大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 综述机器学习在生物医学拉曼光谱全流程中的应用,包括预处理、诊断分类、可解释性分析及临床转化障碍,强调标准化与鲁棒验证的必要性。

Comments 52 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2605.30931 2026-06-15 cs.CL 版本更新 89%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14154 2026-06-15 cs.CR 新提交 78%

SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击

Youngduk Kim, Minkyoo Song, Seungwon Shin

专题命中 多模态Agent :cross-modal(title,abstract)

AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13916 2026-06-15 cs.AI 新提交 57%

A Multi-Agent AI System for Automated High School Transcript Processing: Collaborative Document Analysis at Scale

用于自动化高中成绩单处理的多智能体AI系统:大规模协作文档分析

Ben Torkian, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出一个多智能体AI系统,通过三个专业智能体协作,自动处理不同格式的高中成绩单,以GPA提取作为协调信号,实现96.7%的准确率和每份45秒的处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13686 2026-06-15 cs.CL cs.CY 新提交 57%

Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces

电子商务欺骗性界面下的Web Agent安全基准测试

Zijing Shi, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII) University of Liverpool(利物浦大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 提出WebDecept框架,在电子商务环境中注入七种常见欺骗性界面模式,测试多模态Web Agent的安全性,发现当前Agent极易受骗且提示约束不足。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16120 2026-06-15 cs.AI 版本更新 57%

LLM-Powered AI Agent Systems and Their Applications in Industry

基于大语言模型的AI智能体系统及其工业应用

Guannan Liang, Qianqian Tong

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。

Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 14 篇

2606.14700 2026-06-15 cs.CV 新提交 85%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24596 2026-06-15 eess.AS cs.AI cs.CL 版本更新 85%

X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs

X-OPD:面向语音大语言模型能力对齐的跨模态在策略蒸馏

Di Cao, Dongjie Fu, Hai Yu, Siqi Zheng, Xu Tan, Tao Jin

机构 * Tencent Hunyuan(腾讯文心) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出X-OPD框架,通过跨模态在策略蒸馏对齐语音LLM与文本LLM的能力,利用文本教师模型评估语音模型的轨迹并提供令牌级反馈,显著缩小复杂任务性能差距。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14172 2026-06-15 cs.LG cs.CV 新提交 83%

Context-aware Modality-Topology Co-Alignment for Multimodal Attributed Graphs

上下文感知的模态-拓扑协同对齐用于多模态属性图

Sirui Zhang, Xu Wang, Zhengyu Wu, Xunkai Li, Hongchao Qin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出CoMAG框架,通过任务自适应可靠上下文学习和模态保持的跳令牌对齐,统一处理图任务和模态任务,在保持稀疏边线性复杂度的同时提升结构预测、跨模态匹配和图条件生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10966 2026-06-15 cs.LG cs.AI cs.CV eess.IV 版本更新 81%

Interpretable Alzheimer's Diagnosis via Multimodal Fusion of Regional Brain Experts

可解释的阿尔茨海默病诊断:基于区域脑专家的多模态融合

Farica Zhuang, Shu Yang, Dinara Aliyeva, Zixuan Wen, Duy Duong-Tran, Christos Davatzikos, Tianlong Chen, Song Wang, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出MREF-AD多模态区域专家融合模型,采用混合专家框架将各模态脑区域视为独立专家,通过门控网络学习个性化融合权重,实现可解释的AD诊断。

Comments Published at IEEE ICHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14691 2026-06-15 cs.CL 新提交 79%

CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距

Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04976 2026-06-15 cs.CV cs.AI 版本更新 73%

3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding

3D-RFT:基于视频的3D场景理解的强化微调

Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出3D-RFT框架,将可验证奖励的强化学习(RLVR)扩展到视频3D感知与推理,通过直接优化评估指标(如3D IoU和F1分数)提升性能,4B模型超越8B模型。

Comments Accepted at ICML 2026. Project page: https://3d-rft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13896 2026-06-15 cs.CV cs.AI 新提交 62%

How do Self-Supervised Remote Sensing Vision Models Transfer to Downstream Tasks?

自监督遥感视觉模型如何迁移到下游任务?

Julia Romero, Qin Lv, Morteza Karimzadeh

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究六种代表性自监督地理空间基础模型(GeoFMs)在下游任务中的迁移表现,发现模型排名随任务和适应设置变化,中间层特征比最终层更相关,且解码器设计等适应设置影响与模型选择相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14568 2026-06-15 eess.IV cs.CV 新提交 57%

Trimodal Glioma Representation Alignment via Volumetric Contrastive Learning

三模态胶质瘤表示对齐通过体积对比学习

Denise Marini, Eleonora Grassucci, Danilo Comminiello

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出GLORIA框架,通过Gramian对比损失对齐组织病理、基因表达和MRI三模态特征,用于胶质瘤分级和生存预测,在132例患者数据上优于双模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14277 2026-06-15 cs.CV 新提交 57%

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

机构 * Hikvision Research Institute(海康威视研究院) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。

Comments Accepted by CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14071 2026-06-15 cs.CV 新提交 57%

ShearFuse-UNet: Hadamard, DCT, and Shearlet Transform Fusion for Next-Day Wildfire Spread Prediction

ShearFuse-UNet: Hadamard、DCT和Shearlet变换融合用于次日野火蔓延预测

Ene Meco, Yingyi Luo, Emadeldeen Hamdan, Adam Watts, Ahmet Enis Cetin

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) US Forest Service, Pacific Wildland Fire Science Laboratory(美国林务局太平洋野火科学实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出ShearFuse-UNet,一种轻量级深度学习模型,通过融合WHT、DCT和Shearlet变换分支,在U-Net编码器中实现多模态卫星数据的次日野火蔓延预测,以267k参数达到0.596 F1分数,优于ResNet18 U-Net。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13392 2026-06-15 cs.AI 新提交 57%

MiniMax Sparse Attention

MiniMax 稀疏注意力

Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou, Pengyu Zhao

机构 * MiniMax Peking University(北京大学) NVIDIA(英伟达) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21335 2026-06-15 cs.LG cs.CL 版本更新 57%

Sub-Token Routing for KV Cache Compression

子令牌路由用于KV缓存压缩

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智科)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出子令牌路由方法,在保留令牌内对值向量分组并选择性保留,与令牌级压缩互补,在LLM和VLM中提升压缩性能。

Comments 17 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13970 2026-06-15 cs.RO cs.LG 新提交 50%

An Attention-based Model for Robust Forecasting with Missing Modality

基于注意力的缺失模态鲁棒预测模型

Zhitian Zhang, Wenjie Zi, Yunduz Rakhmangulova, Saghar Irandoust, Hossein Hajimirsadeghi, Thibaut Durand

机构 * Simon Fraser University(西蒙菲莎大学) RBC Borealis

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种基于条件变分自编码器和Transformer的多模态模型,通过注意力机制学习统一固定维度的表示,在训练和推理中处理缺失模态,在人类轨迹预测和机器人操作预测任务上优于现有方法。

Comments Work originally done in 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18166 2026-06-15 cs.IR cs.LG 版本更新 50%

PCR-CA: Parallel Codebook Representations with Contrastive Alignment for Multiple-Category App Recommendation

PCR-CA: 基于对比对齐的并行码本表示用于多类别应用推荐

Bin Tan, Wangyao Ge, Yidi Wang, Xin Liu, Jeff Burtoft, Hao Fan, Hui Wang

机构 * Microsoft Suzhou China(微软苏州中国) Microsoft Beijing China(微软北京中国) Microsoft Redmond WA USA(微软雷德蒙德华盛顿州美国)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PCR-CA框架,通过并行码本VQ-AE模块学习多类别应用的离散语义表示,结合对比对齐损失和双注意力融合,提升CTR预测,尤其对长尾应用效果显著。

Comments Accepted by KDD 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 7 篇

2511.02153 2026-06-15 math.NA cs.NA math.OC 版本更新 82%

A Joint Variational Framework for Multimodal X-ray Ptychography and Fluorescence Reconstruction

多模态X射线ptychography与荧光重建的联合变分框架

Chengru Eric Zou, Elle Buser, Zichao Wendy Di, Yuanzhe Xi

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种联合变分框架,整合X射线ptychography和荧光重建,通过共享空间变量解决非线性逆问题,提升稳定性和重建精度。

Comments Keywords: inverse problems, x-ray imaging science, ill-posedness, joint reconstruction. This work is sponsored by NSF DMS-2338904

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14358 2026-06-15 cs.CY 新提交 78%

Observing Teachers' Instrumental Pedagogical Orchestration in Synchronous Online Learning: A Multimodal Grid Based on Videoconferencing Traces

观察同步在线学习中教师的工具性教学编排:基于视频会议轨迹的多模态网格

Intissar Bamou, Christine Michel, Hassina El Kechai

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出一种基于视频会议轨迹的多模态观察网格,用于分析同步在线教学中教师的工具性教学编排,识别沟通手势、姿势、眼神和数字工具管理中的可观察指标。

Journal ref 18th International Conference on Computer Supported Education, May 2026, Benidorm, France. pp.1774-1781

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13699 2026-06-15 cs.DB 新提交 78%

A Multimodal Machine Learning Framework for Enterprise Database Workload-Aware Root Cause Analysis

一种面向企业数据库工作负载感知根因分析的多模态机器学习框架

Ruchi Pakhle, Siddhant Pawar

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出多模态机器学习框架,结合工作负载特征、系统遥测和操作信号,利用LightGBM等模型实现数据库根因分析,提升可解释性和自动化水平。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13709 2026-06-15 stat.ML cs.LG 新提交 50%

LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

LoMC: 路由基础模型中拒绝抑制的局部多方向校正

Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出LoMC方法,通过支持门控干预框架在路由MoE和混合MoE模型中实现紧凑的拒绝抑制,提升非拒绝目标响应行为并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏