MINT: A Universal Zero-Shot Predictor for Transaction Data
MINT:一种用于交易数据的通用零样本预测器
机构 * Visa Inc.(维萨公司)
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CL
AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
MINT:一种用于交易数据的通用零样本预测器
机构 * Visa Inc.(维萨公司)
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CL
AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。
ProFocus:通过渐进式视觉聚焦解释艺术图像中的情感体验
机构 * University of Science and Technology of China(中国科学技术大学) ; Anhui University(安徽大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本研究针对现有方法无法捕捉艺术情感细微线索的问题,提出ProFocus框架,通过层级艺术评论家与渐进式提示融合模块,在ArtEmis数据集上实现了更优的情感识别与解释性能。
DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) ; University of Bergamo(贝加莫大学)
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV
AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。
VLZip:用于交错长上下文建模的统一视觉与文本压缩方法
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。
PaDoc:基于布局的文档并行解码方法
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出PaDoc,一种基于布局的文档并行解码解析器,在OmniDocBench Full数据集上取得优异性能,且在A800 GPU上显著提升端到端文档解析的吞吐量并降低延迟。
URNet:用于高效RGB-D语义分割的统一重参数化网络
机构 * University of Technology Sydney(悉尼科技大学) ; Nanjing University of Science and Technology(南京理工大学) ; Honor Device Co., Ltd.(荣耀终端有限公司) ; Shanghai Institute of Microsystem and Information Technology, CAS(中国科学院上海微系统与信息技术研究所)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对现有RGB-D语义分割方法的不足,提出URNet,通过单编码器实现多模态特征提取与跨模态融合,采用RepBlock、LGA和PMD,在多基准上达到最优性能且高效。
Comments ACM MM 2026
CRIL-U-Net:用于从T1w和FLAIR MRI中分割局灶性皮质发育不良的紧凑比率交互学习网络
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 该研究针对II型局灶性皮质发育不良MRI自动分割难题,提出CRIL-U-Net模型,在85例患者与25例对照的五折交叉验证中,其性能显著优于传统及注意力型U-Net。
MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV
AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。
Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026
检测器何时失效:通过专家引导的互蒸馏缩小尾域差距
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CL
AI总结 针对多模态假新闻检测器跨域泛化差的问题,提出专家引导的互蒸馏方法,构建域平衡基准Weibo_Balanced,在四个数据集上实现SOTA准确率并大幅降低域偏差。
基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割
机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) ; School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) ; School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。
Comments 11 pages
迈向视觉语言导航的双脑最小充分表示
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; University of Zurich(苏黎世大学) ; University of Exeter(埃克塞特大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。
视觉令牌压缩增强多模态大语言模型的鲁棒性
机构 * Hefei University of Technology(合肥工业大学)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。
Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP
视而不见,仍记于心:全模态大语言模型的令牌压缩
机构 * KAIST(韩国科学技术院) ; VGG, University of Oxford(牛津大学视觉几何组)
专题命中 多模态训练与对齐 :audio-visual(abstract);omni-modal(abstract);分类 cs.CV
AI总结 研究旨在降低Omni-LLMs推理时输入令牌成本,提出无需训练的ReMo框架,通过跨模态重分配信息压缩视觉令牌,在Qwen2.5-Omni上实验,去除54%输入令牌且准确率无损失,甚至略超全令牌模型。
Comments Preprint
MorphologyFM:一种用于从心电图和脉搏血氧波形中进行形态感知表示学习的基础模型
机构 * University of the Chinese Academy of Sciences(中国科学院大学) ; Columbia University(哥伦比亚大学)
专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 研究针对现有生理波形方法未保留临床意义波形形态的问题,提出多模态基础模型MorphologyFM,通过形态感知自监督学习目标预训练,结合多种技术学习相关表示,在多下游任务中表现优于其他方法,证明联合建模更具可转移性。
编织光与时间:用于密集RGB-事件解析的统一谐波-几何表示学习
机构 * NKIARI(鹏城实验室) ; VCIP, CS, Nankai University(南开大学视觉计算与图像处理研究室) ; AAIS, Nankai University(南开大学人工智能学院)
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
AI总结 研究针对RGB-事件解析中统一主干应用的挑战,提出Evita统一主干,嵌入几何视差校正等协同学习模块,构建N-ImageNetV2及预训练协议,经多基准评估,其实现新指标,在实时多模态上精度-延迟权衡表现卓越。
Sparse4D-Radar:一种通过4D雷达-相机融合实现高效且稳健的环视3D目标检测框架
机构 * State Key Laboratory of Ocean Sensing and Ocean College, Zhejiang University(浙江大学海洋传感与海洋学院海洋传感技术国家重点实验室) ; Engineering Research Center of Oceanic Sensing Technology and Equipment, Ministry of Education, Zhejiang University(浙江大学海洋传感技术与装备教育部工程研究中心) ; Donghai Laboratory(东海实验室) ; Ocean College, Institute of Marine Electronics and Intelligent Systems, Zhejiang University(浙江大学海洋学院海洋电子与智能系统研究所)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对4D成像雷达在环视感知缺乏成熟方案的问题,提出Sparse4D-Radar框架。设计可变形融合模块等,经实验验证该框架在环视3D检测性能上达先进水平,兼顾精度、鲁棒性与效率。
Comments 13 pages, 6 figures
HVPNet:一种用于通用显著和伪装目标检测的仿生网络
机构 * School of Artificial Intelligence, Jiangxi Normal University(江西师范大学人工智能学院) ; Faculty of Business Information, Shanghai Business School(上海商学院商务信息学院) ; School of Computer Science and Information Engineering, Shanghai Institute of Technology(上海应用技术大学计算机科学与信息工程学院)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 受人类视觉过程启发,提出简单通用的仿生架构HVPNet,通过视网膜整合模块和皮层解码器实现多模态特征高效融合,在7个任务22个数据集上取得精度-效率平衡。
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。
Comments Accepted by ECCV 2026
双稀疏聚合Transformer用于多光谱目标检测
机构 * Northwestern Polytechnical University(西北工业大学) ; School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络空间安全学院) ; Shaanxi Provincial Key Laboratory of Speech and Image Information Processing(陕西省语音与图像信息处理重点实验室) ; National Engineering Laboratory for Integrated Aerospace-Ground-Ocean Big Data Application Technology(空天地海一体化大数据应用技术国家工程实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出双稀疏聚合Transformer(DSAFormer),通过空间和通道稀疏注意力机制减少冗余交互,并引入可学习加法融合模块增强多模态特征融合,在四个数据集上达到最优检测性能。
DynFS-MoE: 用于创伤后癫痫诊断的动态功能-结构混合专家模型
机构 * Department of Systems Engineering, Stevens Institute of Technology(史蒂文斯理工学院系统工程系) ; Department of Neurosurgery, Robert Wood Johnson Medical School, Rutgers University(罗格斯大学罗伯特·伍德·约翰逊医学院神经外科)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出动态多模态混合专家框架,通过时间感知功能-结构编码和类别条件专家路由,融合功能与结构MRI,在三个二分类任务中优于静态融合基线,并揭示有意义的ROI交互。
通过正则化微调实现可域泛化的3D视觉-语言模型适应
机构 * Concordia University(康考迪亚大学)
专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 提出ReFine3D框架,通过选择性层调优、多视图一致性、同义词提示及点渲染视觉监督等正则化策略,提升3D大语言模型在域泛化中的性能。
Comments Accepted at Transactions on Machine Learning Research (TMLR)
CAP:面向患者级监督的PPG通用表示学习
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Peking University(北京大学) ; Independent Researcher(独立研究者) ; Jinling Clinical Medical College College of Artificial Intelligence Nanjing University of Aeronautics and Astronautics(金陵临床医学院人工智能学院南京航空航天大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出CAP方法,通过构建大规模PPG-EHR多模态数据集和跨模态对比对齐,学习患者级临床语义的PPG表示,在四项下游任务中平均提升26.7%,呼吸率预测提升87.6%。
Comments Accepted as an Oral presentation at KDD 2026
红外与可见光图像的文本驱动融合:在双曲空间实现图像场景自适应
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出一种文本驱动的红外与可见光图像融合框架,利用双曲流形学习嵌入层次语义,通过BLIP文本提示引导视觉-属性对齐,实现无文本输入的自适应融合,性能优于现有方法。
Comments 14 pages, 8 figures
特质更深:面向人格评估的特质特异性非对称融合
机构 * Hefei University of Technology(合肥工业大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) ; Jianghuai Advanced Technology Center(江淮前沿技术中心) ; Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。
MARCUS:结合上下文城市信号的缺失感知区域表示用于租金预测
机构 * The Property Investors Alliance(房地产投资者联盟)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 针对城市区域表示中缺失数据的语义价值被忽略问题,提出缺失感知区域表示模型MARCUS,将缺失视为城市信号,在悉尼和纽约租金预测任务上较基线显著降低MAE,性能最优。
Comments 10 pages, 7 figures, 4 tables. Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)
PiMiX 2.0: 人工智能增强的放射成像与断层扫描数据融合
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract)
AI总结 提出AI增强的数据融合框架PiMiX 2.0,集成多实验多模态放射成像与断层扫描,支持自动数据摄取、3D/4D重建及物理感知解释,加速数据处理并提升可重复性。
Comments 9 pages, 4 figures, 1 table. Work presented in the 26th Topical Conference on High Temperature Plasma Diagnostics Conference, Cambridge, MA, USA (June 7 - 11, 2026)
缺失令牌提示的可靠性感知融合用于鲁棒多语种说话人识别
机构 * Hefei University of Technology(合肥工业大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 提出MRAF框架,通过可学习的缺失令牌和可靠性感知交叉注意力融合,解决多语种场景下跨语言泛化和人脸缺失时的鲁棒性问题,在POLY-SIM 2026测试集上取得高准确率。
Comments 8 pages, 3 figures, 4 tables
PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学
机构 * Johnson & Johnson Innovative Medicine(强生创新医药)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI;multi-modal(comments)
AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。
Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences
迭代微调对复杂历史梵文手稿转录准确率的影响
机构 * Centre for Inter-disciplinary Artificial Intelligence (CAI)(跨学科人工智能中心(CAI)) ; FLAME University(火焰大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对复杂历史梵文手稿的OCR挑战,提出可在布局与外观层级迭代微调的传统OCR流水线,构建含精细标注的数据集,验证了迭代微调的性能提升并完成多模态大模型基准测试。
代码作为表示:学术文档的可编译解析范式
机构 * Southeast University(东南大学) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。
Comments Accepted by ACM MM 2026