arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-14 至 2026-08-14 共收录 32 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2510.22282 2026-08-14 cs.CV cs.AI cs.CL 版本更新 67%

CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning

CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架

Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。

Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21783 2026-08-14 cs.CV 版本更新 57%

SHARP: Spectrum-aware Highly-dynamic Adaptation for Resolution Promotion in Remote Sensing Synthesis

SHARP: 为遥感合成促进分辨率提升的频谱感知高动态适应

Bingxuan Zhao, Qing Zhou, Chuang Yang, Junyu Gao, Qi Wang

机构 * School of Computer Science, Northwestern Polytechnical University, Xi'an, China(计算机科学学院,西北工业大学,西安,中国) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi'an, China(人工智能学院,光学与电子学(iOPEN),西北工业大学,西安,中国)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出SHARP方法,通过频谱感知的高动态适应策略,在无需训练的情况下提升遥感图像分辨率,优于现有无训练基线,在CLIP分数、审美分数和HPSv2上表现更优。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM 2026)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2604.03314 2026-08-14 cs.CV cs.CL 版本更新 90%

CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

CoLA: 跨模态低秩适配用于多模态下游任务

Wish Suharitdamrong, Tony Alex, Muhammad Awais, Sara Atito

机构 * Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心) University of Surrey(塞维利亚大学) Surrey Institute for People-Centred AI(以人为本的人工智能研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出CoLA框架,通过引入跨模态适配路径扩展LoRA,实现双流架构中单模态基础模型的高效多模态适配,在视觉-语言和音频-视觉任务上分别提升约3%和2%的相对性能。

Comments Accepted by ICML 2026, 17 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15086 2026-08-14 cs.MM cs.CV cs.SD 版本更新 86%

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

ControlFoley: 一种统一且可控的视频到音频生成方法,具有跨模态冲突处理

Jianxuan Yang, Xinyue Guo, Zhi Cheng, Kai Wang, Lipan Zhang, Jinjie Hu, Qiang Ji, Yihua Cao, Yihao Meng, Zhaoyue Cui, Mengmei Liu, Meng Meng, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米MiLM Plus) MiLM Plus, Xiaomi Inc. Wuhan University(小米MiLM Plus 武汉大学) Wuhan University(武汉大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 ControlFoley通过联合视觉编码和时域-音域解耦提升视频到音频生成的可控性与同步性,在多种任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 85%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新 79%

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11590 2026-08-14 cs.SD cs.LG 版本更新 78%

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

CookVoice:风格可控的多模态人声生成统一框架

Haowei Lou, Hye-Young Paik, Dai Jia, Kai Li, Lina Yao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 CookVoice是统一的多模态人声生成框架,分解人声为内容、韵律、风格,支持多任务,参数少、推理高效,可控性强且生成质量接近基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05543 2026-08-14 cs.IR 版本更新 71%

omni-macos: On-Device Omni-Modal Search on Apple Silicon

omni-macos:在Apple Silicon上运行的端侧全模态搜索系统

Han Xiao

专题命中 音频语音多模态 :omni-modal(title)

AI总结 omni-macos是一款在Apple Silicon端侧运行的全模态搜索系统,可在用户Mac设备上处理多模态数据搜索,数据不离开设备,适配不同硬件规格的Mac并优化内存使用。

Comments 18 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08235 2026-08-14 eess.AS 版本更新 57%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08874 2026-08-14 cs.CV 版本更新 57%

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

AeroReformer2:面向航拍图像的语音查询指称分割

Rui Li, Chenxi Duan, Haoyang Yang

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Manchester(曼彻斯特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2604.03781 2026-08-14 cs.RO 版本更新 82%

OpenRC: An Open-Source Robotic Colonoscopy Framework for Multimodal Data Acquisition and Autonomy Research

OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架

Siddhartha Kapuria, Mohammad Rafiee Javazm, Naruhiko Ikoma, Joga Ivatury, Mohammad Ali Nasseri, Nassir Navab, Farshid Alambeigi

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。

Comments Abstract: Added repository and contribution statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30045 2026-08-14 cs.CV 版本更新 70%

DualEraser: Joint Video Object and Effect Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

机构 * Tsinghua University(清华大学) Pengcheng National Laboratory(鹏城实验室) Huawei(华为) Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-14 cs.RO 版本更新 50%

JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2604.16878 2026-08-14 cs.LG 版本更新 82%

OC-Distill: Ontology-aware Contrastive Learning with Cross-Modal Distillation for ICU Risk Prediction

OC-Distill:基于跨模态蒸馏的面向本体的对比学习用于ICU风险预测

Zhongyuan Liang, Junhyung Jo, Hyang-Jung Lee, Sang Kyu Kim, Irene Y. Chen

机构 * UC Berkeley(伯克利大学) UCSF(旧金山大学) Samsung Advanced Institute of Technology (SAIT)(三星先进技术研究所)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)

AI总结 OC-Distill通过两阶段框架提升ICU风险预测性能,利用本体感知对比学习和跨模态知识蒸馏,提高模型对患者相似性的捕捉能力及预测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05809 2026-08-14 cs.CR cs.LG 版本更新 78%

Adjustable Text-Guided Backdoor Attacks with Natural-Word Triggers on Multimodal Pretrained Models

隐蔽且可调节的文本引导后门攻击多模态预训练模型

Yiyang Zhang, Chaojian Yu, Ziming Hong, Yuanjie Shao, Qinmu Peng, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出一种基于文本的后门攻击方法,利用常见文本词汇作为触发器,提升攻击隐蔽性和实用性,并通过视觉对抗扰动调节模型对文本触发器的学习,实现可控的攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17782 2026-08-14 cs.CV 版本更新 57%

Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval

面向主体的多粒度对齐用于零样本EEG到图像检索

Lin Jiang, Qingshan She, Jiale Xu, Haiqi Xu, Duanpo Wu, Zhenzhong Kuang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology and Applications, Hangzhou, Zhejiang(浙江省脑机协同智能技术与应用重点实验室,杭州,浙江) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SAMGA框架,通过多粒度对齐解决EEG到图像检索中主体依赖性和多尺度信息的问题,提升检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11973 2026-08-14 cs.IR 版本更新 50%

Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

Sci-Surf:通过人类反馈与智能摘要实现科学文献发现

Fang Guo, Qi Zhu, Rongcan Pei, Shuqi He, Hui Chen, Yue Zhang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2608.02711 2026-08-14 cs.CV 版本更新 79%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16285 2026-08-14 cs.CV 版本更新 70%

EvoTale: Continual Character Customization for Expanding Story Worlds

持久故事世界模拟与连续角色定制

Jinlu Zhang, Qiyun Wang, Baoxiang Du, Jiayi Ji, Jing He, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-14 cs.AI 版本更新 57%

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12608 2026-08-14 cs.CV 版本更新 57%

A Data Efficiency Study of Synthetic Fog for Object Detection Using the Clear2Fog Pipeline

使用Clear2Fog管道研究合成雾的数据效率

Mohamed Ahmed Mohamed, Xiaowei Huang

机构 * Waymo Open Dataset(Waymo开放数据集)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Clear2Fog管道,通过物理模拟生成雾数据,研究环境多样性对模型鲁棒性的影响,发现混合密度数据训练模型优于固定密度数据,且通过调整学习率可克服合成偏见。

Comments Accepted to Neurocomputing. Project code and experimental configs available at https://github.com/mmohamed28/Clear2Fog

Journal ref Neurocomputing, Vol. 703, 134798, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 50%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 5 篇

2608.11616 2026-08-14 cs.AI cs.CV cs.LG 版本更新 86%

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

MBA:面向现实世界商业创意的多模态基准与智能体

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。

Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 84%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03880 2026-08-14 cs.CV 版本更新 70%

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03508 2026-08-14 cs.CV 版本更新 57%

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology

从多分辨率细胞到千兆像素全切片图像:用于计算病理学的基础模型

Basit Alawode, Moshira Ali Abdalla, Dwarikanath Mahapatra, Muzammal Naseer, Sajid Javed

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对现有计算病理学模型泛化性受限的问题,提出多分辨率金字塔Transformer(MRPT),经多分辨率自监督预训练后,在34个数据集的多项任务中性能优于同类模型与多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03799 2026-08-14 cs.CL 版本更新 57%

Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

自然语言处理:从分词到RLHF的全面实用指南

Mullosharaf K. Arabov

机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。

Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 3 篇

2508.08199 2026-08-14 cs.CV 版本更新 85%

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-14 cs.CL cs.CV 版本更新 84%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 24 pages, 2 figures. Major theoretical revision: reformulated cross-instance geometry, null-relation analysis, relation-stratified normalization, and representation-aware traversal coordinates; expanded related work and implementation details. Preliminary technical report; empirical validation is left to future work

详情

展开后加载摘要…

URL PDF HTML 收藏