arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-15 至 2026-04-15 共收录 78 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2604.12537 2026-04-15 cs.CV cs.AI 84%

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 79%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22799 2026-04-15 cs.CV 77%

VPTracker: Global Vision-Language Tracking via Visual Prompt

VPTracker: 基于多模态大语言模型的全局视觉-语言跟踪

Jingchao Wang, Kaiwen Zhou, Zhijian Wu, Kunhua Ji, Dingjiang Huang, Yefeng Zheng

机构 * School of Data Science and Engineering, East China Normal University, Shanghai 200062, China(数据科学与工程学院,华东师范大学,上海200062,中国) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou 310024, China(医学人工智能实验室,西湖大学,杭州310024,中国)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出VPTracker,首个基于多模态大语言模型的全局视觉-语言跟踪框架,通过引入位置感知的视觉提示机制,提升跟踪鲁棒性和稳定性,有效抑制干扰。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10200 2026-04-15 cs.AI cs.CV 76%

Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts

Edu-MMBias: 一种三级多模态基准,用于在教育背景下审计视觉-语言模型中的社会偏见

Ruijia Li, Mingzi Zhang, Zengyi Yu, Yuang Wei, Bo Jiang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华师范大学教育人工智能研究所) Faculty of Education, East China Normal University(东华师范大学教育学院)

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文提出Edu-MMBias基准,通过三级维度审计视觉-语言模型中的社会偏见,揭示模型存在补偿性类偏见和深层健康与种族刻板印象,视觉输入可触发偏见回潮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05818 2026-04-15 cs.CV cs.CL cs.IR 73%

WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering

WikiSeeker: 重新思考视觉语言模型在基于知识的视觉问答中的作用

Yingjian Zhu, Xinming Wang, Kun Ding, Ying Wang, Bin Fan, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室 (MAIS))

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出WikiSeeker框架,通过引入多模态检索器和重新定义视觉语言模型的角色,提升多模态检索性能和答案质量,实现在EVQA、InfoSeek和M2KR数据集上的最优表现。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12033 2026-04-15 cs.CL cs.AI cs.CV 67%

Benchmarking Deflection and Hallucination in Large Vision-Language Models

对大视觉-语言模型中偏移和幻觉的基准测试

Nicholas Moratelli, Christopher Davis, Leonardo F. R. Ribeiro, Bill Byrne, Gonzalo Iglesias

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Amazon AGI(亚马逊人工智能实验室) University of Cambridge(剑桥大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VLM-DeflectionBench基准,通过2775个样本评估模型在冲突或不足证据下的行为,揭示模型在面对噪声或误导性证据时的偏移能力不足,为可靠的KB-VQA评估提供可扩展的基准。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 57%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12115 2026-04-15 cs.CV 57%

HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models

HTDC: 通过犹豫触发的微分校准缓解大视觉-语言模型中的幻觉

Xinyun Liu

机构 * Sichuan University(四川大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HTDC,一种无需训练的解码框架,通过检测层间犹豫信号,仅在易出错步骤激活校准,有效抑制幻觉并保持任务准确性。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12096 2026-04-15 cs.AI 57%

LLM-HYPER: Generative CTR Modeling for Cold-Start Ad Personalization via LLM-Based Hypernetworks

LLM-HYPER:基于大语言模型的超网络生成CTR模型用于冷启动广告个性化

Luyi Ma, Wanjia Sherry Zhang, Zezhong Fan, Shubham Thakur, Kai Zhao, Kehui Yao, Ayush Agarwal, Rahul Iyer, Jason Cho, Jianpeng Xu, Evren Korpeoglu, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出LLM-HYPER框架,利用大语言模型作为超网络生成CTR估计器参数,通过少样本链式思维提示实现冷启动广告个性化,实验表明其在NDCG@10上优于基线方法55.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 57%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12284 2026-04-15 cs.CR 50%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2604.11964 2026-04-15 cs.HC cs.MM 85%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.MM

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 83%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10695 2026-04-15 cs.CV 83%

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

检索以恢复:通过语义一致的净化实现不完整音频-视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Nankai University(南开大学计算机学院) School of mathematics, Sun Yat-sen University(中山大学数学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出R$^{2}$ScP框架,通过检索而非生成方法处理缺失模态,利用统一语义嵌入进行跨模态检索,并引入上下文感知适应净化机制,提升语义恢复能力,实验表明其在不完整模态场景中性能更优。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12650 2026-04-15 cs.CV cs.MM 73%

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

监听深度伪造检测:一种超越以说话为中心的伪造分析的新视角

Miao Liu, Fangda Wei, Jing Wang, Xinyuan Qian

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology Beijing(北京科技大学) University of Science(科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出监听深度伪造检测任务,引入首个专门为此任务设计的ListenForge数据集,并提出MANet网络以捕捉监听伪造中的细微运动不一致,实验表明现有说话深度伪造检测模型在监听场景中表现不佳。

Comments Submitted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2604.12335 2026-04-15 cs.CV cs.LG 79%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16806 2026-04-15 cs.CV 74%

MedGS: Gaussian Splatting for Multi-Modal 3D Medical Imaging

MedGS:用于多模态3D医学影像的高斯点散射

Kacper Marzol, Ignacy Kolton, Weronika Smolak-Dyżewska, Joanna Kaleta, Żaneta Świderska-Chadaj, Marcin Mazur, Mirosław Dziekiewicz, Tomasz Markiewicz, Przemysław Spurek

机构 * Jagiellonian University, Poland(雅盖隆大学,波兰) Warsaw University of Technology, Poland(华沙理工大学,波兰) IDEAS Research Institute, Poland(IDEAS研究所,波兰) Military Institute of Medicine, Poland(军事医学研究所,波兰)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出MedGS,一种利用内镜成像独特性质的3D重建框架,通过物理逼真重照明模型提升重建质量,实现更准确的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00181 2026-04-15 cs.CV cs.AI 62%

CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning

CamReasoner:通过结构化空间推理强化相机运动理解

Hang Wu, Yujun Cai, Zehao Li, Haonan Ge, Bowen Sun, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) University of Queensland(昆士兰大学) Ant Group(蚂蚁集团) University of Chinese Academy of Sciences(中国科学院大学) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CamReasoner通过结构化推理框架提升相机运动理解,采用O-T-A范式和大规模推理轨迹集,首次利用强化学习实现逻辑对齐,提升分类和VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 57%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 57%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01186 2026-04-15 cs.CV 57%

ASTRA: Let Arbitrary Subjects Transform in Video Editing

ASTRA: 让任意主体在视频编辑中变换

Fei Shen, Weihao Xu, Rui Yan, Dong Zhang, Xiangbo Shu, Jinhui Tang, Maocheng Zhao

机构 * NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学与技术学院及人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ASTRA提出一种无需训练的视频编辑框架,通过多模态对齐模块和先验掩码重定位模块解决密集多主体场景中的注意力稀释和边界纠缠问题,实现精准操控与非目标区域的严格保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12145 2026-04-15 eess.AS cs.SD 57%

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

为何您的分词器在信息融合中失败:一种面向时间的预量化融合用于视频增强的音频分词

Xiangyu Zhang, Benjamin John Southwell, Siqi Pan, Xinlei Niu, Beena Ahmed, Julien Epps

机构 * School of Electrical Engineering and Telecommunications, University of New South Wales(新南威尔士大学电气工程与电信学院) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了视频增强音频分词中重建质量下降的根本原因,提出了一种面向时间的预量化融合方法,通过在分词器架构中合理定位融合位置,结合时间轴上的特征融合,实现了高保真重建和下游任务的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2604.12352 2026-04-15 cs.AI cs.CL 81%

MultiDocFusion: Hierarchical and Multimodal Chunking Pipeline for Enhanced RAG on Long Industrial Documents

多文档融合:一种用于长工业文档增强RAG的分块流程

Joongmin Shin, Chanjun Park, Jeongbae Park, Jaehyung Seo, Heuiseok Lim

机构 * Human-inspired AI Research(人机协同人工智能研究所) Department of Computer Science and Engineering(计算机科学与工程系) School of Software(软件学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对长工业文档结构复杂的问题,提出MultiDocFusion分块流程,结合视觉解析、OCR提取、层次结构重建和DFS分组,提升RAG检索精度和问答质量。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12574 2026-04-15 cs.CV 79%

Cross-Modal Knowledge Distillation for PET-Free Amyloid-Beta Detection from MRI

跨模态知识蒸馏用于无PET的MRI淀粉样蛋白β检测

Francesco Chiumento, Julia Dietlmeier, Ronan P. Killeen, Kathleen M. Curran, Noel E. O'Connor, Mingming Liu

机构 * Dublin City University(都柏林城市大学) Insight Research Ireland Centre for Data Analytics(爱尔兰Insight研究数据分析师中心) St. Vincent’s University Hospital(圣文森医院) University College Dublin(都柏林大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于BiomedCLIP的跨模态知识蒸馏框架,利用MRI单独预测淀粉样蛋白β,无需PET或临床变量,实现了可解释的无PET检测方法。

Comments Accepted to CVPR Workshops 2026 (PHAROS-AIF-MIH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12081 2026-04-15 cs.AI 79%

Human-Inspired Context-Selective Multimodal Memory for Social Robots

以人为本的上下文选择性多模态记忆用于社交机器人

Hangyeol Kang, Slava Voloshynovskiy, Nadia Magnenat Thalmann

机构 * Department of Computer Science, University of Geneva(日内瓦大学计算机科学系) MIRALab, University of Geneva(日内瓦大学MIRALab)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种以人为本的多模态记忆架构,用于社交机器人,通过捕捉和检索文本和视觉事件痕迹,提升个性化和上下文感知的交互能力。

Comments Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13021 2026-04-15 cs.CV cs.AI 62%

Representation geometry shapes task performance in vision-language modeling for CT enterography

表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用

Cristian Minoccheri, Emily Wittrup, Kayvan Najarian, Ryan Stidham

机构 * Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门) Department of Gastroenterology(消化内科部门) Department of Emergency Medicine(急诊医学部门) Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了CT结肠镜视觉-语言迁移学习,发现均值池化在疾病分类中表现更优,而注意力池化在跨模态检索中更有效,同时指出单片组织对比度比空间覆盖范围更重要,为构建体积医学影像视觉-语言系统提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00919 2026-04-15 cs.CL cs.AI 62%

Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving

基于检索增强生成在奥林匹克级物理问题求解中的基础模型评估

Shunfeng Zheng, Yudi Zhang, Meng Fang, Zihan Zhang, Zhitan Wu, Mykola Pechenizkiy, Ling Chen

机构 * AAII, University of Technology Sydney, New South Wales, Australia(AAII,悉尼大学,新南威尔士州,澳大利亚) Eindhoven University of Technology, Eindhoven, The Netherlands(埃因霍温理工大学,埃因霍温,荷兰) University of Liverpool, Liverpool, United Kingdom(利物浦大学,利物浦,英国) University of New South Wales, New South Wales, Australia(新南威尔士大学,新南威尔士州,澳大利亚)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过PhoPile多模态数据集评估检索增强生成在奥林匹克级物理问题求解中的表现,探讨了基础模型结合检索与物理语料对性能提升的影响及存在的挑战。

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13340 2026-04-15 cs.CV 57%

Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models

检索可能有害:揭示检索增强扩散模型的后门漏洞

Hao Fang, Xiaohang Sui, Hongyao Yu, Kuofeng Gao, Jiawei Kong, Sijin Yu, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文揭示了检索增强扩散模型(RDM)的后门漏洞,通过多模态对比攻击方法BadRDM,展示了如何利用检索数据库中的毒害代理进行攻击,同时保持模型的正常功能。

Comments Accepted by ACL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00866 2026-04-15 astro-ph.IM cs.LG 50%

Template-Fitting Meets Deep Learning: Redshift Estimation Using Physics-Guided Neural Networks

模板拟合与深度学习的结合:利用物理引导的神经网络进行红移估计

Jonas Chris Ferrao, Dickson Dias, Pranav Naik, Glory D'Cruz, Anish Naik, Siya Khandeparkar, Manisha Gokuldas Fal Dessai

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出一种结合模板拟合与深度学习的红移估计方法,通过物理引导的神经网络融合光谱数据与图像数据,实现高精度红移估计。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2604.12820 2026-04-15 cs.AI cs.CL 73%

RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair

RePAIR:通过提示感知模型修复实现交互式机器去学习

Jagadeesh Rachapudi, Pranav Singh, Ritali Vatsi, Praful Hambarde, Amit Shukla

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RePAIR框架,通过提示感知模型修复实现用户交互式机器去学习,解决大语言模型在预训练中吸收有害知识、虚假信息和隐私数据的问题,实现用户自主控制数据。

详情

展开后加载摘要…

URL PDF HTML 收藏