arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2405.16730 2026-04-28 cs.LG cs.AI stat.AP 57%

"Noisier" Noise Contrastive Eestimation is (Almost) Maximum Likelihood

更嘈杂的噪声对比估计几乎等同于最大似然估计

Peiyu Yu, Dinghuai Zhang, Hengzhi He, Xiaojian Ma, Sirui Xie, Ruiyao Miao, Yifan Lu, Yasi Zhang, Deqian Kong, Ruiqi Gao, Jianwen Xie, Guang Cheng, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Mila - Quebec AI Institute(魁北克人工智能研究所) Google DeepMind(谷歌DeepMind) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Akool Research(Akool研究)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出'Noisier' NCE,通过增大噪声幅度使NCE梯度接近最大似然估计,从而在理论和实践中实现更快收敛,适用于高维和多模态数据集的密度比估计。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22678 2026-04-27 cs.CL 57%

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

BERAG:基于贝叶斯集成的检索增强生成用于基于知识的视觉问答

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne

机构 * Department of Engineering(工程系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 BERAG通过将语言模型条件于单个检索文档而非单一上下文,解决检索增强生成中文档贡献不明和长上下文中的信息丢失问题,提升视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22374 2026-04-27 cs.CL 57%

Selective Contrastive Learning For Gloss Free Sign Language Translation

选择性对比学习用于无 gloss 手语翻译

Changhao Lai, Rui Zhao, Xuewen Zhong, Jinsong Su, Yidong Chen

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省 Fujian-Taiwan 非物质文化遗产数字保护与智能处理重点实验室,文化部,中国) National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出选择性对比学习方法,通过动态选择负样本提升手语翻译的跨模态对齐效果,减少噪声干扰。

Comments Accepted by ACL 2026 as the main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22180 2026-04-27 cs.IR cs.AI 57%

ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

ResRank:通过端到端联合训练与残差段落压缩统一检索与列表级重排序

Xiaojie Ke, Shuai Zhang, Liansheng Sun, Yongjin Wang, Hengjun Jiang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 ResRank通过端到端联合训练与残差段落压缩技术,解决传统重排序方法中输入长度增加导致的排名质量下降和推理延迟问题,实现高效且有效的检索与重排序统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22174 2026-04-27 cs.CV 57%

Unlocking Optical Prior: Spectrum-Guided Knowledge Transfer for SAR Generalized Category Discovery

解锁光学先验:基于频谱引导的知识迁移用于SAR广义类别发现

Jingyuan Xia, Ruikang Hu, Ye Li, Zhixiong Yang, Xu Lan, Zhejun Lu

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学与技术学院,国防科技大学) State Key Laboratory of Complex System Simulation and Modeling Technology(复杂系统仿真与建模技术国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于频谱引导的知识迁移框架,通过频谱差异建模提升SAR图像中光学先验的适应性,实现广义类别发现任务的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21806 2026-04-27 cs.CV 57%

TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval

TEMA: 图像锚定,文本引导的多修改复合图像检索

Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Yongqi Li, Liqiang Nie

机构 * School of Software, Shandong University(山东大学软件学院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 TEMA通过构建多修改数据集和提出文本导向实体映射架构,解决复合图像检索中的实体覆盖不足和句法-实体对齐问题,提升检索准确性和效率。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13211 2026-04-27 cs.CV 57%

3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale

3DAlign-DAER:动态注意力策略与高效检索策略用于大规模细粒度3D文本对齐

Yijia Fan, Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Keze Wang

机构 * Uni3D-g

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出3DAlign-DAER框架,通过动态注意力策略和高效检索策略实现文本与3D几何的细粒度对齐,解决大规模3D数据库下的对齐性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV 57%

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14165 2026-04-22 cs.CL 57%

EviSearch: A Human in the Loop System for Extracting and Auditing Clinical Evidence for Systematic Reviews

EviSearch:一个用于系统综述中提取和审计临床证据的人机协作系统

Naman Ahuja, Saniya Mulla, Muhammad Ali Khan, Zaryab Bin Riaz, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 EviSearch通过多智能体系统自动化从原始试验PDF中生成与本体对齐的临床证据表,并提供细胞级可追溯性以供审计和人工验证,提升提取精度并减少手动校对负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18037 2026-04-21 cs.CV 57%

HABIT: Chrono-Synergia Robust Progressive Learning Framework for Composed Image Retrieval

HABIT: 时序协同鲁棒渐进学习框架用于复合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Shiqi Zhang, Qinlei Huang, Zhiheng Fu, Yinwei Wei

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 HABIT框架通过互知识估计模块和双一致性渐进学习模块,解决复合图像检索中的噪声三元组对应问题,提升鲁棒性和检索性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17898 2026-04-21 cs.CV 57%

ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval

ReTrack:基于证据的双流方向锚校准网络用于复合视频检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Qinlei Huang, Guozhi Qiu, Zhiheng Fu, Meng Liu

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 ReTrack通过校准复合特征的方向偏差,解决复合视频检索中模态贡献纠缠、特征优化和检索不确定性问题,实现多模态查询理解的提升,并在复合图像检索任务中取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15951 2026-04-21 cs.AI 57%

Integrating Graphs, Large Language Models, and Agents: Reasoning and Retrieval

图、大语言模型与代理的整合:推理与检索

Hamed Jelodar, Samita Bai, Mohammad Meymani, Parisa Hamedi, Roozbeh Razavi-Far, Ali Ghorbani

机构 * Canadian Institute for Cybersecurity, Faculty of Computer Science, University of New Brunswick(加拿大网络安全研究所,计算机科学学院,新不伦瑞克大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了图与大语言模型整合的设计选择,分类了基于用途、图模态和整合策略的方法,探讨了不同领域中的适用场景和优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13468 2026-04-21 cs.IR cs.CL 57%

From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines

从相关性到权威性:面向网页搜索引擎的权威感知生成检索

Sunkyung Lee, Jihye Back, Donghyeon Jeon, Soonhwan Kwon, Moonkwon Kim, Inho Kang, Jongwuk Lee

机构 * Sungkyunkwan University(成均馆大学) Naver Corporation(Naver公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。

Comments ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17005 2026-04-21 cs.CV cs.SD 57%

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance: 基于对比对齐的文本控制音乐驱动舞蹈生成

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * University of Surrey, Guildford, Surrey, UK(萨里大学) Jiangnan University, Wuxi, Jiangsu, China(江南大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出TeMuDance框架,通过统一嵌入空间对齐音乐、文本和运动数据,实现无需手动标注数据的文本控制音乐驱动舞蹈生成,提升语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15663 2026-04-20 cs.SE cs.AI 57%

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

CodeMMR:连接自然语言、代码和图像以实现统一检索

Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

机构 * MBZUAI Linköping University(林雪平大学) University of Groningen(格罗宁根大学) TU Darmstadt(图宾根大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CodeMMR,通过指令式多模态对齐,将自然语言、代码和图像嵌入共享语义空间,实现跨模态和语言的强泛化,优于基线模型,并提升RAG中的代码生成精度与视觉 grounding。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10166 2026-04-17 cs.MM 57%

Fact-Checking with Contextual Narratives: Leveraging Retrieval-Augmented LLMs for Social Media Analysis

基于上下文叙述的事实核查:利用检索增强的LLM进行社交媒体分析

Arka Ujjal Dey, Muhammad Junaid Awan, Georgia Channing, Christian Schroeder de Witt, John Collomosse

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 CRAVE框架整合检索增强的大语言模型与聚类技术,通过多模态证据检索和聚类分析,提升社交媒体事实核查的准确性和解释性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10410 2026-04-17 cs.AI 57%

CWCD: Category-Wise Contrastive Decoding for Structured Medical Report Generation

CWCD:用于结构化医学报告生成的类别级对比解码

Shantam Srivastava, Mahesh Bhosale, David Doermann, Mingchen Gao

机构 * The Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, The State University of New York, NY, USA(布法罗大学,纽约州立大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出CWCD框架,通过类别特定参数化和对比正常与遮蔽X光片生成结构化放射报告,提升临床效果和生成质量。

Comments Accepted to MIDL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08952 2026-04-17 cs.CL cs.IR 57%

MAB-DQA: Addressing Query Aspect Importance in Document Question Answering with Multi-Armed Bandits

MAB-DQA: 通过多臂老虎机解决文档问答中的查询方面重要性

Yixin Xiang, Yunshan Ma, Xiaoyu Du, Yibing Chen, Yanxin Zhang, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡国立大学) Nanjing Pami Intelligent Technology Co., Ltd.(南京帕米智能科技有限公司) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Nanjing Forestry University(南京林业大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出MAB-DQA框架,通过多臂老虎机模型解决文档问答中查询方面的重要性问题,通过分解查询为方面感知的子查询并动态分配检索预算,提升文档理解性能。

Comments Accepted by ACL 2026. 20 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21262 2026-04-17 cs.CL 57%

CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding

CausalEmbed: 在潜在空间中实现自动回归多向量生成用于视觉文档嵌入

Jiahao Huo, Yu Huang, Yibo Yan, Ye Pan, Kening Zheng, Wei-Chieh Huang, Yi Cao, Mingdong Ou, Philip S. Yu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出CausalEmbed方法,通过对比训练中的迭代边际损失生成紧凑且结构良好的多向量嵌入,实现高效的视觉文档检索,减少30-155倍的token数量同时保持高性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13168 2026-04-17 cs.AI cs.CE cs.IR cs.MA 57%

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows

Finch:跨电子表格中心企业工作流的金融与会计基准测试

Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Zikun Zhu, Adina Yakefu, Shuxin Zheng

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 Finch通过真实企业工作流评估AI代理,包含数据录入、结构化、格式化等任务,涵盖预算、交易等多领域,展示了AI在复杂企业工作流中的挑战。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-04-16 cs.CV 57%

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13101 2026-04-16 cs.SE cs.AI 57%

Building Trust in the Skies: A Knowledge-Grounded LLM-based Framework for Aviation Safety

在天空中建立信任:一种基于知识的LLM框架用于航空安全

Anirudh Iyengar, Alisa Tiselska, Dumindu Samaraweera, Hong Liu

机构 * Senior Member, IEEE(IEEE高级会员) IEEE

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出结合LLM和知识图谱的框架,提升航空安全分析的可信度,通过双阶段流程构建和验证安全知识,提高准确性和可追溯性。

Comments Initial version of a conference publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12371 2026-04-16 cs.CV 57%

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

机构 * Cisco Systems(思科系统)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 57%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16662 2026-04-16 cs.HC cs.AI cs.IR cs.LG 57%

Safire: Similarity Framework for Visualization Retrieval

Safire:可视化检索的相似性框架

Huyen N. Nguyen, Nils Gehlenborg

机构 * Harvard Medical School(哈佛医学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Safire框架,通过比较标准和表示模态两个维度,系统化分析可视化相似性,揭示不同应用场景中相似性标准与表示模态的关联,并探讨其对多模态学习、AI应用和可视化可重复性的影响。

Comments To appear in IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13340 2026-04-15 cs.CV 57%

Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models

检索可能有害:揭示检索增强扩散模型的后门漏洞

Hao Fang, Xiaohang Sui, Hongyao Yu, Kuofeng Gao, Jiawei Kong, Sijin Yu, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文揭示了检索增强扩散模型(RDM)的后门漏洞,通过多模态对比攻击方法BadRDM,展示了如何利用检索数据库中的毒害代理进行攻击,同时保持模型的正常功能。

Comments Accepted by ACL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11668 2026-04-14 cs.CV 57%

UNIGEOCLIP: Unified Geospatial Contrastive Learning

UNIGEOCLIP:统一地理对比学习

Guillaume Astruc, Eduard Trulls, Jan Hosang, Loic Landrieu, Paul-Edouard Sarlin

机构 * LASTIG, Univ Gustave Eiffel, IGN, ENSG, France(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理林业信息研究所,法国国家地理科学学院,法国) Google, Switzerland(谷歌,瑞士) CNES, France(法国国家空间研究中心,法国) LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris, Marne-la-Vallée, France(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科桥梁学院,巴黎理工学院,马恩拉瓦莱,法国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 UNIGEOCLIP通过统一嵌入空间对五种地理模态进行联合对齐,提升多模态地理数据的对比学习性能,优于单一模态模型和坐标基线。

Journal ref CVPR 2026 EarthVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18027 2026-04-08 cs.CL 57%

PDF Retrieval Augmented Question Answering

PDF检索增强型问答

Thi Thu Uyen Hoang, Meenakshi Rajendran, Kun Zhang, Yuhan Wu, Viet Anh Nguyen

机构 * Saarland University(萨尔兰大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出基于检索增强生成框架的PDF多模态问答系统,通过整合非文本元素提升复杂查询的准确性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03039 2026-04-07 cs.CV 57%

GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model

GenSmoke-GS:一种基于生成模型的多阶段方法,用于从烟雾退化图像中生成新视角

Qida Cao, Xinyuan Hu, Changyue Shi, Jiajun Ding, Zhou Yu, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV

AI总结 本文提出GenSmoke-GS方法,通过多阶段流程提升烟雾退化图像的可视性,减少场景内容变化,实验表明其在定量和视觉质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01598 2026-04-03 cs.CV 57%

Riemannian and Symplectic Geometry for Hierarchical Text-Driven Place Recognition

Riemannian和Symplectic几何用于层次化文本驱动的位置识别

Tianyi Shang, Zhenyu Li

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SympLoc框架,通过多级对齐策略提升文本到点云定位的鲁棒性,实验显示在KITTI360Pose数据集上Top-1召回率提升19%。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏