arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26071 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2501.04336 2026-03-05 cs.CV 57%

Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs

构建一个思维宫殿:为有效长视频分析构建基于环境的语义图谱

Zeyi Huang, Yuyang Ji, Xiaofang Wang, Nikhil Mehta, Tong Xiao, Donghyun Lee, Sigmund Vanvalkenburgh, Shengxin Zha, Bolin Lai, Yiqiu Ren, Licheng Yu, Ning Zhang, Yong Jae Lee, Miao Liu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Meta UIUC(伊利诺伊大学香槟分校)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 VideoMindPalace通过构建环境基础的语义图谱,提升长视频分析中空间-时间连贯性和类人推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03541 2026-03-05 cs.CL cs.AI 57%

RAG-X: Systematic Diagnosis of Retrieval-Augmented Generation for Medical Question Answering

RAG-X: 用于医疗问答的检索增强生成系统系统性诊断

Aswini Sivakumar, Vijayan Sugumaran, Yao Qiang

机构 * Oakland University(奥克兰大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 RAG-X通过系统性诊断框架,评估检索和生成过程,揭示问答系统中的隐藏失败模式,提升医疗问答的准确性和可靠性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23286 2026-02-27 cs.CL cs.AI cs.DB cs.IR 57%

SPARTA: Scalable and Principled Benchmark of Tree-Structured Multi-hop QA over Text and Tables

SPARTA:可扩展且原则性的树状多跳问答基准

Sungho Park, Jueun Kim, Wook-Shin Han

机构 * POSTECH

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 SPARTA通过自动生成大规模表格-文本问答基准测试,揭示了跨模态推理的深层缺陷。

Comments 10 pages, 5 figures. Published as a conference paper at ICLR 2026. Project page: https://sparta-projectpage.github.io/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21992 2026-02-26 cs.CV 57%

PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

PanoEnv:探索基于强化学习的全景环境中3D空间智能

Zekai Lin, Xu Zheng

机构 * University of Glasgow(格拉斯哥大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 PanoEnv通过强化学习框架提升VLMs在全景环境中3D空间推理能力,实现更高准确率和语义评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 57%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19240 2026-02-24 cs.AI 57%

Topology of Reasoning: Retrieved Cell Complex-Augmented Generation for Textual Graph Question Answering

推理拓扑:检索细胞复杂度增强的生成用于文本图问题回答

Sen Zhao, Lincheng Zhou, Yue Chen, Ding Zou

机构 * Academy of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学先进交叉学科研究院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴电信设备智能系统部)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出TopoRAG,通过将文本图提升为细胞复杂度,捕捉高维拓扑依赖,提升文本图问题回答的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19224 2026-02-24 cs.CV 57%

Knowledge-aware Visual Question Generation for Remote Sensing Images

面向遥感图像的知识感知视觉问题生成

Siran Li, Li Mi, Javiera Castillo-Navarro, Devis Tuia

机构 * EPFL Switzerland(瑞士联邦理工学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 本文提出KRSVQG模型,通过结合外部知识生成更丰富、基于图像和领域知识的问题,提升遥感图像问答系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21990 2026-02-24 cs.CV cs.SD 57%

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入

Changli Tang, Qinfan Xiao, Ke Mei, Tianyi Wang, Fengyun Rao, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16334 2026-02-19 cs.SD cs.AI 57%

Spatial Audio Question Answering and Reasoning on Dynamic Source Movements

空间音频问答与动态声源运动推理

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12255 2026-02-19 cs.CV 57%

Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets

Fusionista2.0:大规模数据集的高效检索系统

Huy M. Le, Dat Tien Nguyen, Phuc Binh Nguyen, Gia Bao Le Tran, Phu Truong Thien, Cuong Dinh, Minh Nguyen, Nga Nguyen, Thuy T. N. Nguyen, Tan Nhat Nguyen, Binh T. Nguyen

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed Bin Zayed人工智能大学(MBZUAI)) AISIA Research Lab(AISIA研究实验室) University of Information Technology(信息技术大学) Ho Chi Minh University of Science(胡志明科学大学) Vietnam National University, Ho chi Minh City(越南国家大学,胡志明市)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 Fusionista2.0通过优化预处理、识别技术和用户界面,实现了大规模视频检索的高效性和准确性提升。

Journal ref MultiMedia Modeling. MMM 2026. Lecture Notes in Computer Science, vol 16415

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00736 2026-02-16 cs.CV 57%

Unifying Multiple Foundation Models for Advanced Computational Pathology

统一多种基础模型以推进高级计算病理学

Wenhui Lei, Yusheng Tan, Anqi Li, Hanyu Chen, Hengrui Tian, Ruiying Li, Zhengqun Jiang, Fang Yan, Xiaofan Zhang, Shaoting Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Washington University in St. Louis(华盛顿大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) Shanghai Innovation Institute(上海创新研究院) Sensetime Research(商汤科技研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。

Comments 50 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10518 2026-02-12 cs.CV 57%

MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps

MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试

Sharat Bhat, Harshita Khandelwal, Tushar Kataria, Vivek Gupta

机构 * University of Southern California(南加州大学) University of California Los Angeles(加州大学洛杉矶分校) University of Utah(犹他大学) Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07624 2026-02-10 cs.AI 57%

M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions

M2A:具有双层混合记忆的多模态记忆代理用于长期个性化交互

Junyu Feng, Binxiao Xu, Jiayi Chen, Mengyu Dai, Cenyang Wu, Haodong Li, Bohan Zeng, Yunliu Xie, Hao Liang, Ming Lu, Wentao Zhang

专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI

AI总结 M2A通过双层混合记忆系统实现长期多模态交互中的个性化响应,利用在线更新机制提升用户偏好适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05728 2026-02-06 cs.CL cs.AI 57%

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

CompactRAG: 减少多跳问答中的LLM调用和令牌开销

Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) Isoftstone Information Technology (Group) Co.,Ltd.(伊软石信息技术(集团)有限公司) College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) School of Electronic Information, Central South University(电子信息学院,中南大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 CompactRAG通过解耦离线语料重组与在线推理,减少多跳问答中的LLM调用和令牌消耗,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22218 2026-02-02 cs.CV cs.DL 57%

What Lies Beneath: A Call for Distribution-based Visual Question & Answer Datasets

表下之物:对基于分布的视觉问答数据集的呼吁

Jill P. Naiman, Daniel J. Evans, JooYoung Seo

机构 * Information Science(信息科学) University of Illinois(伊利诺伊大学) Urbana-Champaign(厄巴纳-香槟) Illinois, USA(伊利诺伊斯州,美国)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文呼吁建立专门针对科学图表的VQA基准,通过生成合成图表并要求模型基于底层数据回答问题,以解决现有数据集未能捕捉的图表与数据间关系的推理挑战。

Comments Accepted to ACM/IEEE Joint Conference on Digital Libraries JCDL 2025, 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 57%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19225 2026-01-29 cs.CL cs.AI 57%

RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering

RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答

Kaehyun Um, KyuHwan Yeom, Haerim Yang, Minyoung Choi, Hyeongjun Yang, Kyong-Ho Lee

机构 * Yonsei University(延世大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19847 2026-01-29 cs.AI cs.DC 57%

DGRAG: Distributed Graph-based Retrieval-Augmented Generation in Edge-Cloud Systems

DGRAG:边缘-云计算系统中的分布式图驱动检索增强生成

Wenqing Zhou, Yuxuan Yan, Qianqian Yang

机构 * Zhejiang University(浙江大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 DGRAG是一种面向边缘-云计算系统的分布式图驱动检索增强生成框架,通过边缘设备本地知识图和云端轻量级索引实现隐私保护和高效检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12658 2026-01-27 cs.CL cs.AI 57%

Augmenting Question Answering with A Hybrid RAG Approach

通过混合RAG方法增强问答

Tianyi Yang, Nashrah Haque, Vaishnave Jonnalagadda, Yuya Jeremy Ong, Zhehui Chen, Yanzhao Wu, Lei Yu, Divyesh Jadav, Wenqi Wei

机构 * Plastic Lab(塑料实验室) Google(谷歌) Florida International University(佛罗里达国际大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出SSRAG方法,通过混合查询增强、代理路由和结构化检索技术,提升问答任务的响应质量。

Comments 10 pages, 5 tables, 2 figures; presented at IEEE CogMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09396 2026-01-27 cs.CV 57%

Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA

过多的帧,但并非都有用:长视频问答的高效策略

Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya, Wonjeong Ryu, Donghyun Kim, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 LVNet通过高效的关键帧选择器提升长视频问答效率,实现四个基准数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 57%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16478 2026-01-26 cs.CL cs.AI 57%

DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering

DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理

Haotian Chen, Qingqing Long, Siyu Pu, Xiao Luo, Wei Ju, Meng Xiao, Yuanchun Zhou, Jianghua Zhao, Xuezhi Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Peking University(北京大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15457 2026-01-23 cs.CL cs.AI cs.IR 57%

Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering

分块、检索与重排序:RAG架构在政策文件问答中的实证评估

Anuj Maharjan, Umesh Yadav

机构 * Computer Science (EECS) University of Toledo Toledo, OH, USA

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文通过实证评估,比较了RAG架构在政策文件问答中的有效性,发现Advanced RAG在忠实度上表现更优,但文档分段限制影响多步骤推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14757 2026-01-22 cs.CV 57%

ReinPath: A Multimodal Reinforcement Learning Approach for Pathology

ReinPath:一种用于病理学的多模态强化学习方法

Kangcheng Zhou, Jun Jiang, Qing Zhang, Shuang Zheng, Qingli Li, Shugong Xu

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 ReinPath提出了一种多模态强化学习方法,通过构建高质量病理学VQA数据集,结合语义奖励策略和群体相对策略优化,提升了病理图像和文本的多模态推理能力,并在零样本分类任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 57%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12198 2026-01-19 cs.CV 57%

ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models

ViSTA: 基于多模态适配器的文本到图像扩散模型用于视觉叙事

Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal

机构 * Department of Computer Science, Georgetown University(计算机科学系,乔治城大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 ViSTA通过多模态历史适配器提升文本到图像扩散模型在视觉叙事中的生成一致性与文本对齐能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10323 2026-01-16 cs.CV cs.CL 57%

ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding

ROMA: 实时多模态助手与交互式流式理解

Xueyun Tian, Wei Li, Bingbing Xu, Heng Dong, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。

Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10228 2026-01-16 cs.CV cs.MM eess.IV 57%

Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge

优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案

Sicheng Yang, Yukai Huang, Shitong Sun, Weitong Cai, Jiankang Deng, Jifei Song, Zhensong Zhang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。

Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 57%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16787 2026-01-13 cs.CL cs.AI 57%

Credible Plan-Driven RAG Method for Multi-Hop Question Answering

可信计划驱动的RAG方法用于多跳问答

Ningning Zhang, Chi Zhang, Zhizhong Tan, Xingxing Yang, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学技术大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 PAR-RAG通过引入复杂性感知的计划生成和双验证机制,提升了多跳问答任务中的推理稳定性和事实一致性,实现了更可靠的问答性能。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏