arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 546 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 546 篇

2603.26266 2026-07-01 cs.AI cs.CV 版本更新 70%

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation

GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见

Rui Xie, Zhi Gao, Chenrui Shi, Zirui Shang, Lu Chen, Qing Li

机构 * Shanghai Jiao Tong University(上海交通大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Beijing Institute of Technology(北京理工大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 GUIDE通过实时网络视频检索和即插即用标注框架,解决GUI代理的领域偏见问题,通过视频语义分析和自动化标注流程提升代理对特定应用的操作流程和UI布局的理解,实验表明其在多代理系统和单模型代理中均能提升性能。

Comments Accepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29341 2026-06-02 cs.CV cs.CL 70%

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

WorldMemArena: 通过动作-世界交互评估多模态智能体记忆

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) J.P. Morgan Chase(摩根大通) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21996 2026-05-29 cs.CV cs.AI 70%

VRAG: Learning World Models for Interactive Video Generation

VRAG:面向交互式视频生成的世界模型学习

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin

机构 * Peking University(北京大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学)

专题命中 多模态RAG :retrieval augmented generation(abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对自回归视频生成中累积误差和记忆机制不足的问题,提出视频检索增强生成(VRAG)方法,通过显式全局状态条件降低长期累积误差并提升时空一致性。

Comments Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17946 2026-05-21 cs.AI cs.CV cs.LG 70%

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain

SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准

Lingtao Mao, Huangyu Dai, Xinyu Sun, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13391 2026-05-14 cs.AI 70%

RS-Claw: Progressive Active Tool Exploration via Hierarchical Skill Trees for Remote Sensing Agents

RS-Claw:通过分层技能树实现渐进式主动工具探索的遥感代理

Liangtian Liu, Zeyuan Wang, Ziyu Li, Kai Ouyang, Zichao Tang, Chengfu Liu, Haifeng Li, Hanwen Yu, Wentao Yang, Cheng Yang, Dongyang Hou

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Resources and Environment, University of Electronic Science and Technology of China(资源与环境学院,电子科技大学) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(地球科学与空间信息工程学院,湖南科技大学) Sanya Institute of Hunan University of Science and Technology(海南科技大学三亚研究院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出RS-Claw,通过分层技能树实现主动探索,解决遥感代理工具选择中的被动机制问题,提升长周期推理中的工具命中率和上下文空间效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI 70%

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02409 2026-04-06 cs.CV cs.AI 70%

LumiVideo: An Intelligent Agentic System for Video Color Grading

LumiVideo:一种用于视频色彩分级的智能代理系统

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港浸会大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港浸会大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 LumiVideo通过感知、推理、执行和反思四个阶段模仿专业调色师的工作流程,利用LLM和RAG框架实现非线性色彩参数空间导航,生成符合行业标准的色彩配置文件,并支持通过自然语言反馈进行迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02034 2026-04-03 cs.AI 70%

AI in Insurance: Adaptive Questionnaires for Improved Risk Profiling

保险中的AI:适应性问卷以提升风险评估

Diogo Silva, João Teixeira, Bruno Lima

机构 * Deloitte(德勤) Faculty of Engineering, University of Porto(波尔图大学工程学院) LIACC, Faculty of Engineering, University of Porto(波尔图大学工程学院人工智能与计算机科学实验室)

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出ARQuest框架,利用大语言模型和替代数据源创建个性化适应性问卷,通过社交媒体图像分析等技术提升风险评估的准确性与用户满意度。

Journal ref International Workshop on Agentic Engineering (AGENT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM 70%

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 70%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13628 2026-03-17 cs.CV cs.AI 70%

Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models

基于可定位性的自适应推理图像地理定位方法

Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo, Taozhe Li, Ruimin Ke, Xiaofan Zhou, Chenxi Liu

机构 * The University of Utah(犹他大学) The University of Oklahoma(俄克拉荷马大学) Worcester Polytechnic Institute(沃斯特理工学院) Rensselaer Polytechnic Institute(雷士利理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02123 2026-03-09 cs.CL 70%

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00873 2026-03-03 cs.AI 70%

MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains

MC-Search:基于结构化长推理链评估和增强多模态代理搜索

Xuying Ning, Dongqi Fu, Tianxin Wei, Mengting Ai, Jiaru Zou, Ting-Wei Li, Hanghang Tong, Yada Zhu, Hendrik Hamann, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta IBM Research(IBM研究院) Stony Brook University(石溪大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 MC-Search是首个针对代理MM-RAG的基准,通过结构化长推理链评估和增强多模态代理搜索,揭示了系统性问题并改进了模型的规划和检索能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17544 2026-02-19 cs.AI 70%

A Multimodal Conversational Assistant for the Characterization of Agricultural Plots from Geospatial Open Data

一种多模态对话助手,用于从遥感开放数据中表征农业地块

Juan Cañada, Raúl Alonso, Julio Molleda, Fidel Díez

机构 * Dept. AI \& Data Analytics CTIC Technology Center Gijón, Spain Dept. IT CTIC Technology Center Gijón, Spain Eng. University of Oviedo Gijón, Spain Dept. R \& D CTIC Technology Center Gijón, Spain

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本研究提出一种多模态对话助手,通过自然语言交互整合遥感和农业数据,降低专业信息访问门槛,实现农业地块表征。

Comments Accepted at 2025 4th International Conference on Geographic Information and Remote Sensing Technology

Journal ref Proc. Int. Conf. GIRST 2025 (2025) 127-132

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10902 2026-02-18 cs.CL 70%

Multimodal Peer Review Simulation with Actionable To-Do Recommendations for Community-Aware Manuscript Revisions

多模态同行评审模拟:面向社区意识的论文修订可操作待办推荐系统

Mengze Hong, Di Jiang, Weiwei Zhao, Yawen Li, Yihang Wang, Xinyuan Luo, Yanjie Sun, Chen Jason Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究者)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本研究提出一个多模态同行评审模拟系统,通过整合文本和视觉信息,利用检索增强生成技术提升评审质量,并生成可操作的待办列表,以提高论文修订的效率和准确性。

Comments Accepted by TheWebConf 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19666 2026-02-17 cs.CL 70%

RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams

RoD-TAL:罗马尼亚驾照考试问答的基准测试

Andrei Vlad Man, Răzvan-Alexandru Smădu, Cristian-George Craciun, Dumitru-Clementin Cercel, Florin Pop, Mihaela-Claudia Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校) Technical University of Munich(慕尼黑技术大学) National Institute for Research & Development in Informatics - ICI Bucharest(信息研究所-布加勒斯特) Paris 1 Panthéon-Sorbonne University(巴黎1大学) University of Bucharest(布加勒斯特大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 RoD-TAL是一个用于评估大型语言模型和视觉语言模型在罗马尼亚驾照法律问答中性能的多模态基准数据集,通过文本和图像问答任务验证了领域微调和推理优化对考试通过率的影响。

Comments 41 pages, 30 figures, Accepted by the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14462 2026-02-17 cs.CV cs.CL 70%

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

RAVENEA:多模态检索增强视觉文化理解的基准

Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie

机构 * University of Copenhagen(哥本哈根大学) ETH Zürich(苏黎世联邦理工学院) University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 RAVENEA通过多模态检索增强方法提升视觉文化理解,验证了文化注释对多模态检索和下游任务的增强效果,并揭示了不同国家间性能差异。

Comments ICLR 2026; Project page: https://jiaangli.github.io/ravenea/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11960 2026-02-13 cs.CV cs.CL cs.LG 70%

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

对法语PDF到Markdown转换的视觉语言模型进行基准测试

Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

机构 * Probayes, La Poste(Probayes公司) OpenValue, La Poste(OpenValue公司)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本研究针对法语PDF到Markdown转换,评估了视觉语言模型在处理复杂文档中的表现,发现专有模型在手写和表单处理上更具鲁棒性,而开源系统在标准打印布局上表现良好。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05266 2026-02-03 cs.AR cs.CL cs.LG 70%

Understanding and Mitigating Errors of LLM-Generated RTL Code

理解并缓解LLM生成的RTL代码错误

Jiazheng Zhang, Cheng Liu, Long Cheng, Xiaowei Li, Huawei Li

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出基于LLM的框架,通过检索增强生成、规则检查、多模态转换和迭代仿真调试,显著提升了RTL代码生成的准确性。

Comments Accepted by IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19060 2026-01-28 cs.CV cs.AI 70%

Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models

基于像素的检索用于知识型大型多模态模型

Jeonghwan Kim, Renjie Tao, Sanat Sharma, Jiaqi Wang, Kai Sun, Zhaojiang Lin, Seungwhan Moon, Lambert Mathias, Anuj Kumar, Heng Ji, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 PixSearch是一种端到端的多模态模型,通过像素级检索和统一感知与推理,提升视觉问答任务中的事实一致性与泛化能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19670 2026-01-16 cs.CL 70%

CoSense-LLM: Semantics at the Edge with Cost- and Uncertainty-Aware Cloud-Edge Cooperation

CoSense-LLM:在成本和不确定性意识下实现边缘语义的云边协作

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 多模态RAG :RAG(abstract);hybrid retrieval(abstract);分类 cs.CL

AI总结 CoSense-LLM通过边缘优先设计,在成本和不确定性意识下实现云边协作,以提供紧凑的语义标记和隐私保护。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06235 2026-01-13 cs.SD cs.AI cs.HC 70%

An Intelligent AI glasses System with Multi-Agent Architecture for Real-Time Voice Processing and Task Execution

基于多智能体架构的智能AI眼镜系统:用于实时语音处理与任务执行

Sheng-Kai Chen, Jyh-Horng Wu, Ching-Yao Lin, Yen-Ting Lin

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出一种基于多智能体架构的AI眼镜系统,实现实时语音处理与多语言任务执行。

Comments Published in NCS 2025 (Paper No. N0180)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04297 2026-01-09 cs.LG cs.CV cs.HC cs.IR 70%

ArtCognition: A Multimodal AI Framework for Affective State Sensing from Visual and Kinematic Drawing Cues

ArtCognition:一种多模态AI框架,用于从视觉和运动学绘画线索中感知情绪状态

Behrad Binaei-Haghighi, Nafiseh Sadat Sajadi, Mehrad Liviyan, Reyhane Akhavan Kharazi, Fatemeh Amirkhani, Behnam Bahrak

机构 * Department of Electrical and Computer Engineering, University of Tehran(电信工程系,德黑兰理工大学) Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学) Department of Psychology, Allameh Tabataba’i University(心理学系,阿勒梅·塔巴塔比大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR

AI总结 ArtCognition通过融合视觉和运动学绘画线索,提供非侵入性情绪状态评估的新方法,验证了其在心理测量中的潜力。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01718 2026-01-06 cs.AI 70%

Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications

Yuan3.0 Flash:面向企业应用的开源多模态大语言模型

YuanLab. ai, :, Shawn Wu, Sean Wang, Louie Li, Darcy Chen, Allen Wang, Jiangang Luo, Xudong Zhao, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Danied Zhao, Penn Zheng, Owen Zhu, Tong Yu

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18177 2025-12-23 cs.AI cs.CV 70%

NEURO-GUARD: Neuro-Symbolic Generalization and Unbiased Adaptive Routing for Diagnostics -- Explainable Medical AI

NEURO-GUARD:神经符号泛化与无偏自适应路由用于诊断——可解释的医疗AI

Midhat Urooj, Ayan Banerjee, Sandeep Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 NEURO-GUARD通过整合视觉变换器与语言驱动推理,提升医疗图像诊断的准确性、透明性和泛化能力。

Comments Accepted at Asilomar Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01149 2025-12-17 cs.IR 70%

ModernVBERT: Towards Smaller Visual Document Retrievers

ModernVBERT: 向更小的视觉文档检索器迈进

Paul Teiletche, Quentin Macé, Max Conti, Antonio Loison, Gautier Viaud, Pierre Colombo, Manuel Faysse

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR

AI总结 ModernVBERT通过优化视觉文档检索模型,实现了在文档检索任务中性能优于更大模型的高效轻量级模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02530 2025-12-10 cs.AI 70%

Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration

Aetheria:基于多智能体辩论与协作的多模态可解释内容安全框架

Yuxiang He, Jian Zhao, Yuchen Yuan, Tianle Zhang, Wei Cai, Haojie Cheng, Ziyan Shi, Ming Zhu, Haichuan Tang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Sichuan University(四川大学) Peking University(北京大学) Beijing Jiaotong University(北京交通大学) Harbin Institute of Technology(哈尔滨工业大学) China Railway Rolling Stock Corporation Limited(中国铁路滚动股票有限公司)

专题命中 多模态RAG :RAG(abstract);knowledge retrieval(abstract);分类 cs.AI

AI总结 Aetheria通过多智能体辩论与协作机制,实现多模态内容安全的可解释性与高准确性,提升可信AI审查水平。

Comments https://github.com/Herrieson/Aetheria

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20965 2025-11-27 cs.CV cs.CL 70%

TrafficLens: Multi-Camera Traffic Video Analysis Using LLMs

TrafficLens: 多摄像头交通视频分析使用LLMs

Md Adnan Arefeen, Biplob Debnath, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美国实验室) University of Missouri–Kansas City (UMKC)(密苏里大学-堪萨斯城分校)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 TrafficLens通过利用多摄像头重叠区域和对象相似性检测,高效地将视频转换为文本,减少处理时间并提升交通视频分析效率。

Comments 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02966 2025-11-26 cs.CV cs.AI 70%

KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models

KEPT: 基于视觉-语言模型的连续驾驶帧轨迹预测增强方法

Yujin Wang, Tianyi Wang, Quanfeng Liu, Wenxian Fan, Junfeng Jiao, Christian Claudel, Yunbing Yan, Bingzhao Gao, Jianqiang Wang, Hong Chen

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 KEPT 通过知识增强的视觉-语言模型,利用时间频率-空间融合编码器和检索增强生成流水线,提升自动驾驶中轨迹预测的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01892 2025-11-05 cs.LG cs.CL 70%

Retrieval-Augmented Multimodal Depression Detection

Ruibo Hou, Shiyu Teng, Jiaqing Liu, Shurong Chai, Yinhao Li, Lanfen Lin, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(信息科学与工程学院,立命馆大学) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments Accepted in IEEE EMBC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏