How Does India Cook Biryani?
印度是如何烹饪饭团的?
机构 * IIIT Hyderabad
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
印度是如何烹饪饭团的?
机构 * IIIT Hyderabad
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。
自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成
机构 * Department of Computer Science(计算机科学系) ; VIT-AP University(VIT-AP大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。
Comments 13 figures, 3 tables
连续学习用于从大语言模型中建模低资源语言
机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Sciences, Pilani, India(机器智能组,计算机科学与信息系,比拉理工学院和科学学院,印度帕利尼)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
AI总结 本文提出利用基于词性的代码切换和重放适配器策略,解决从大语言模型构建小语言模型时的灾难性遗忘问题,并在视觉语言任务中验证了方法的有效性。
VNU-Bench:多源多模态新闻视频理解的基准数据集
机构 * University of Florida(佛罗里达大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.LG
AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。
通过大型语言模型理解多智能体推理用于漫画视觉问答
机构 * University of Reading(阅读大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。
EarthVL: 一种渐进式地球视觉-语言理解和生成框架
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 EarthVL提出一种渐进式视觉-语言框架,通过多任务数据集和语义引导网络提升城市规划中的遥感目标识别与问答性能。
从提示本身学习:层次归因提示优化
专题命中 视觉问答 :MLLM(abstract);分类 cs.AI
AI总结 HAPO框架通过动态归因机制、语义单元优化和多模态支持,提升提示优化效率,适用于多任务场景。
CTIS-QA:基于临床模板的滑动切片级问题回答用于病理学
机构 * School of Biological Science(生物科学学院) ; Medical Engineering Beihang University Beijing, China(医学工程北京航空航天大学北京中国) ; ByteDance Inc.(字节跳动公司)
专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV
AI总结 CTIS-QA通过双流架构实现滑动切片级问题回答,结合临床模板和视觉-语言对齐,提升病理诊断准确性。
Comments The paper has been accepted by BIBM 2025
UNIDOC-BENCH: 一个统一的文档中心多模态RAG基准
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 UniDoc-Bench是首个大规模文档中心多模态RAG基准,通过多模态问答对评估文本-图像融合与联合检索性能,揭示多模态嵌入不足及视觉上下文补充机制。
CPJ: 通过基于提示-判断的图像描述实现可解释的农业害虫诊断
机构 * Business School, Shandong University of Technology, Shandong, China(山东科技大学商学院) ; Institute of International Language Services Studies, Macau Millennium College, Macau SAR, China(国际语言服务研究所,澳门 Millennium 学院)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 CPJ通过基于提示-判断的图像描述实现可解释的农业害虫诊断,无需训练即可提升诊断性能。
Comments This paper is 6 pages in length and contains 2 figures. Tao Fang (Corresponding Author), Lina Lu (Co-corresponding Author)
通过检索增强的大语言模型中的原子事实核查来提高医疗问答的可靠性与可解释性
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 通过原子事实核查提升医疗问答的可靠性与可解释性,减少幻觉并提高事实准确性。
Comments 18 pages, 7 figures and tables
Chrono: 一种用于多模态大语言模型中表示时间的简单蓝图
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
AI总结 Chrono提出了一种简单通用的序列蓝图,用于提升多模态大语言模型在视频时间定位和 grounded 视频问答任务中的性能。
Comments Code: https://github.com/sudo-Boris/mr-Blip. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Under review
通过扩散排名进行3D描述生成的视图选择
机构 * University of Michigan LG AI Research(密歇根大学LG人工智能研究)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出DiffuRank方法,通过评估3D物体与2D视图的对齐度,提升3D描述生成的准确性与细节,同时扩展数据集规模并优于CLIP模型。
Comments Dataset link: https://huggingface.co/datasets/tiange/Cap3D
OpenView: 通过视图外视觉问答增强大规模语言模型
机构 * Monash University(墨尔本大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 OpenView通过全景图像生成多选VQA,提升大规模语言模型在视图外视觉问答任务中的性能。
Comments Code: https://github.com/q1xiangchen/OpenView
Null-LoRA: 在空域上进行低秩适应
机构 * School of Computer Science(计算机科学学院) ; Engineering, Sun Yat-sen University, Guangdong, China(工程学院,中山大学,广东,中国)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 Null-LoRA通过在空域上进行低秩适应,提升参数效率和模型效果,在图像-文本检索和视觉问答任务中取得最优表现。
MMDrive: 通过多表示融合超越视觉的交互场景理解
机构 * organization= College of Computer Science ; Technology, Jilin University , city= Changchun , country= China ; organization= Georgia Institute of Technology , city= Atlanta , country= USA ; organization= Qingdao Institute of Software, College of Computer Science ; Technology, China University of Petroleum (East China) , city= Qingdao , country= China ; organization= Institute for Math \& AI, Wuhan University , city= Wuhan , country= China ; organization= University of Michigan, Ann Arbor , country= USA ; organization= Thrust of Artificial Intelligence, Hong Kong University of Science ; organization= School of Artificial Intelligence ; Computer Science, Nantong University , city= Nantong , country= China
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 MMDrive通过融合占用图、LiDAR点云和文本描述,实现超越视觉的三维场景理解,提升自动驾驶的多模态推理能力。
Ego-EXTRA:视频语言眼动数据集用于专家-学员协助
机构 * Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学) ; Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构) ; Meta Reality Labs Research(Meta现实实验室)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 Ego-EXTRA数据集通过专家-学员双向对话评估多模态大语言模型,揭示其在专家级帮助中的局限性。
混合检索增强生成用于鲁棒多语言文档问答
机构 * Univ Rennes, CNRS, IRISA - UMR 6074(里昂大学、法国国家科学研究中心、IRISA - UMR 6074) ; L3i-lab, La Rochelle Université(L3i实验室、拉罗谢尔大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 本文提出混合检索增强生成方法,用于在嘈杂的历史文档中实现鲁棒的多语言问答,通过语义查询扩展、生成提示优化和模块化架构提升检索鲁棒性和问答准确性。
Comments Preprint
在化学表格上评估多模态大语言模型的基准测试
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学) ; Artificial Intelligence Research Institute(人工智能研究院) ; iFLYTEK Co., Ltd(iFLYTEK公司)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出ChemTable基准,用于评估多模态模型在理解化学表格中的能力,揭示了现有模型在跨模态对齐和领域推理方面的不足。
Descrip3D: 通过物体级文本描述增强基于大语言模型的3D场景理解
机构 * University of Southern California(南加州大学) ; DEVCOM Army Research Laboratory(国防部陆军研究实验室)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 Descrip3D通过引入物体级文本描述,提升大语言模型在3D场景理解中的关系推理能力,有效增强复杂室内场景的语义理解。
BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶
机构 * UC San Diego(加州大学圣地亚哥分校) ; Robert Bosch Corporate Research India(博世印度公司研究)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。
优化医疗问答系统:基于RAG框架的微调与零样本大语言模型比较研究
机构 * Department of Electrical Engineering ; Computer Science University of Toledo Toledo, USA ; Institute of Mathematical Sciences Claremont Graduate University Claremont, USA ; Department of Bioengineering University of Toledo Toledo, USA ; Department of Computer Science Bowling Green State University Bowling Green, USA
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文通过RAG框架结合微调与零样本大语言模型,提升医疗问答系统的准确性与可靠性,实验证明检索增强显著提高回答质量。
RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; Xiaohongshu Inc.(小红书公司) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI
AI总结 RAG-IGBench通过创新的评估指标和多模态数据,评估基于检索增强生成的交错生成任务,验证了模型在开放领域问答中的性能提升。
Comments 26 pages, 6 figures, NeurIPS 2025 D&B Track poster
偏见超越人口统计:通过反事实视觉问答探测黑盒大视觉-语言模型的决策边界
机构 * The University of Tokyo(东京大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 本文通过反事实VQA基准探测黑盒LVLMs的决策边界,揭示非人口属性对决策的更大影响,并展示人类规范验证示例对提升模型响应一致性和公平性的作用。
释放小时级视频训练以实现长视频-语言理解
专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV
AI总结 本文提出VideoMarathon数据集和Hour-LLaVA模型,通过小时级视频训练提升长视频-语言理解能力。
Comments NeurIPS 2025, Project page: https://videomarathon.github.io/
Hybrid-DMKG: 一种基于动态多模态知识图谱的混合推理框架用于多模态多跳问答与知识编辑
专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI
AI总结 Hybrid-DMKG通过动态多模态知识图谱实现多跳问答中的准确推理,提升对知识更新的鲁棒性。
Comments Accepted by AAAI 2026
MoLT:基于层级令牌的高效音频视觉学习
机构 * KAIST(韩国科学技术院) ; Sejong University(世宗大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 MoLT通过层级令牌融合提升音频视觉学习效率,采用轻量适应策略和正交正则化,优于现有方法。
Comments 10 pages, 5 figures
TinyRS-R1:用于遥感的紧凑多模态语言模型
机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 TinyRS-R1是一种专为遥感设计的紧凑多模态语言模型,通过四阶段训练实现高效性能,兼具推理增强与低资源消耗。
Comments Accepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS
SFA: 扫描、聚焦与放大以实现面向指导的视频文本VQA回答
机构 * Department of Computing and Mathematics, Manchester Metropolitan University(计算与数学系、曼彻斯特 Metropolitan 大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 SFA通过扫描、聚焦与放大机制,提出首个Video-LLM方法,提升视频文本VQA任务的准确性和泛化能力。
通过LLM规划和嵌入引导搜索实现高效的多跳知识图谱问答
机构 * Department of Computer Science, Drexel University, Philadelphia, PA, USA(计算机科学系,德雷塞尔大学,费城,宾夕法尼亚州,美国)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出两种混合算法,通过LLM规划和嵌入引导搜索实现高效且可验证的多跳知识图谱问答,提升推理效率与准确性。