Large Language Models for Assisting American College Applications
大型语言模型用于协助美国大学申请
专题命中 视觉问答 :grounding(abstract)
AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
大型语言模型用于协助美国大学申请
专题命中 视觉问答 :grounding(abstract)
AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。
评估用于RAG的提示工程技术在小型语言模型中的表现:一种多跳问答方法
专题命中 视觉问答 :grounding(abstract)
AI总结 本文通过评估24种提示模板,发现优化RAG在小型语言模型上的表现提升显著,为资源受限环境下的RAG系统提供实用建议。
Comments 32 Pages, Submitted to Journal of Computing and Security
ReFilter:通过门控过滤提升检索增强生成的鲁棒性
机构 * City University of Hong Kong(香港城市大学) ; University of Waterloo(滑铁卢大学)
专题命中 视觉问答 :grounding(abstract)
AI总结 ReFilter通过门控过滤提升检索增强生成的鲁棒性,实现跨领域问答任务的高性能表现。
ADCanvas: 为视障和低视力创作者提供可访问且对话式的音频描述创作工具
专题命中 视觉问答 :visual question answering(abstract)
AI总结 ADCanvas为视障和低视力创作者提供可访问且对话式的音频描述创作工具,通过多模态交互支持端到端的AD创作和视觉问答。
Comments 21 pages, 4 figures, published in CHI '26
Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain
信念更新与委托在多任务人机交互中的作用:来自受控模拟的证据
专题命中 视觉问答 :visual question answering(abstract)
AI总结 研究发现用户在多任务人机交互中形成路径依赖的期望,保守更新信念,并基于主观信念而非客观性能决定对AI的依赖。
图像胜过言语吗?探讨文本误导在VLMs中的影响
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Pennsylvania State University(宾夕法尼亚州立大学) ; New York University(纽约大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; AG2ai, Inc.(AG2ai公司)
专题命中 视觉问答 :vision-language model(abstract)
AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。
Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)
CCFQA:跨语言和跨模态语音与文本事实性评估基准
专题命中 视觉问答 :multimodal large language model(abstract)
AI总结 CCFQA是一个用于评估多模态大语言模型跨语言和跨模态事实性能力的基准,通过少样本迁移学习策略在多语言语音问答任务中取得与GPT-4o-mini-Audio相当的性能。
Comments Accepted in AAAI 2026
DF-RAG:基于查询的多样性检索增强生成
机构 * George Mason University(乔治·马歇尔大学) ; Capital One
专题命中 视觉问答 :grounding(abstract)
AI总结 DF-RAG通过在检索阶段引入多样性,提升复杂推理问答任务的F1性能,相比传统RAG提升了4-10个百分点,并接近Oracle上限的91.3%
Comments Accepted to Findings of EACL 2026
澄清或回答:基于上下文不充分的代理视觉问答强化学习
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
专题命中 视觉问答 :visual question answering(abstract)
AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。
DomainCQA: 从领域特定图表中构建知识密集型问答
专题命中 视觉问答 :multimodal large language model(abstract)
AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。
Comments 83 pages, 59 figures
通过变分推断改进音频问答
机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) ; École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)
专题命中 视觉问答 :multimodal large language model(abstract)
AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。
Comments ICASSP 2026
Qwen3-VL-Embedding 和 Qwen3-VL-Reranker:面向最新多模态检索与排序的统一框架
专题命中 视觉问答 :visual question answering(abstract)
AI总结 Qwen3-VL-Embedding和Qwen3-VL-Reranker通过统一框架实现多模态检索与排序的高精度性能。
用于解释大语言模型 verbalized 自信心的有影响力训练数据检索
机构 * Faculty of Computer Science, University of Vienna, Vienna, Austria(维也纳大学计算机科学系) ; UniVie Doctoral School Computer Science, Vienna, Austria(UniVie计算机科学博士学院) ; Faculty of Philological and Cultural Studies, University of Vienna, Vienna, Austria(维也纳大学语言与文化研究系)
专题命中 视觉问答 :grounding(abstract)
AI总结 TracVC通过追踪训练数据来解释LLMs表达自信心的来源,揭示了模型可能依赖无关数据模仿自信,而非真实内容基础。
一种实时系统用于从新闻中填写FRA表单57
专题命中 视觉问答 :vision language model(abstract)
AI总结 本文提出了一种实时系统,通过从新闻中提取信息来自动填写FRA表单57,解决了表单复杂性和新闻噪声问题。
Comments to be published in WSDM 2026 Demonstration
通过知识图谱增强下一代语言模型:通过KG-BERT扩展Claude、Mistral IA和GPT-4
机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) ; National Engineering School of Tunis(突尼斯国家工程学院) ; Faculty of Sciences of Tunis(突尼斯科学学院)
专题命中 视觉问答 :grounding(abstract)
AI总结 通过KG-BERT将知识图谱与Claude、Mistral IA和GPT-4结合,提升其事实可靠性与上下文感知能力。
Comments This paper was accepted and scheduled for inclusion in the ICALT 2025 proceedings but was ultimately not published due to absence from the conference presentation. It appears in the official program booklet. Conference: 2025 IEEE International Conference on Advanced Learning Technologies (ICALT)
通过强化学习提升短篇和长篇问答的可靠性
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)
专题命中 视觉问答 :grounding(abstract)
AI总结 本研究通过强化学习框架减少短篇和长篇问答中的幻觉问题,提升模型可靠性与事实可信度。
通过伪正样本进行相似性标准化以弥合模态差距
机构 * Mitsubishi Electric Corporation(三菱电机公司)
专题命中 视觉问答 :vision-language model(abstract)
AI总结 通过伪正样本进行相似性标准化,有效弥合跨模态检索中的模态差距,提升检索性能。
Comments Accepted to PACLIC2025
Chatty-KG:一种用于基于知识图谱的按需对话问答的多智能体AI系统
机构 * Concordia University(康科德大学) ; IBM Research(IBM研究院)
专题命中 视觉问答 :grounding(abstract)
AI总结 Chatty-KG通过多智能体系统实现基于知识图谱的对话问答,结合RAG检索与结构化执行,提升多轮问答的准确性和效率。
Comments This paper is accepted to SIGMOD 2026
HKRAG:面向视觉丰富文档的综合知识检索增强生成
专题命中 视觉问答 :visual question answering(abstract)
AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。
更多偏见,更少偏见:用于增强多项选择题回答的BiasPrompting
机构 * Nanyang Techonological University(南洋理工大学) ; National University of Singapore(国立新加坡大学) ; Centre for AI research, VinUniversity(Vin大学人工智能研究中心)
专题命中 视觉问答 :grounding(abstract)
AI总结 BiasPrompting通过引导LLMs生成并评估所有可能答案的推理过程,提升多项选择题回答的推理能力,尤其在复杂问题中表现优异。
Comments Accepted at the 41st ACM/SIGAPP Symposium On Applied Computing (SAC 2026), Main Conference
专题命中 视觉问答 :multimodal large language model(abstract)
Comments preprint
机构 * Shandong University(山东大学) ; University of Western Ontario(西方大学) ; Dalhousie University(达尔豪斯大学) ; University of Toronto(多伦多大学)
专题命中 视觉问答 :grounding(abstract)
Comments accepted to EMNLP 2025
机构 * Chongqing University(重庆大学) ; Independent Researcher(独立研究者) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)
专题命中 视觉问答 :multimodal large language model(abstract)
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 视觉问答 :multimodal large language model(abstract)
专题命中 视觉问答 :vision-language model(abstract)
Comments Comments: Update Title, Author, Abstract, etc
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)
专题命中 视觉问答 :vision-language model(abstract)
Comments 21 pages. Code: https://github.com/kimihiroh/tama
机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格普尔) ; Panjab University, Chandigarh(旁遮普大学,昌迪加尔)
专题命中 视觉问答 :multimodal large language model(abstract)
Comments EMNLP 2025 (Main)
机构 * Research and Development Group, Hitachi, Ltd.(日立株式会社研发部)
专题命中 视觉问答 :visual question answering(abstract)
机构 * Columbia University(哥伦比亚大学)
专题命中 视觉问答 :grounding(abstract)
Comments Accepted in EMNLP 2025 Findings
机构 * Amsterdam UMC, Department of Medical Informatics(阿姆斯特丹大学医学中心,医学信息学系) ; Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) ; Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML)) ; Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学)
专题命中 视觉问答 :grounding(abstract)
Comments Accepted to EMNLP 2025 (Main Conference)