Multi-Sourced, Multi-Agent Evidence Retrieval for Fact-Checking
多源多智能体证据检索用于事实核查
机构 * The University of Melbourne(墨尔本大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 WKGFC通过多智能体证据检索和知识图谱增强,提升事实核查的准确性和鲁棒性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
多源多智能体证据检索用于事实核查
机构 * The University of Melbourne(墨尔本大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 WKGFC通过多智能体证据检索和知识图谱增强,提升事实核查的准确性和鲁棒性。
通过扩散映射的测地原型匹配用于可解释的细粒度识别
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Zhejiang University(浙江大学) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出通过扩散映射的测地原型匹配方法,用于可解释的细粒度识别,通过内在几何结构提升原型的语义对应性。
Comments The paper has been accepted by ICASSP 2026
FiLo++: 通过融合细粒度描述和变形定位实现零/少样本异常检测
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) ; School of Artifcial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Wuhan AI Research(武汉AI研究所) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Intellectual Property & Big Data, Guangdong Polytechnic Normal University(广东省知识产权与大数据重点实验室,广东工业大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 FiLo++通过融合细粒度描述和变形定位技术,提升零/少样本异常检测的准确性和鲁棒性。
BiCLIP: 用于鲁棒医学图像分割的双向和一致语言-图像处理
机构 * Department of Computer Engineering, University of Kurdistan, Iran(伊朗库尔德大学计算机工程系) ; Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(伊拉克埃尔比尔库尔德大学人工智能与创新中心) ; College of Information Technology, United Arab Emirates University, UAE(阿联酋大学信息科技学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 BiCLIP通过双向多模态融合和一致性目标提升医学图像分割的鲁棒性,有效应对标注稀少和临床伪影挑战。
案件 profiling 与个案证据:一种概率分析
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文通过概率分析探讨了 profiling 证据与个案证据的区别,指出 profiling 证据不能直接证明被告具体罪行,挑战了其在刑事审判中的有效性。
Comments 16 pages
长上下文强化学习需要可验证的上下文奖励
机构 * National University of Singapore(国立新加坡大学) ; MiroMind AI ; absolute AI
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 LongRLVR通过引入可验证的上下文奖励,解决长上下文强化学习中因稀疏奖励导致的梯度消失问题,显著提升大语言模型的推理能力。
Comments ICLR 2026
隐性角色游戏:均衡概念与计算
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出隐性角色游戏的均衡定义,揭示其计算复杂性,并通过实验验证了在大规模实例中的计算可行性。
面向客户端开发的生产级AI编码系统
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出了一种面向客户端开发的生产级AI编码系统,通过结构化多阶段流程整合Figma设计、PRD和领域知识,提升代码生成与产品需求的对齐性。
Comments 18 pages, 2 figures
LaSTR:基于语言的时间序列片段检索
机构 * Research(研究) ; Development Group, Hitachi, Ltd.(日立有限公司研发小组)
专题命中 视觉定位与Grounding :VLM(abstract)
AI总结 LaSTR通过结合语言描述和时间序列数据,实现了高效的时间序列片段检索,提升了检索质量和语义一致性。
从文献到假设:一种用于生物标志物引导的药物组合假设生成的AI合作者系统
机构 * Peter L. Reichertz Institute for Medical Informatics (PLRI), Hannover Medical School(汉诺威医学院彼得·L·里赫茨医学信息学研究所) ; Lower Saxony Center for Artificial Intelligence and Causal Methods in Medicine (CAIMed)(下萨克森医学人工智能与因果方法中心) ; Sanford Burnham Prebys (SBP) Medical Discovery Institute, San Diego(圣地亚哥桑福尔德·伯恩斯医学发现研究所)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出 AI 合作者系统 CoDHy,通过整合生物医学知识图谱和文献证据,实现基于生物标志物的药物组合假设生成与验证。
视觉标记究竟编码了什么?揭示多模态大语言模型中的稀疏性与冗余性
机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 文档图表理解 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本研究揭示多模态大语言模型中视觉标记的稀疏性与冗余性,通过EmbedLens工具发现活跃标记在进入模型前已编码细粒度信息,并提出中层注入方法提升效率。
Comments Accepted by CVPR2026
FireRed-OCR 技术报告
机构 * Super Intelligence Team(超级智能团队) ; Xiaohongshu Inc(小红书公司)
专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 FireRed-OCR 通过三阶段渐进训练策略,将通用 VLM 转化为高精度结构文档解析专家,实现 OCR 领域的突破性性能。
VisJudge-Bench: 可视化美学与质量评估
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; DeepWisdom(深智科技) ; Université de Montréal & Mila(蒙特利尔大学及Mila)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 VisJudge-Bench提出首个可视化质量评估基准,通过VisJudge模型显著提升对可视化美学和质量的判断精度。
Comments 62 pages, 27 figures, 8 tables. Accepted at ICLR 2026
代理的原子性:揭示、利用和缓解浏览器使用代理中的TOCTOU漏洞
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI
AI总结 本文研究了浏览器使用代理中的TOCTOU漏洞,通过实证研究揭示其普遍存在性,并提出基于预执行验证的轻量级缓解方法。
Interaction2Code: 基于MLLM的交互式网页代码生成基准测试
机构 * The Chinese University of Hong Kong, China(香港中文大学) ; Singapore Management University, Singapore(新加坡管理学院) ; Renmin University of China, China(中国人民大学) ; Tsinghua University, China(清华大学) ; Southwest University, China(西南大学)
专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 Interaction2Code提出首个基于MLLM的交互式网页代码生成基准测试,识别MLLM在交互生成中的四个限制并提出四种增强策略。
Comments Published in the Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)
SSMG-Nav: 通过语义骨架记忆图增强终身物体导航
机构 * Brain-Inspired Application Technology Center (BATC), Shanghai Jiao Tong University(脑启发应用技术中心(BATC),上海交通大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 SSMG-Nav通过语义骨架记忆图提升终身物体导航,整合多模态信息与持久记忆,优化路径效率与任务成功率。
Comments Accepted by 2026 ICRA
DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作
机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) ; Samsung AI Center, DS Division(三星人工智能中心,DS部门) ; Hanyang University ERICA(翰洋大学ERICA)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。
Comments Accepted to ICRA2026
通过无训练KV缓存压缩实现高效的长周期GUI代理
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。
神经符号技能发现用于条件多级规划
机构 * Department of Computer Science and Technology The University of Cambridge(计算机科学与技术系 剑桥大学) ; Department of Computer Engineering Bogazici University(计算机工程系 boazici大学) ; SISREC Osaka University(Osaka大学SISREC)
专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种神经符号学习架构,通过少量演示获取可推广的高级符号技能,并在多级规划中实现复杂任务的执行。
Comments 18 pages, 4 figures
LAD-Drive: 通过动作感知扩散变换器弥合语言与轨迹
机构 * Institute for Intelligent Systems, Esslingen University of Applied Sciences(智能系统研究所,埃斯林根应用科学大学) ; Department of Computer Science, University of Freiburg(计算机科学系,弗赖堡大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 LAD-Drive通过动作感知扩散变换器,将语言模型的意图与连续轨迹生成结合,提升自动驾驶中的多模态规划能力。
公平在心,公平在行?一个用于理解与生成的同步基准:UMLLMs的公平性评估
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; The Chinese University of Hong Kong(香港中文大学) ; School of Software Technology, Zhejiang University(浙江大学软件学院) ; Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) ; Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 IRIS基准通过同步评估UMLLMs的理解与生成任务公平性,揭示系统性偏见现象并提供公平性优化指导。
Comments Accepted to ICLR 2026
M$^2$: 通过轨迹摘要和洞察检索实现长 horizon 网络代理的双记忆增强
机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学) ; AI Business, Alibaba Group, Hangzhou, China(阿里云人工智能业务) ; Xi'an University of Architecture(西安建筑科技大学) ; Zhejiang University, Hangzhou, China(浙江大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 M$^2$通过双记忆机制提升长 horizon 网络代理的上下文效率和决策鲁棒性,实现更高成功率和更低计算成本。
ViTSP:一种由视觉语言模型引导的解决大规模旅行商问题的框架
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.AI
AI总结 ViTSP利用预训练视觉语言模型指导大规模TSP求解,通过识别子问题提升全局解的质量,实验表明其在大规模实例上优于现有方法。
MVR:多视图视频奖励塑造用于强化学习
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。
Comments ICLR 2026
语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。
Comments 8 pages, 2 figures, 3 tables. Includes link to code
BioCAP: 利用合成描述性注释超越标签在生物基础模型中的应用
机构 * The Ohio State University(俄亥俄州立大学) ; Duke University(杜克大学) ; Boston University(波士顿大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 BioCAP通过生成合成描述性注释提升生物基础模型的性能,实现物种分类和文本-图像检索的高准确率。
Comments ICLR 2026; Project page: https://imageomics.github.io/biocap/
CaptionFool: 针对最新Transformer图像描述模型的通用图像描述模型攻击
机构 * Intuit
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 CaptionFool通过修改少量图像块,成功生成任意目标描述,揭示了视觉-语言模型的安全漏洞。
衡量VLMs不表达的内容:验证指标隐藏了放射学报告生成中的临床术语擦除
机构 * DTU Compute, Technical University of Denmark(丹麦技术大学计算机学院)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI
AI总结 本文提出临床关联位移(CAD)和加权关联擦除(WAE)指标,用于评估放射学报告生成中临床术语的保留情况,揭示当前验证指标在临床术语擦除方面的不足。
Comments This is an extended version of a manuscript currently under review
稀疏视角无干扰高斯点云法
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; University of Macau(澳门大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出一种基于先验信息的框架,用于提升稀疏视角下无干扰3DGS的性能,通过几何模型和视觉-语言模型增强训练效果。
大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。