CLIPAG: Towards Generator-Free Text-to-Image Generation
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted for publication by ICCV 2023
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments International Conference on Learning Representations (ICLR'23), Code:https://bit.ly/3Xd9gRQ
专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.CV、cs.LG
Comments Accepted by the Special Issue on Human-Centered Explainable AI, ACM Transactions on Interactive Intelligent Systems
专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments This work has been accepted by IEEE T-PAMI. Copyright is transferred without notice, after which this version may no longer be accessible
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI
Comments Paper accepted at the CoNLL 2021 conference. This version: section added on the performance of the visual and visio-linguistic models on linquistic tasks
专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments In EMNLP Findings
专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2020 Spotlight paper
专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.AI
TMF-RSE:用于肺部严重程度评分的具有区域语义和证据不确定性的三模态融合
机构 * Institute of Applied Sciences and Intelligent Systems (ISASI), CNR(应用科学与智能系统研究所(ISASI),CNR) ; Department of Computer Science and Artificial Intelligence, University of the Basque Country (UPV/EHU)(巴斯克国家大学计算机科学与人工智能系) ; University of Salento(萨莱nton大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV;VLM(comments)
AI总结 针对从胸部影像量化肺部疾病严重程度的问题,提出TMF-RSE框架,结合多模态特征,采用互补融合机制和证据回归,在相关数据集实验中性能优于基于Transformer的基线。
Comments 6 pages, 2 figures, 5 tables. IEEE conference format (IEEEtran). Submitted to AVSS 2026. Tri-modal fusion for lung severity scoring using appearance, segmentation, and VLM semantics with evidential uncertainty
机构 * New York University(纽约大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV;MLLM(comments)
Comments Project page: https://cambrian-mllm.github.io
机构 * MICS, CentraleSupélec - Université Paris-Saclay, France(MICS,中央圣艾尔布兰大学-巴黎萨克雷大学,法国) ; Google DeepMind, London, UK(谷歌DeepMind,伦敦,英国) ; CONICET, Universidad de Buenos Aires, Argentina(CONICET,布宜诺斯艾利斯大学,阿根廷)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV;multimodal large language model(comments)
Comments Accepted to MICCAI 2025 1st Workshop on Multimodal Large Language Models (MLLMs) in Clinical Practice
专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV;LLaVA(comments)
Comments To appear at NeurIPS 2024. Code is available at https://github.com/xing0047/cca-llava
专题命中 幻觉与鲁棒性 :VLM(abstract,comments);分类 cs.CV
Comments All code and dataset is available at: https://tinyurl.com/vlm-robustness. Accepted in CVPRW 2024
CLAIR-Fin:用于跨模态金融问答中声明级验证与自适应辩论的对抗性多智能体框架
机构 * Ahsanullah University of Science and Technology(阿萨努拉科技大学) ; Jashore University of Science and Technology(杰索尔科技大学) ; American International University - Bangladesh(孟加拉国美国国际大学)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 本研究提出CLAIR-Fin九智能体框架,针对跨模态金融问答的声明级验证与自适应辩论,在BB-FinQA-X数据集上提升了模型忠实度,且弃权比例合理,优于相关基线方法。
用于可靠企业级文本到SQL的有界语义规划与确定性编译
专题命中 幻觉与鲁棒性 :grounding(abstract_cn);分类 cs.AI
AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。
Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript
具有增强对抗样本迁移性的视角不变攻击
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对对抗样本跨模型迁移性带来的安全威胁,提出视角不变攻击(PIA)及其扩展PIA-Mix,通过多自由度顶点采样策略提升对抗样本迁移性,实验显示其性能优于当前最优基于迁移的攻击方法。
Journal ref IEEE Transactions on Information Forensics and Security, vol. 21, pp. 6818-6831, 2026
DR.GAP:采用解耦推理的性别感知提示缓解大语言模型中的偏见
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI
AI总结 该研究针对大语言模型的性别偏见问题,提出DR.GAP方法,通过生成无性别推理轨迹作为上下文示例,在不修改模型参数的情况下缓解偏见,且可扩展至视觉语言模型,经多任务多模型实验验证有效。
PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化
机构 * Shanghai University(上海大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。
代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。
Comments 27 pages, 5 figures, 15 tables
智能体安全应成为运行时契约
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
自我进化临床系统之路:将医疗智能体从辅助扩展到自主
机构 * Hunan University(湖南大学) ; ByteDance(字节跳动) ; Duke University(杜克大学) ; Westlake University(西湖大学) ; The University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Macau(澳门大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI
AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。
Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents
基于智能体AI、嵌套学习与语义缓存的幻觉缓解与AI可持续性
机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据) ; Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 提出一种HOPE启发的嵌套学习架构,结合连续记忆系统和语义缓存,通过三阶段智能体管道在混合基准上实现幻觉缓解,同时降低能耗并提高可观测性。
Comments 33 pages, 9 figures
重新思考大语言模型验证:证据结构、不确定性与选择性优化
机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) ; Microsoft Research(微软研究院) ; SCB Dental College and Hospital(SCB牙科学院与医院)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV
AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。
Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)
SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。
FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索
机构 * Vietnamese-German University(越南-德国大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology(信息技术大学) ; Ho Chi Minh city University of Science(胡志明市科学大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。
Comments accepted to the ECCV 2026 AI City Challenge Workshop