arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-16 至 2026-03-16 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2603.12746 2026-03-16 cs.CV 85%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 75%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00150 2026-03-16 cs.CV cs.AI cs.CE cs.MM 62%

FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications

FCMBench: 首个大规模金融信用多模态基准用于实际应用

Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(奇富科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FCMBench是首个大规模且隐私合规的多模态基准,涵盖金融信用应用中的任务和鲁棒性挑战,包含26种证书类型、5198张隐私合规图像和13806对VQA样本,评估模型在现实干扰下的感知与推理任务,揭示现代视觉语言模型的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18507 2026-03-16 cs.CV cs.AI 62%

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

多场景视角下的多模态持续学习与MLLMs

Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNIFIER框架,通过视觉表征扩展和视觉一致性约束解决多场景下的持续学习问题,提升跨场景视觉问答和F1分数。

Comments 22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 13 篇

2603.05869 2026-03-16 cs.CV 85%

PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues

PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理

Yukun Qi, Pei Fu, Hang Li, Yuhan Liu, Chao Jiang, Bin Qin, Zhenbo Luo, Jian Luan

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12669 2026-03-16 cs.CV cs.LG 84%

Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning

视觉验证增强的VLMs融合以实现高效的视觉推理

Selim Furkan Tekin, Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Margaret L. Loper, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出V3Fusion方法,通过融合多种视觉语言模型,利用焦点误差多样性与CKA-focal度量来提升视觉推理性能,实验显示在多个基准上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 81%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 81%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08820 2026-03-16 cs.CV 74%

Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing

Omni-Video 2:基于MLLM条件扩散模型的统一视频生成与编辑扩展

Hao Yang, Zhiyu Tan, Jia Gong, Luozheng Qin, Hesen Chen, Xiaomeng Yang, Yuqing Sun, Yuetan Lin, Mengping Yang, Hao Li

专题命中 视觉推理 :MLLM(title);分类 cs.CV

AI总结 本文提出Omni-Video 2,通过连接预训练多模态大语言模型与视频扩散模型,实现视频生成与编辑的统一。核心方法是利用MLLM生成明确的目标描述以指导生成过程,并通过轻量适配器高效注入多模态条件token,提升复杂编辑任务性能。

Comments Technical Report, Project: https://howellyoung-s.github.io/Omni-Video2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12597 2026-03-16 cs.LG cs.AI cs.HC cs.MA cs.SE 73%

Feynman: Knowledge-Infused Diagramming Agent for Scalable Visual Designs

Feynman: 一种融合知识的图表生成代理,用于可扩展的视觉设计

Zixin Wen, Yifu Cai, Kyle Lee, Sam Estep, Josh Sunshine, Aarti Singh, Yuejie Chi, Wode Ni

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Feynman代理,通过知识组件枚举和代码规划生成高质量图表-描述对,构建了可扩展的图表生成流水线,并创建了视觉语言基准Diagramma。

Comments A previous version was submitted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI 73%

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12225 2026-03-16 cs.CV cs.LG 73%

HoneyBee: Data Recipes for Vision-Language Reasoners

HoneyBee: 用于视觉-语言推理器的数据食谱

Hritik Bansal, Devendra Singh Sachan, Kai-Wei Chang, Aditya Grover, Gargi Ghosh, Wen-tau Yih, Ramakanth Pasunuru

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出HoneyBee数据集,通过数据整理方法提升视觉-语言推理能力,发现上下文来源策略和数据干预显著提升性能,并提出测试时缩放策略以降低解码成本。

Comments 32 pages. Accepted to CVPR 2026 in Denver, Colorado, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13100 2026-03-16 cs.RO cs.AI 70%

Evaluating VLMs' Spatial Reasoning Over Robot Motion: A Step Towards Robot Planning with Motion Preferences

评估VLMs在机器人运动中的空间推理能力:迈向具有运动偏好的机器人规划的一步

Wenxi Wu, Jingjing Zhang, Martim Brandão

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文评估了四种先进VLMs在机器人运动中的空间推理能力,探讨了运动偏好(如物体接近性和路径风格)的处理,并分析了准确率与计算成本的权衡。

Comments Accepted to the First Workshop on Efficient Spatial Reasoning at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12430 2026-03-16 cs.CV 70%

Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation

Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证

Jian Jiang, Chenxi Lin, Yiming Gu, Zengyi Qin, Zhitao Zeng, Kun Yuan, Yonghao Long, Xiang Xia, Cheng Yuan, Yuqi Wang, Zijie Yue, Kunyi Yang, Yuting Zhang, Zhu Zhuo, Dian Qin, Xin Wang, NG Chi Fai, Brian Anthony, Daguang Xu, Guy Rosman, Ozanan Meireles, Zizhen Zhang, Nicolas Padoy, Hesheng Wang, Qi Dou, Yueming Jin, Yutong Ban

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13185 2026-03-16 cs.CV 57%

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

从单目视频生成时空世界场景图

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。

Comments https://github.com/rohithpeddi/WorldSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22645 2026-03-16 cs.CV 57%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06119 2026-03-16 cs.CV 57%

Omni-Video: Democratizing Unified Video Understanding and Generation

Omni-Video:统一视频理解与生成的普及

Zhiyu Tan, Hao Yang, Luozheng Qin, Jia Gong, Mengping Yang, Hao Li

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Omni-Video框架,通过改进多模态大语言模型生成连续视觉线索,结合轻量架构和高效训练方案,实现视频理解、生成与编辑的统一模型。

Comments Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 18 篇

2512.08881 2026-03-16 cs.CV 85%

SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing

SATGround:一种面向遥感视觉语义的时空感知方法

Aysim Toker, Andreea-Maria Oncescu, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SATGround方法,通过结构化定位机制提升卫星图像视觉语义理解,结合语言和空间信息增强定位精度,在多个遥感基准测试中取得显著提升,包括比先前方法提升33.2%的视觉语义定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17476 2026-03-16 cs.CV 85%

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文

Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11975 2026-03-16 cs.CV cs.AI cs.CR 84%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12773 2026-03-16 cs.CV cs.AI eess.IV 81%

Empowering Semantic-Sensitive Underwater Image Enhancement with VLM

通过VLM赋能语义敏感的水下图像增强

Guodong Fan, Shengning Zhou, Genji Yuan, Huiyu Li, Jingchun Zhou, Jinjiang Li

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用视觉语言模型增强水下图像增强的语义敏感能力,通过生成文本描述并生成空间语义指导图,提升图像重建的语义聚焦度,实验验证其在感知质量和检测分割任务中的有效性。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12606 2026-03-16 cs.CV cs.AI 81%

Mastering Negation: Boosting Grounding Models via Grouped Opposition-Based Learning

掌握否定:通过分组对立学习提升 grounding 模型

Zesheng Yang, Xi Jiang, Bingzhang Hu, Weili Guan, Runmin Cong, Guo-Jun Qi, Feng Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出 D-Negation 数据集及分组对立学习框架,通过显式建模否定语义提升视觉语言 grounding 模型的鲁棒性和定位精度。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21105 2026-03-16 cs.CV 79%

RLM: A Vision-Language Model Approach for Radar Scene Understanding

RLM:一种用于雷达场景理解的视觉-语言模型方法

Pushkal Mishra, Kshitiz Bansal, Dinesh Bharadia

机构 * University of California San Diego(加州大学圣地亚哥分校) Blue River Technology

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

AI总结 本文提出RadarVLM,通过结构化空间语言监督学习统一的场景表示,改进了雷达场景理解中的空间推理能力,实验显示其在生成描述和车辆分割任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI 79%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 77%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12930 2026-03-16 cs.CV cs.LG 73%

Rethinking VLMs for Image Forgery Detection and Localization

重新思考视觉语言模型用于图像伪造检测与定位

Shaofeng Guo, Jiequan Cui, Richang Hong

机构 * Hefei University of Technology Key Laboratory of Knowledge Engineering with Big Data, Ministry of Education(合肥工业大学大数据知识工程重点实验室,教育部)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文研究如何利用视觉语言模型提升图像伪造检测与定位性能,发现传统先验知识对检测效果有负面影响,提出IFDL-VLM新方法,通过位置掩码增强模型可解释性,并在多个基准上取得新最优结果。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12538 2026-03-16 cs.CV cs.AI 73%

Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation

具有混合专家的时空语义专家路由架构用于指代图像分割

Alaa Dalaq, Muzammil Behzad

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SERA架构,通过在视觉语言框架中引入轻量级表达感知专家细化,提升指代图像分割的时空一致性与边界精度,实验表明其在准确定位和精细边界界定上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12369 2026-03-16 cs.CV 70%

Human Knowledge Integrated Multi-modal Learning for Single Source Domain Generalization

融合人类知识的多模态学习用于单源域泛化

Ayan Banerjee, Kuntal Thakur, Sandeep Gupta

机构 * Impact Lab, Arizona State University(影响实验室,亚利桑那州立大学)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出GenEval方法,结合基础模型与人类知识提升单源域泛化性能,在糖尿病视网膜病变和癫痫发作区检测中取得优异结果。

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026, pp. 2380-2391

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13168 2026-03-16 cs.AI cs.CL cs.IR 57%

Developing and evaluating a chatbot to support maternal health care

开发和评估一个支持产科保健的聊天机器人

Smriti Jha, Vidhi Jain, Jianyu Xu, Grace Liu, Sowmya Ramesh, Jitender Nagpal, Gretchen Chapman, Benjamin Bellows, Siddhartha Goyal, Aarti Singh, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Population Council Institute(人口理事会研究所) Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) Nivi, Inc.(Nivi公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。

Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 57%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏