arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-23 至 2026-03-23 共收录 51 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2603.19481 2026-03-23 cs.CV 57%

Narrative Aligned Long Form Video Question Answering

叙事对齐的长视频问答

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19274 2026-03-23 cs.CL cs.AI 57%

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

CURE:临床理解和检索评估的多模态基准

Yannian Gu, Zhongzhen Huang, Linjie Mu, Xizhuo Zhang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, China(商汤研究院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20017 2026-03-23 cs.CL cs.DB cs.IR 50%

RouterKGQA: Specialized--General Model Routing for Constraint-Aware Knowledge Graph Question Answering

RouterKGQA: 专用-通用模型路由用于约束感知的知识图谱问答

Bo Yuan, Hexuan Deng, Xuebo Liu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 视觉问答 :grounding(abstract)

AI总结 RouterKGQA提出专用-通用模型协作框架,通过专用模型生成推理路径,通用模型在必要时进行知识图谱引导修复,提升性能并降低成本,实验显示在多个基准上F1和Hits@1均优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19688 2026-03-23 cs.CL 50%

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

DataProphet:解开多模态大语言模型监督数据泛化之谜

Xuan Qi, Luxi He, Dan Roth, Xingyu Fu

机构 * University of Pennsylvania(宾夕法尼亚大学) Tsinghua University(清华大学) Princeton University(普林斯顿大学)

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文提出DataProphet,一种无需训练的指标,通过结合多模态困惑度、相似性和数据多样性,有效评估监督数据对目标基准的影响,实现更优的数据选择。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 13 篇

2603.01038 2026-03-23 cs.CV cs.AI 81%

From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing

从直觉到探究:一种工具增强的推理MLLM框架用于可推广的面部反伪装

Haoyuan Zhang, Keyao Wang, Guosheng Zhang, Haixiao Yue, Zhiwen Tan, Siran Peng, Tianshuo Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Ajian Liu, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(UCAS智能科学研究院) MAIS, CASIA(CASIA模式识别与智能信息处理研究院) Baidu Inc(百度公司) CAIR, HKISI, CAS(HKISI CAS计算机视觉研究院) M.U.S.T

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出TAR-FAS框架,通过整合外部视觉工具提升面部反伪装的泛化能力,采用CoT-VT范式使MLLM深入分析细微伪装线索,实验表明其在跨域协议下达到SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19517 2026-03-23 cs.CV cs.LG 73%

ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding

ReXInTheWild:医疗照片理解的统一基准

Oishi Banerjee, Sung Eun Kim, Alexandra N. Willauer, Julius M. Kernbach, Abeer Rihan Alomaish, Reema Abdulwahab S. Alghamdi, Hassan Rayhan Alomaish, Mohammed Baharoon, Xiaoman Zhang, Julian Nicolas Acosta, Christine Zhou, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究所) Department of Medicine, Division of Gastroenterology, Massachusetts General Hospital(麻省总医院内科与消化内科部门) Department of Neuroradiology, Heidelberg University Hospital(海德堡大学医院神经放射科部门) King Abdulaziz Medical City, National Guard Health Affairs(国王阿卜杜勒-阿齐兹医疗城,国民守卫健康事务局) Division of Pulmonary, Critical Care, and Sleep Medicine, University of Cincinnati(辛辛那提大学肺科、重症医学及睡眠医学部门)

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ReXInTheWild基准,通过484张医学文献来源的照片和7个临床主题的955个多项选择问题,评估视觉-语言模型对医疗照片内容的理解能力,揭示不同模型在细粒度图像理解和医学推理上的性能差异。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24903 2026-03-23 cs.CV cs.CE 70%

FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

FinMMDocR:基于场景意识、文档理解与多步骤计算的金融多模态推理基准测试

Zichen Tang, Haihong E, Rongjin Li, Jiacheng Liu, Linwei Jia, Zhuodi Hao, Zhongjun Yang, Yuanze Li, Haolin Tian, Xinyi Hu, Peizhi Zhao, Yuan Liu, Zhengyu Wang, Xianghe Wang, Yiling Huang, Xueyuan Lin, Ruofei Bai, Zijian Xie, Qian Huang, Ruining Cao, Haocheng Gao

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 FinMMDocR通过引入场景意识、文档理解和多步骤计算,推动多模态大语言模型在现实金融场景中的推理能力提升,其包含12种隐含金融场景、9类丰富文档及平均11步推理任务。

Comments Accepted by AAAI-26 Main Track

Journal ref Proc. AAAI 2026 (Vol. 40, No. 30), pages 25858-25866

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00171 2026-03-23 cs.CV 70%

CompAgent: An Agentic Framework for Visual Compliance Verification

CompAgent:一种用于视觉合规验证的代理框架

Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

机构 * Generative AI Innovation Center(生成式人工智能创新中心) Amazon Web Services(亚马逊网络服务)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12781 2026-03-23 cs.AI cs.CV 62%

VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension

VIRO:用于指代表达理解的鲁棒且高效的神经符号推理与验证

Hyejin Park, Junhyuk Kwon, Suha Kwak, Jungseul Ok

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学(POSTECH))

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VIRO通过在推理步骤中嵌入轻量级操作符验证器,提升指代表达理解的鲁棒性和效率,达到61.1%的平衡准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19863 2026-03-23 cs.CV 57%

MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment

MedQ-Engine:一种用于医疗图像质量评估中进化多模态大语言模型的闭环数据引擎

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MedQ-Engine,通过闭环数据引擎迭代评估模型,发现失败原型,利用人类在循环注释提升模型性能,使8B参数模型在医疗图像质量评估中超越GPT-4o 13%并接近人类专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19779 2026-03-23 cs.CV 57%

One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment

一个模型,两种思维:任务条件推理用于统一的图像质量与审美评估

Wen Yin, Cencen Liu, Dingrui Liu, Bing Su, Yuan-Fang Li, Tao He

机构 * University of Electronic Science and Technology of China(电子科技大学) Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TATAR框架,通过任务感知的异步奖励机制,解决图像质量评估与审美评估的推理与优化不匹配问题,实验证明其在多个基准上的优越性能。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-03-23 cs.CL cs.AI 57%

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14052 2026-03-23 cs.CV cs.MA 57%

A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

一种多智能体感知-行动联盟用于高效长视频推理

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV 57%

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19858 2026-03-23 cs.RO cs.MA 50%

Beyond detection: cooperative multi-agent reasoning for rapid onboard EO crisis response

超越检测:用于快速在轨遥感危机响应的协作多智能体推理

Alejandro D. Mousist, Pedro Delgado de Robles Martín, Raquel Lladró Climent, Julian Cobos Aparicio

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。

Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17910 2026-03-23 cs.CL 50%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19468 2026-03-23 cs.SD eess.AS 50%

Listen First, Then Answer: Timestamp-Grounded Speech Reasoning

先听再回答:基于时间戳的语音推理

Jihoon Jeong, Pooneh Mousavi, Mirco Ravanelli, Cem Subakan

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出基于强化学习的时间戳接地策略,使语音大模型在推理时更关注音频内容,提升多模态推理的准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 12 篇

2603.19203 2026-03-23 cs.CV 85%

Tinted Frames: Question Framing Blinds Vision-Language Models

着色边框:问题框架使视觉语言模型失明

Wan-Cyuan Fan, Jiayun Luo, Declan Kutscher, Leonid Sigal, Ritwik Gupta

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Vector Institute for AI(人工智能向量研究所)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 本文研究视觉语言模型在不同问题框架下的注意力分配问题,发现框架影响其视觉输入处理,提出轻量级提示调优方法提升视觉感知能力。

Comments Preprint. Project page: https://davidhalladay.github.io/tinted_frames_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15160 2026-03-23 cs.CV 85%

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision:基于BEV的双阶段框架用于空间智能

Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

机构 * Atlas Lab(Atlas实验室) School of Aerospace, BUAA(北京航空航天大学航空学院) School of Software, BUAA(北京航空航天大学软件学院) State Key Laboratory of HERATT(HERATT国家重点实验室) Key Laboratory of SDODS (MOE) Project(SDODS重点实验室(教育部))

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 EagleVision通过结合几何感知帧选择与主动BEV推理,提升视频空间推理能力,实现空间感知与验证的闭环循环。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 83%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20193 2026-03-23 cs.CV cs.AI cs.LG 82%

From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering

从遮罩到像素与意义:一种新的分类、基准和度量标准用于VLM图像篡改

Xinyi Shang, Yi Tang, Jiacheng Cui, Ahmed Elhagry, Salwa K. Al Khatib, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种基于像素和意义的VLM图像篡改检测新方法,引入了新的分类体系和基准,提出了基于像素的度量标准,并评估了现有模型在微编辑和非遮罩篡改上的表现。

Comments Code and data at: https://github.com/VILA-Lab/PIXAR (Accepted in CVPR 2026 Findings, but not opted in)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12788 2026-03-23 cs.CV 79%

Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing

思考并回答ME:基准测试和探索遥感中的多实体推理 grounding

Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi

机构 * Beihang University, Beijing, China(北京航空航天大学) University of Liverpool, Liverpool, UK(利物浦大学) Institute of Acoustics, Chinese Academy of Sciences, Beijing, China(中国科学院声学研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出ME-RSRG基准数据集,通过Entity-Aware Reasoning框架提升遥感多实体推理能力,验证了该框架的有效性。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19429 2026-03-23 cs.AI cs.LO cs.SC 79%

When both Grounding and not Grounding are Bad -- A Partially Grounded Encoding of Planning into SAT (Extended Version)

当同时 grounding 和不 grounding 都不好 -- 一种部分 grounding 的规划到 SAT 编码(扩展版)

João Filipe, Gregor Behnke

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出一种部分 grounding 的 SAT 编码,在保持动作 lifted 的同时部分 grounding 预言,实现线性规模的规划效率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19608 2026-03-23 cs.CV cs.AI 62%

FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement

FB-CLIP:基于前景-背景解耦的细粒度零样本异常检测

Ming Hu, Yongsheng Huo, Mingyu Dou, Jianfu Yin, Peng Zhao, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang

机构 * Xi’an Institute of Optics and Precision Mechanics, Chinese Academy of Sciences(西安光学精密机械研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Xi’an Jiaotong University(西安交通大学) Zhongnan Hospital of Wuhan University(武汉大学中南医院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FB-CLIP框架,通过多策略文本表示和前景-背景分离,提升细粒度零样本异常检测的准确性和定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19531 2026-03-23 cs.CV cs.AI 62%

dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3

dinov3.seg: 基于DINOv3的开放词汇语义分割

Saikat Dutta, Biplab Banerjee, Hamid Rezatofighi

机构 * IITB-Monash Research Academy(IITB-莫纳什研究学院) IIT Bombay(印度理工学院班加罗尔) Monash University(莫纳什大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出dinov3.seg,通过改进DINOv3模型实现开放词汇语义分割,结合文本嵌入与视觉特征,提升复杂场景下的分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19782 2026-03-23 cs.AI 57%

Embodied Science: Closing the Discovery Loop with Agentic Embodied AI

具身科学:通过代理具身AI闭合发现循环

Xiang Zhuang, Chenyi Zhou, Kehua Feng, Zhihui Zhu, Yunfan Gao, Yijie Zhong, Yichi Zhang, Junjie Huang, Keyan Ding, Lei Bai, Haofen Wang, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出具身科学框架,将科学发现视为闭环过程,结合代理推理与物理执行,通过感知-语言-行动-发现框架实现自主发现系统。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17432 2026-03-23 cs.CV 57%

AIFloodSense: A Global Aerial Imagery Dataset for Semantic Segmentation and Understanding of Flooded Environments

AIFloodSense:一个全球空中影像数据集,用于洪水环境的语义分割与理解

Georgios Simantiris, Konstantinos Bacharidis, Apostolos Papanikolaou, Petros Giannakakis, Costas Panagiotakis

机构 * Department of Management Science and Technology(管理科学与技术系) Hellenic Mediterranean University(希伯伦地中海大学) Institute of Computer Science, FORTH(信息科学研究所,FORTH)

专题命中 视觉定位与Grounding :visual question answering(abstract);分类 cs.CV

AI总结 本文提出AIFloodSense数据集,包含470张高分辨率图像,覆盖64个国家和六个大洲,支持图像分类、语义分割和视觉问答三个任务,旨在提升洪水环境的灾害评估能力。

Comments 36 pages, 19 figures, 8 tables

Journal ref Remote Sens. 2026, 18(6), 938

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG 57%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19267 2026-03-23 cs.CL cs.IR 50%

Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication

审查审查者:图增强的大语言模型用于电商争议裁决

Yuchen Du, Ashley Li, Zixi Huang

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。

Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 2 篇

2603.20164 2026-03-23 cs.RO cs.AI 83%

The Robot's Inner Critic: Self-Refinement of Social Behaviors through VLM-based Replanning

机器人的内在批评者:通过基于视觉语言模型的重新规划实现社会行为的自我完善

Jiyu Lim, Youngwoo Yoon, Kwanghyun Park

机构 * KwangWoon University(匡文大学) ETRI(电子技术研究院)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出CRISP框架,通过基于视觉语言模型的重新规划,使机器人自主评估并优化其社会行为,提高灵活性和自主性,适用于多种平台。

Comments Accepted to ICRA 2026. 8 pages, 9 figures, Project page: https://limjiyu99.github.io/inner-critic/

详情

展开后加载摘要…

URL PDF HTML 收藏