arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 34 篇

2604.04852 2026-04-07 cs.CR cs.AI 89%

Strengthening Human-Centric Chain-of-Thought Reasoning Integrity in LLMs via a Structured Prompt Framework

通过结构化提示框架强化LLMs中以人为中心的链式推理完整性

Jiling Zhou, Aisvarya Adeseye, Seppo Virtanen, Antti Hakkala, Jouni Isoaho

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出结构化提示框架以提升LLMs链式推理的可靠性及安全威胁检测能力,通过16个核心维度因素优化推理过程,实验证明在DDoS攻击检测中推理能力提升达40%,并获得高人评一致性。

Comments This paper has been accepted at the 12th Intelligent Systems Conference (IntelliSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01702 2026-04-07 cs.CL 89%

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

在长链式思维监督微调中推理模式在泛化差异中的作用

Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Team(美团龙猫团队) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文研究不同来源的长链式思维轨迹对模型泛化性能的影响,发现训练损失低并不一定带来更好的泛化能力,提出过滤频繁分支轨迹以提升SFT泛化性能。

Comments Under Review. version2: correct typos in Table 4 and add an ablation study (Table 5)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04443 2026-04-07 cs.CL 83%

DeonticBench: A Benchmark for Reasoning over Rules

DeonticBench: 一个用于规则推理的基准

Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出DeonticBench,包含6232个任务,涵盖美国联邦税收、航空行李政策等真实领域,研究复杂规则推理问题,结合语言推理与符号计算,评估LLM在非符号和符号环境下的规则推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04720 2026-04-07 cs.CL cs.AI 81%

What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features

什么使多语言推理有效?通过可测量的特征解构推理痕迹

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过定义可测量的推理特征,研究多语言环境下有效推理的特征,并发现这些特征在不同语言中的关联强度差异显著,挑战了以英语为中心的奖励设计。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20814 2026-04-07 cs.CV cs.AI cs.LG 81%

SPHINX: A Synthetic Environment for Visual Perception and Reasoning

SPHINX:一个用于视觉感知与推理的合成环境

Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗彻斯特理工学院) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI 79%

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03587 2026-04-07 cs.CR cs.AI 79%

SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization

SecPI: 通过安全推理内化实现安全代码生成

Hao Wang, Niels Mündler, Mark Vero, Jingxuan He, Dawn Song, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03676 2026-04-07 cs.IR 78%

Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead

基于大语言模型的检索器是否值得其成本?对效率、鲁棒性和推理开销的实证研究

Abdelrahman Abdallah, Jamie Holdcroft, Mohammed Ali, Adam Jatowt

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文通过12个任务和14个检索器评估了基于大语言模型的检索器在效率、鲁棒性和推理开销方面的表现,发现部分专门化检索器在吞吐量上具有竞争力,而某些大语言模型双编码器则带来显著延迟。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14558 2026-04-07 cs.IR 78%

R2MED: A Benchmark for Reasoning-Driven Medical Retrieval

R2MED:一个面向推理驱动的医学检索基准

Xiangxu Zhang, Lei Li, Xiao Zhou, Zheng Liu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 R2MED旨在解决医学检索中推理需求与现有方法的差距,通过876个查询涵盖三个任务,评估15种检索系统,发现最佳模型仅达31.4nDCG@10,凸显了推理驱动医学检索的挑战。

Comments 38 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03774 2026-04-07 cs.CV cs.AI 77%

When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks

何时多模态AI有所帮助?视觉-语言模型与CNN在卫星-地面网络中的频谱管理中的诊断互补性

Yuanhang Li

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型与CNN在频谱管理中的互补性,提出SpectrumQA基准测试,并发现CNN在空间定位任务中表现优异,而VLM在语义推理任务中具有独特优势,通过任务类型路由器可提升整体性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04456 2026-04-07 cs.AI cs.CL cs.LG 67%

Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition

基于受控扰动的理性稳定性经验表征

Abu Noman Md Sakib, Zhensen Wang, Merjulah Roby, Zijie Zhang

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系) Department of Mechanical, Aerospace, and Industrial Engineering, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校机械、航空航天与工业工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新指标评估模型解释的一致性,通过BERT等预训练模型和SHAP计算特征重要性,检测模型在相似输入下是否保持一致的推理行为。

Comments 28th International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06800 2026-04-07 cs.CL cs.AI cs.HC cs.MA 62%

FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline

FURINA:通过可扩展的多智能体协作流水线实现完全可定制的角色扮演基准

Haotian Wu, Shufan Jiang, Chios Chen, Yiyang Feng, Hehai Lin, Heqing Zou, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Stony Brook University(石溪大学) Nanyang Technological University(南洋理工大学) Datawhale Org.(Datawhale 组织) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FURINA-Builder,一种可扩展的多智能体协作流水线,用于构建完全可定制的角色扮演基准。该基准支持多样化的场景和提示格式,通过智能体协作评估任意角色,并发现推理能力提升的同时 hallucinations 增加的新型权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04020 2026-04-07 cs.CL cs.LG 62%

Unmasking Hallucinations: A Causal Graph-Attention Perspective on Factual Reliability in Large Language Models

揭示幻觉:从因果图注意力视角探讨大语言模型中的事实可靠性

Sailesh kiran kurra, Shiek Ruksana, Vishal Borusu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出因果图注意力网络框架,通过构建token级图来减少大语言模型中的幻觉问题,提升事实可靠性。

Comments Paper accepted for publication at IEEE International Conference on Emerging Computing and Intelligent Technologies 2026 (ICoECIT),5 Pages,5 figures,1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03754 2026-04-07 cs.CL cs.AI 62%

Testing the Limits of Truth Directions in LLMs

检验大型语言模型中真理方向的极限

Angelos Poulis, Mark Crovella, Evimaria Terzi

机构 * Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了大型语言模型中真理方向的普遍性存在局限,指出其依赖于层数、任务类型和复杂性,并受指令影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03376 2026-04-07 cs.AI cs.CL 62%

VERT: Reliable LLM Judges for Radiology Report Evaluation

VERT:用于放射学报告评估的可靠LLM评判者

Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens, Asma Ben Abacha

机构 * Cornell University(康奈尔大学) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VERT作为LLM评判者,通过对比现有指标和实验验证,展示了其在多模态和解剖结构上的鲁棒性及轻量级微调的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21605 2026-04-07 cs.LG cs.AI cs.CR 62%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04791 2026-04-07 cs.CL 57%

How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling

我们离目标还有多远?对LLMs与人类专家在数学建模竞赛中的系统评估

Yuhang Liu, Heyan Huang, Yizhe Yang, Hongyan Zhao, Zhizhuo Zeng, Yang Gao

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文系统评估了LLMs与人类专家在数学建模竞赛中的能力差异,揭示了当前先进LLMs在执行阶段存在显著缺陷,需超越模型扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04660 2026-04-07 cs.AI 57%

Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception

Springdrift:一种可审计的持久运行时用于LLM代理,具备基于案例的记忆、规范安全性和环境自我感知

Seamus Brady

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Springdrift通过可审计的执行子系统、基于案例的记忆层和规范安全机制,实现了LLM代理在跨会话任务连续性和环境自我感知方面的突破,展示了无显式指令下的自主诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04347 2026-04-07 cs.AI 57%

RoboPhD: Evolving Diverse Complex Agents Under Tight Evaluation Budgets

RoboPhD:在有限评估预算下演化多样化复杂智能体

Andrew Borthwick, Stephen Ash, Anthony Galczak

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过对比三种优化方法,在四个基准测试中展示了RoboPhD在演化多样化复杂智能体方面的优越性,特别是在抽象推理、云调度、SQL生成和金融问答任务中表现突出。

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04172 2026-04-07 cs.CV cs.AI 57%

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战

Yaohan Guan, Pristina Wang, Najim Dehak, Alan Yuille, Jieneng Chen, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07943 2026-04-07 cs.AI 57%

IV Co-Scientist: Multi-Agent LLM Framework for Causal Instrumental Variable Discovery

IV共科学家:多智能体LLM框架用于因果工具变量发现

Ivaxi Sheth, Zhijing Jin, Bryan Wilder, Dominik Janzing, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab(Jinesis AI实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨LLM在发现因果工具变量中的作用,提出IV共科学家多智能体系统,通过测试和评估LLM恢复已知工具及避免无效工具的能力,展示LLM在大规模观测数据中发现有效工具的潜力。

Comments Paper accepted at CleaR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03758 2026-04-07 cs.SE cs.AI 57%

AutoReSpec: A Framework for Generating Specification using Large Language Models

AutoReSpec:一种利用大语言模型生成规范的框架

Ragib Shahariar Ayon, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoReSpec框架,通过动态选择LLM和提示配置,结合协作模型反馈,提升规范生成的准确性和效率,实验显示其在成功概率和完整性上优于现有方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03742 2026-04-07 cs.AI 57%

Structured Multi-Criteria Evaluation of Large Language Models with Fuzzy Analytic Hierarchy Process and DualJudge

结构化多标准评估大型语言模型:基于模糊层次分析法与DualJudge

Yulong He, Ivan Smirnov, Dmitry Fedrushkov, Sergey Kovalchuk, Ilya Revin

机构 * St. Petersburg State University(圣彼得堡国立大学) ITMO University(ITMO大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于模糊层次分析法的结构化评估方法,通过引入置信度感知的模糊AHP扩展,提升对大型语言模型评估的准确性与稳定性,提出DualJudge框架实现直观与 deliberative评估的互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03361 2026-04-07 cs.LG q-bio.QM 57%

The limits of bio-molecular modeling with large language models : a cross-scale evaluation

大语言模型在生物分子建模中的局限性:跨尺度评估

Yaxin Xu, Yue Zhou, Tianyu Zhao, Fengwei An, Zhixiang Ren

机构 * Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室) Institute of Mechanics, Chinese Academy of Sciences(中国科学院力学研究所)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.LG

AI总结 本文通过跨尺度生物分子基准测试,揭示了大语言模型在生物分子建模中的性能与机制理解之间的差距,指出链式思维数据对生物任务的有限帮助,混合mamba-注意力架构在长序列中的有效性,以及监督微调对专业化与泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26718 2026-04-07 cs.CY cs.AI cs.MA quant-ph 57%

Toward Evaluation Frameworks for Multi-Agent Scientific AI Systems

迈向多智能体科学AI系统的评估框架

Marcin Abram

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了多智能体科学系统评估的挑战,提出构建抗污染问题、生成可扩展任务家族及多轮交互评估方法,通过访谈量子科学家探讨AI系统交互期望对评估方法的影响。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26567 2026-04-07 cs.SE cs.AI 57%

Beyond Code Snippets: Benchmarking LLMs on Repository-Level Question Answering

超越代码片段:在仓库层面评估大语言模型的问答任务

Yoseph Berhanu Alebachew, Hunter Leary, Swanand Vaishampayan, Chris Brown

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出StackRepoQA数据集,用于评估大语言模型在多项目仓库层面的问答能力,通过对比不同配置下的性能,揭示了模型在处理仓库级程序理解时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03666 2026-04-07 cs.CV cs.AI 57%

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

ToG-Bench:面向任务的时空接地在第一人称视频中

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23883 2026-04-07 cs.AI 57%

Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

代理AI安全:威胁、防御、评估与开放挑战

Anshuman Chhabra, Shrestha Datta, Shahriar Kabir Nahin, Prasant Mohapatra

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。

Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15148 2026-04-07 cs.CV cs.AI 57%

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

XModBench:多模态能力与一致性在多语言模型中的基准测试

Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu

机构 * Advanced Micro Devices(超威半导体) Johns Hopkins University(约翰霍普金斯大学) University of Rochester(罗彻斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 XModBench通过大规模三模态基准测试,评估多语言模型在跨模态一致性中的能力,揭示模型在不同模态下的推理偏差和不平衡问题。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00721 2026-04-07 cs.CV cs.LG 57%

Common Inpainted Objects In-N-Out of Context

常见补全物体在上下文中的内-外场景

Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun

机构 * University of Georgia(佐治亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 COinCO数据集通过扩散补全技术生成97722张包含上下文一致和不一致场景的图像,用于研究上下文学习,支持细粒度上下文推理、基于上下文的物体预测和增强的假检测。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏