arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-25 至 2026-03-25 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 33 篇

2603.22582 2026-03-25 cs.CL cs.AI 90%

Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?

对我的谎言:推理模型中的思维链推理可信度如何?

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校,管理、创业与技术系,李商学院) DeepNeuro AI

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了12种开源推理模型在MMLU和GPQA Diamond中的表现,发现模型在提示影响下的可信度差异显著,训练方法和架构影响更大。

Comments 27 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20172 2026-03-25 cs.CL cs.AI cs.LG 87%

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

衡量忠实性取决于如何测量:分类器敏感性在LLM链式推理评估中的应用

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校管理、创业与技术系,Lee商学院) DeepNeuro AI

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过不同分类器对10276个推理轨迹的分析,揭示了模型忠实性评估中分类器选择对结果的影响,指出不同方法导致的忠实性差异显著,需采用多种方法进行评估。

Comments 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22318 2026-03-25 cs.CL cs.LG 81%

Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds

飞行猪、FaR及更广泛的领域:评估LLM在反事实世界中的推理能力

Anish R Joishy, Ishwar B Balappanawar, Vamshi Krishna Bonagiri, Manas Gaur, Krishnaprasad Thirunarayan, Ponnurangam Kumaraguru

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Wright State University(威斯汀豪斯州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在反事实场景下的推理能力,提出FaR方法以增强模型的元认知,减少逻辑与知识冲突带来的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI 79%

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09537 2026-03-25 cs.SE cs.AI 79%

From Context to Intent: Reasoning-Guided Function-Level Code Completion

从上下文到意图:基于推理的函数级代码补全

Yanzhou Li, Tianlin Li, Yiran Zhang, Shangqing Liu, Aishan Liu, Xianglong Liu, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于推理的提示框架,通过利用代码上下文中的隐含线索推断开发者意图,提升函数级代码补全的准确性,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20586 2026-03-25 cs.LG cs.AI 76%

MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning

MKA:用于高效长上下文推理的内存键注意

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出MKA机制,通过多级KV缓存和动态路由提升长上下文推理效率,FastMKA在保持准确率的同时显著提升训练速度和评估效率。

Comments Accepted to the ACM Computing Frontiers 2026 Conference (Oral Presentation) and the ICML 2025 Long Context Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17108 2026-03-25 cs.CV 75%

LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience

基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性

Nafis Fuad, Xiaodong Qian

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。

Comments There is a update in result, which is needed to be addressed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22288 2026-03-25 cs.CL cs.AI cs.LG 75%

Evaluating Prompting Strategies for Chart Question Answering with Large Language Models

评估大型语言模型在图表问答中的提示策略

Ruthuparna Naikar, Ying Zhu

机构 * Georgia State University, Atlanta GA, USA(佐治亚州立大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统评估了四种提示策略在图表问答任务中的表现,发现Few-Shot Chain-of-Thought策略在准确性和格式遵循上表现最佳,为结构化数据推理任务提供了选择提示策略的指导。

Journal ref Advances in Visual Computing (ISVC 2025), LNCS 16397, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23125 2026-03-25 cs.IR 67%

From Questions to Trust Reports: A LLM-IR Framework for the TREC 2025 DRAGUN Track

从问题到信任报告:一种用于TREC 2025 DRAGUN赛道的LLM-IR框架

Ignacy Alwasiak, Kene Nnolim, Jaclyn Thi, Samy Ateia, Markus Bink, Gregor Donabauer, David Elsweiler, Udo Kruschwitz

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出一种结合LLM生成问题与语义过滤的框架,用于生成信任报告,通过改进检索和重排序提升相关性和可信度。

Comments TREC 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV 67%

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22651 2026-03-25 cs.AI cs.CL cs.LG 67%

Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies

多代理LLM架构在金融文档处理中的基准测试:协作模式、成本准确性权衡及生产扩展策略的比较研究

Siddhant Kulkarni, Yukta Kulkarni

机构 * Department of Computer Science and Engineering(计算机科学与工程系) New York University(纽约大学) New York, NY 10012(纽约市NY 10012)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较四种多代理架构在金融文档处理中的表现,揭示了反射架构在字段级F1得分最高但成本更高,而分层架构在成本准确性帕累托前沿表现最佳,同时展示了语义缓存等策略对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23355 2026-03-25 cs.LG cs.CL 62%

Off-Policy Value-Based Reinforcement Learning for Large Language Models

为大语言模型设计的非策略价值基于强化学习

Peng-Yuan Wang, Ziniu Li, Tian Xu, Bohan Yang, Tian-Shuo Liu, ChenYang Wang, Xiong-Hui Chen, Yi-Chen Li, Tianyun Yang, Congliang Chen, Yang Yu

机构 * National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(大数据研究院(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReVal方法,通过结合步级信号和轨迹级信号提升大语言模型的训练效率,实验表明其在数学推理任务中优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04945 2026-03-25 cs.CL cs.AI cs.HC 62%

Collaborative Evaluation of Deepfake Text with Deliberation-Enhancing Dialogue Systems

协同评估深度伪造文本的深度伪造Deliberation对话系统

Jooyoung Lee, Xiaochen Zhu, Georgi Karadzhov, Tom Stafford, Andreas Vlachos, Dongwon Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了DeepFakeDeLiBot在深度伪造文本检测中的协同评估效果,发现群体问题解决能提高机器生成文本的识别准确率,尽管与AI工具的交互未显著提升整体性能,但增强了群体互动和协作效率。

Comments 15; To appear in ICWSM 2026 (https://www.icwsm.org/2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 62%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22333 2026-03-25 cs.LG cs.AI 62%

Graph Signal Processing Meets Mamba2: Adaptive Filter Bank via Delta Modulation

图信号处理与Mamba2交汇:通过Delta调制实现自适应滤波器组

Yehjin Shin, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HADES框架,将Mamba2重新解释为线图上的自适应滤波器组,通过结构化偏置实现全局低通和局部高通滤波,提升效率和可解释性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22321 2026-03-25 cs.CV cs.AI cs.CL 62%

From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs

从指令到协助:一个对齐指令手册与装配视频的数据集用于评估多模态大语言模型

Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工大学DEIB学院) KASTEL, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院KASTEL研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M2AD数据集,用于评估多模态大语言模型在技术任务中的协助能力,探讨其推理、步骤跟踪和指令引用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 62%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15994 2026-03-25 cs.CR cs.AI 57%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22492 2026-03-25 cs.AI 57%

RealCQA-V2: A Diagnostic Benchmark for Structured Visual Entailment over Scientific Charts

RealCQA-V2:结构化科学图表视觉蕴含的诊断基准

Saleem Ahmed, Srirangaraj Setlur, Venu Govindaraju

机构 * University at Buffalo, Buffalo, NY, USA(布法罗大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RealCQA-V2通过将图表问答转化为视觉前提证明任务,提供结构化视觉蕴含验证,揭示多模态推理中的局部-全局推理差距。

Comments Under Review : Code and Data will be made public soon - https://cse-ai-lab.github.io/VPP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23229 2026-03-25 cs.CL 57%

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义

Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) National Research Council Canada(加拿大国家研究委员会)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了八种最先进的生成式多模态大语言模型在检测和解释六种隐喻意义类型上的能力,并通过人工评估验证其解释的合理性与忠实性。

Comments LREC 2026, 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22939 2026-03-25 cs.CV cs.LG 57%

FixationFormer: Direct Utilization of Expert Gaze Trajectories for Chest X-Ray Classification

FixationFormer:直接利用专家凝视轨迹进行胸部X光分类

Daniel Beckmann, Benjamin Risse

机构 * Institute for Geoinformatics(地理信息研究所) Department of Computer Science(计算机科学系) University of Münster(穆斯堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出FixationFormer,通过将专家凝视轨迹作为序列建模,利用Transformer架构提升胸部X光分类性能,实现更直接的专家诊断信息整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22777 2026-03-25 cs.AI 57%

AgriPestDatabase-v1.0: A Structured Insect Dataset for Training Agricultural Large Language Model

AgriPestDatabase-v1.0:用于训练农业大语言模型的结构化昆虫数据集

Yagizhan Bilal Durak, Ahsan Ul Islam, Shahidul Islam, Ashley Morgan-Olvera, Iftekhar Ibne Basith, Syed Hasib Akhter Faruqui

机构 * Sam Houston State University(萨姆豪斯敦州立大学) Kennesaw State University(肯纳威克州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AgriPestDatabase-v1.0,构建了结构化昆虫数据集并采用轻量级LLM进行微调,以提升农业害虫管理的决策支持能力。

Comments Accepted in Artificial Super Intelligence Conference 2026 (Sponsored by KSU PLOT & IEEE CIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22576 2026-03-25 cs.CL 57%

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

CAPITU:一个评估巴西葡萄牙语指令遵循能力的基准,具有文学背景

Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CAPITU基准通过八部巴西文学经典作品背景,结合可验证指令约束与文化内容,评估LLM在巴西葡萄牙语中的指令遵循能力,测试18种前沿模型,揭示多轮对话中约束持久性差异及形态学约束等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22561 2026-03-25 cs.AI 57%

AI Mental Models: Learned Intuition and Deliberation in a Bounded Neural Architecture

AI 心智模型:在有限神经架构中学习的直觉与推理

Laurence Anthony

机构 * Waseda University(早稻田大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨有限神经架构是否能在经典64项演绎推理基准上实现直觉与推理的分工。研究提出双路径架构,通过直觉与推理路径的分离,展示出在交叉验证中推理路径的显著优势,表明模型具备结构化内部计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22499 2026-03-25 cs.CR cs.LG 57%

OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection

OrgForge-IT:一种可验证的合成基准用于基于大语言模型的内部威胁检测

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出OrgForge-IT,一种可验证的合成基准,通过确定性模拟引擎和语言模型生成表面文本,确保跨 artifact 一致性。研究发现多模型 leaderboard 显示,三类威胁和八种可注入行为的检测策略存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11488 2026-03-25 cs.CL cs.SD eess.AS 57%

When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration

当音频大模型不听:一种跨语言的模态仲裁研究

Jayadev Billa

机构 * San Jose, CA, USA(美国加州圣何塞) Yahoo(雅虎) Nuance(Nuance公司) BBN(BBN公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现音频与文本冲突时,语言模型更倾向于遵循文本而非音频,通过ALME数据集和TDR指标揭示模态仲裁中的信息内容与仲裁易用性差异。

Comments 13 pages, 18 tables, 4 figures, benchmark and code at https://github.com/jb1999/alme-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00415 2026-03-25 cs.AI 57%

Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm

迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹

Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科技大学) University of Michigan(密歇根大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。

Comments This is a work in progress due to methodology refinement and further evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23122 2026-03-25 cs.CV 50%

PiCo: Active Manifold Canonicalization for Robust Robotic Visual Anomaly Detection

PiCo:主动流形规范化的稳健机器人视觉异常检测

Teng Yan, Binkai Liu, Shuai Liu, Yue Yu, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(abstract)

AI总结 PiCo通过主动流形规范化解决机器人视觉异常检测在多姿态和不稳定环境下的鲁棒性问题,采用分阶段机制提升几何不确定性和噪声消除能力,实验显示其在静态和闭环场景中均取得显著性能提升。

Comments 16 pages. Submitted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23034 2026-03-25 cs.CV 50%

Traffic Sign Recognition in Autonomous Driving: Dataset, Benchmark, and Field Experiment

自动驾驶中的交通标志识别:数据集、基准测试与实地实验

Guoyang Zhao, Weiqing Qi, Kai Zhang, Chenguang Zhang, Zeying Gong, Zhihai Bi, Kai Chen, Benshan Ma, Ming Liu, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lingnan University(岭大) Shenzhen Unity Drive Innovation Technology Co., Ltd.(深圳Unity Drive创新技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TS-1M数据集及诊断基准,通过跨区域识别、稀有类别识别等挑战性任务,评估现代交通标志识别模型的性能,揭示语义对齐对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15253 2026-03-25 cs.CV 50%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。

Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏