arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-23 至 2026-04-23 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2604.20319 2026-04-23 cs.CV 90%

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

SurgCoT:通过链式推理基准提升手术视频中的时空推理

Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn)

AI总结 SurgCoT通过统一的链式推理框架评估多模态大语言模型在7个外科领域35种手术中的时空推理能力,揭示了商业模型在手术推理中的优势及现有模型的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19758 2026-04-23 cs.AI cs.CL cs.LG 82%

ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models

ThermoQA:一个用于评估大语言模型热力学推理能力的三级基准测试

Kemal Düzkar

机构 * Olivenet Kyrenia, Cyprus(奥利文特基尔尼亚,塞浦路斯)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ThermoQA通过293个热力学问题测试大语言模型的热力学推理能力,揭示记忆属性与推理能力的差异,提供开放源代码的评估工具。

Comments 17 pages, 8 figures, open-source dataset and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20273 2026-04-23 cs.AI cs.CL 81%

ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks

ActuBench: 一个用于生成和评估精算推理任务的多智能体LLM流水线

Jan-Philipp Schmidt

机构 * TH Köln, Institut für Versicherungswesen (ivwKöln)(TH Köln保险学系(ivwKöln))

专题命中 推理评测 :reasoning(title);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ActuBench,一个多智能体LLM流水线,用于自动生成和评估符合国际精算协会教育大纲的高级精算评估题目。通过四个LLM角色的分工,结合成本优化的辅助代理,评估了50个模型并在两个基准上报告了三个主要发现。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04225 2026-04-23 cs.CV cs.AI cs.CL 81%

Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images

定位后检查:基于区域的推理提升AI生成图像的检测

Yikun Ji, Yan Hong, Bowen Deng, Jun Lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LTE框架,通过定位可疑区域并重新检查以提升AI生成图像检测的准确性和鲁棒性,提供可理解的区域级解释。

Comments 18 pages, 11 figures (including supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20806 2026-04-23 cs.CV cs.AI cs.CL 81%

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试

Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) Harbin Institute of Technology(哈尔滨工业大学) Central South University(中南大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) Guizhou University(贵州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10312 2026-04-23 cs.LG 79%

Training-free retrieval-augmented generation with reinforced reasoning for flood damage nowcasting

无需训练的检索增强生成与强化推理用于洪水损害现在预测

Lipai Huang, Kai Yin, Chia-Fu Liu, Ali Mostafavi

机构 * Urban Resilience.AI Lab, Zachry Department of Civil and Environmental Engineering(城市韧性.AI实验室,土木与环境工程系) Department of Computer Science and Engineering(计算机科学与工程系) Department of Civil, Environmental and Architectural Engineering(土木、环境与建筑工程系) Institute for a Disaster Resilient Texas(德克萨斯灾害韧性研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出R2RAG-Flood框架,通过强化推理实现无需训练的洪水损害现在预测,利用结构化预测器、文本摘要和推理轨迹构建知识库,在推理阶段通过地理邻近和自由样本支持案例推理,提升预测准确性与成本效率。

Comments 18 pages, 3 figures, 8 tables, submitted to CACAIE journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20350 2026-04-23 cs.CV 78%

X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis

X-PCR:眼科诊断中跨模态渐进临床推理的基准测试

Gui Wang, Zehao Zhong, YongSong Zhou, Yudong Li, Ende Wu, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua University(清华大学) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Wenzhou Medical University(温州医科大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出X-PCR基准测试,通过完整眼科诊断流程评估多模态大语言模型的渐进推理和跨模态整合能力,包含26,415张图像和177,868个专家验证的VQA对,评估21个模型揭示其在渐进推理和跨模态整合方面的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14044 2026-04-23 cs.CV 78%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13928 2026-04-23 cs.CL cs.AI 73%

LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X

Shuo Xing, Junyuan Hong, Yifan Wang, Runjin Chen, Zhenyu Zhang, Ananth Grama, Zhengzhong Tu, Zhangyang Wang

机构 * Texas A&M University(德克萨斯农工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Updated experiments with corrected data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-04-23 cs.CL 70%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 49 pages, 46 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20190 2026-04-23 cs.CV cs.LG 70%

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19773 2026-04-23 cs.CL cs.AI 62%

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models

PR-CAD:基于大语言模型的统一可控且忠实的文本到CAD生成的渐进式细化

Jiyuan An, Jiachen Zhao, Fan Chen, Liner Yang, Zhenghao Liu, Hongyan Wang, Weihua An, Meishan Zhang, Erhong Yang

机构 * School of Information Science, Beijing Language and Culture University, China(北京语言大学信息学院) School of Computer Science and Technology, Beijing Jiaotong University, China(北京交通大学计算机科学与技术学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), China(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PR-CAD通过统一生成与编辑任务,提升文本到CAD生成的可控性和忠实性,采用高保真交互数据集和强化学习框架,实现设计创建与细化的一体化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19765 2026-04-23 cs.CL cs.AI 62%

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs

幻觉神经元能否泛化?来自LLMs跨领域迁移的证据

Snehit Vaddi, Pujith Vaddi

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了LLMs中幻觉神经元在不同知识领域间的泛化能力,发现其在跨领域迁移时性能显著下降,表明幻觉机制具有领域特异性。

Comments 18 pages, 5 models, 6 domains, ACL format. Includes causal intervention analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19754 2026-04-23 cs.AI cs.LG 62%

Exploring Data Augmentation and Resampling Strategies for Transformer-Based Models to Address Class Imbalance in AI Scoring of Scientific Explanations in NGSS Classroom

探索数据增强和重采样策略以解决基于Transformer模型的AI评分中科学解释类不平衡问题

Prudence Djagba, Kevin Haudek, Clare G. C. Franovic, Leonora Kaldaras

机构 * Michigan State University(密歇根州立大学) CREATE for STEM(STEM创新计划) University of Houston(休斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过数据增强策略提升Transformer模型对科学解释评分的性能,发现GPT生成数据和ALP方法在处理严重类别不平衡时效果显著,优于传统过采样方法。

Comments Published as a conference paper at NARST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08570 2026-04-23 cs.LG cs.AI cs.PL cs.SE quant-ph 62%

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

QuanBench+: 一种统一的多框架基准用于基于LLM的量子代码生成

Ali Slim, Haydar Hamieh, Jawad Kotaich, Yehya Ghosn, Mahdi Chehimi, Ammar Mohanna, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * American University of Beirut(贝鲁特美国大学) King Abdullah University of Science and Technology(卡迪夫国王大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuanBench+基准,用于评估LLM在量子代码生成中的多框架性能,通过执行测试和反馈修复机制,展示了不同框架下的代码生成效果及改进。

Comments 24 pages total, 25 figures, 5 tables, including supplementary material. Accepted to the ICLR 2026 Workshop on I Can't Believe It's Not Better

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20413 2026-04-23 cs.AI 57%

Self-Awareness before Action: Mitigating Logical Inertia via Proactive Cognitive Awareness

行动前的自我意识:通过主动认知意识缓解逻辑惯性

Fulong Fan, Peilin Liu, Fengzhe Liu, Shuyan Yang, Gang Yan

机构 * School of Software, Jilin University(吉林大学软件学院) School of Computer Science, Jilin University(吉林大学计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SABA框架,通过在最终决策前引入对缺失前提的自我意识,解决大语言模型在非交互谜题中因早期假设传播导致的结论不稳定问题,实现了在多个基准测试中的最佳性能。

Comments Accepted to ACL 2026. 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20006 2026-04-23 cs.CL 57%

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

从回忆到遗忘:个性化代理长期记忆的基准测试

Md Nayem Uddin, Kumar Shubham, Eduardo Blanco, Chitta Baral, Gengyu Wang

机构 * Arizona State University(亚利桑那州立大学) Genies University of Arizona(亚利桑那大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Memora基准测试,评估个性化代理在长期对话中的记忆、推理和推荐能力,引入FAMA指标以衡量对过时记忆的依赖,发现LLM和记忆代理在处理长期记忆时存在显著不足。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19815 2026-04-23 cs.AI 57%

Large Language Models Meet Biomedical Knowledge Graphs for Mechanistically Grounded Therapeutic Prioritization

大型语言模型与生物医学知识图谱结合用于机制性指导的治疗优先级排序

Chih-Hsuan Wei, Chi-Ping Day, Zhizheng Wang, Christine C. Alewine, Betty Tyler, Hasan Slika, David Saraf, Chin-Hsien Tai, Joey Chan, Robert Leaman, Zhiyong Lu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DrugKLM框架,结合生物医学知识图谱与大语言模型的机制推理,提升治疗优先级排序的准确性与生物学依据。

Comments 24 pages, 5 figures in main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08948 2026-04-23 cs.CL 57%

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

TaxPraBen:一种可扩展的基准,用于评估LLM在中文实际税收实践中的结构化表现

Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yue

机构 * Yunnan University(云南大学) Wuhan University(武汉大学) Jianghan University(江汉大学) Nanjing Audit University(南京审计大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出TaxPraBen,首个专注于中文税收实践的基准,结合10项传统任务和3项创新场景,评估19种LLM在税收实践中的表现,揭示封闭源大参数LLM和中文LLM的优势。

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15037 2026-04-23 cs.SE cs.AI 57%

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

CircuChain: 解构LLM电路分析中的能力与合规性

Mayank Ravishankara

机构 * Independent Researcher(独立研究员) San Francisco, CA, USA(美国加州旧金山)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CircuChain通过设计控制/陷阱问题对,评估LLM在电路分析中遵循指令与物理推理能力的差异,揭示模型能力与约束对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08508 2026-04-23 cs.CV cs.CL 57%

Re:Verse -- Can Your VLM Read a Manga?

Re:Verse -- 能读懂漫画吗?

Aaditya Baranwal, Madhav Kataria, Naitik Agrawal, Yogesh S Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学) Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。

Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20738 2026-04-23 cs.CL 57%

RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering

RespondeoQA:一种双语拉丁-英语问答基准

Marisa Hudspeth, Patrick J. Burns, Brendan O'Connor

机构 * Manning College of Information & Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校信息与计算机科学学院) Institute for the Study of the Ancient World, New York University(纽约大学古代世界研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个包含7800个问答对的双语拉丁-英语问答翻译基准,涵盖拉丁语教学资料中的多种问题类型,评估了三种大语言模型在技能类问题上的表现。

Comments Published in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18349 2026-04-23 cs.CL 57%

HiGMem: A Hierarchical and LLM-Guided Memory System for Long-Term Conversational Agents

HiGMem:一种分层且基于LLM的长期对话代理内存系统

Shuqi Cao, Jingyi He, Fei Tan

机构 * East China Normal University(东华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HiGMem通过分层事件-对话轮次内存系统,利用事件摘要作为语义锚点,提升检索效率和证据集可靠性,优于现有方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Camera-ready version. 10 pages, 2 figures. Code: https://github.com/ZeroLoss-Lab/HiGMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14785 2026-04-23 cs.AI 57%

MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror

MirrorBench: 通过引入镜像评估多模态大语言模型中的自中心智能

Shengyu Guo, Tongrui Ye, Jianbo Zhang, Zicheng Zhang, Chunyi Li, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MirrorBench通过引入镜像测试,系统评估多模态大语言模型的自中心智能,揭示其在基础视觉感知到高级自我表征方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04950 2026-04-23 cs.CV cs.AI 57%

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00979 2026-04-23 cs.CV cs.AI 57%

IVY-FAKE: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection

IVY-FAKE:图像和视频AIGC检测的统一可解释框架和基准

Changjiang Jiang, Wenhui Dong, Zhonghao Zhang, Fengchang Yu, Wei Peng, Xinbin Yuan, Yifei Bi, Ming Zhao, Zian Zhou, Chenyang Si, Caifeng Shan

机构 * Nanjing University+(南京大学+)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IVY-FAKE,首个大规模多模态可解释AIGC检测基准,包含106000+丰富标注样本和5000个手动验证示例,通过GRPO强化学习模型实现可解释推理,提升多基准检测性能,显著优于现有方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20460 2026-04-23 cs.CV 50%

CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

CCTVBench:用于多模态大语言模型的对比一致性交通视频问答基准

Xingcheng Zhou, Hao Guo, Rui Song, Walter Zimmer, Mingyu Liu, André Schamschurko, Hu Cao, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 CCTVBench通过真实事故视频与世界模型生成的反事实场景配对,提出对比一致性评估方法,揭示视频问答中对比一致性与标准指标间的显著差距,并引入C-TCD方法提升问答与一致性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19822 2026-04-23 cs.SE 50%

Statistical Software Engineering with Tuned Variables

基于调优变量的统计软件工程

Nimrod Busany

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出将统计软件工程中的治理空间作为核心对象,强调在变化环境中通过调优变量维持程序质量与安全性的方法。

Comments 3 pages, position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21394 2026-04-23 cs.CR 50%

MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection

MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测

Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。

Comments ACL 2026 Industry Track Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18823 2026-04-23 cs.CV 50%

MSLAU-Net: A Hybrid CNN-Transformer Network for Medical Image Segmentation

MSLAU-Net:一种用于医学图像分割的混合CNN-Transformer网络

Libin Lan, Yanxin Li, Xiaojuan Liu, Juan Zhou, Jianxun Zhang, Nannan Huang, Yudong Zhang

机构 * College of Computer Science and Engineering(计算机科学与工程学院) College of Artificial Intelligence(人工智能学院) Department of Pharmacy(药学部) Department of Prosthodontics(修复学部) Chongqing Key Laboratory of Oral Diseases(重庆口腔疾病重点实验室) Chongqing Municipal Key Laboratory of Oral Biomedical Engineering of Higher Education(重庆市口腔生物医学工程高等教育重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Southeast University(东南大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出MSLAU-Net,结合CNN和Transformer的优势,通过多尺度线性注意力和自上而下特征聚合机制,提升医学图像分割的精度与效率。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏