arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-27 至 2026-03-27 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2603.25423 2026-03-27 cs.SI cs.AI 57%

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25322 2026-03-27 cs.MA cs.AI 57%

AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Study

AD-CARE:一种基于指南、模态无关的LLM代理,用于多队列评估、公平性分析和读者研究的阿尔茨海默病诊断

Wenlong Hou, Sheng Bi, Guangqian Yang, Lihao Liu, Ye Du, Hanxiao Xue, Juncheng Wang, Yuxiang Feng, Yue Xun, Nanxi Yu, Ning Mao, Mo Yang, Yi Wah Eva Cheung, Ling Long, Kay Chen Tan, Lequan Yu, Xiaomeng Ma, Shaozhen Yan, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院) Amazon(亚马逊) Zhejiang University(浙江大学) Sany AI(三一人工智能) Yantai Yuhuangding Hospital, Qingdao University(青岛大学烟台毓璜顶医院) The University of Hong Kong(香港大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AD-CARE通过整合临床指南和多模态数据,实现了多队列中84.9%的诊断准确率,显著提升诊断效率和公平性,适用于阿尔茨海默病的临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25309 2026-03-27 cs.CL 57%

Separate Before You Compress: The WWHO Tokenization Architecture

在压缩前分离:WHHO标记化架构

Kusal Darshana

机构 * Remeinium Research(Remeinium 研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出WHHO架构和SGPE算法,通过分离语言规则与压缩过程,实现多语言标记化,显著降低复杂Abugida语言的token数量,提升推理效率。

Comments 17 pages, 1 figure, 8 tables. Tokenization Architecture including formal DFA definitions and regular expressions for Sinhala and Devanagari syllabification. Evaluation includes comparisons with OpenAI o200k-base, Llama-4-Scout, and DeepSeek-V3. Source code and datasets: https://github.com/remeinium/WWHO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25133 2026-03-27 cs.AI 57%

RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following

RubricEval: 一种用于LLM评判者的 rubric级元评估基准

Tianjun Pan, Xuan Lin, Wenyan Yang, Qianyu He, Shisong Chen, Licai Qi, Wanqing Xu, Hongwei Feng, Bo Xu, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Donghua University(东华大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RubricEval旨在解决rubric级评估的可靠性问题,通过多样化的指令和响应以及高质量实例,评估评判者在指令遵循中的表现,发现即使GPT-4o在Hard子集也仅达到55.97%的准确率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25105 2026-03-27 cs.CL 57%

OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMs

OMIND:面向心理健康大语言模型的知识引导微调与多轮对话基准框架

Suraj Racha, Prashant Harish Joshi, Utkarsh Maurya, Nitin Yadav, Mridul Sharma, Ananya Kunisetty, Saranya Darisipudi, Nirmal Punjabi, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出OMIND框架,通过结构化知识检索、模型剪枝和人工审核生成高质量多任务SFT数据集,并引入oMind-Chat多轮对话基准,验证了其在核心能力和对话任务上的优越性能。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25075 2026-03-27 cs.AI 57%

Sparse Visual Thought Circuits in Vision-Language Models

视觉语言模型中的稀疏视觉思维电路

Yunpeng Zhou

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25056 2026-03-27 cs.CR cs.AI 57%

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

系统提示是攻击面:LLM代理配置如何影响安全并创造可利用的漏洞

Ron Litvak

机构 * Independent Researcher(独立研究员) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了LLM邮件代理中系统提示配置对安全性和漏洞的影响,发现提示模型交互是关键安全变量,通过不同配置可使钓鱼检测率从低于1%到97%波动,同时提出Safetility指标以平衡检测、可用性和对抗鲁棒性。

Comments 32 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25733 2026-03-27 cs.CV 50%

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

SlotVTG: 用于通用视频时间定位的对象中心适配器

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 SlotVTG通过引入轻量级槽适配器,使MLLMs在最小成本下实现对象中心的输入关联视觉推理,提升跨域鲁棒性的同时保持领域内性能。

Comments Accepted to GRAIL-V workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25089 2026-03-27 cs.CV 50%

THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics

THEMIS:迈向多模态大语言模型在科学论文欺诈取证中的全面评估

Tzu-Yen Ma, Bo Zhang, Zichen Tang, Junpeng Ding, Haolin Tian, Yuanze Li, Zhuodi Hao, Zixin Ding, Zirui Wang, Xinyu Yu, Shiyao Peng, Yizhuo Zhao, Ruomeng Jiang, Yiling Huang, Peizhi Zhao, Jiayuan Chen, Weisheng Tan, Haocheng Gao, Yang Liu, Jiacheng Liu, Zhongjun Yang, Jiayu Huang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 THEMIS通过真实场景和复杂图像评估多模态大语言模型在学术欺诈推理中的能力,引入了五种欺诈类型和16种细粒度操作,揭示模型在不同核心能力上的优劣。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24696 2026-03-27 cs.CV 50%

LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration

LLaVA-LE:用于月球探索的大型语言和视觉助手

Gokce Inal, Pouyan Navard, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。

Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 7 篇

2410.12476 2026-03-27 cs.CL cs.LG 81%

Retrieval-Reasoning Large Language Model-based Synthetic Clinical Trial Generation

基于检索-推理的大型语言模型合成临床试验生成

Zerui Xu, Fang Wu, Yingzhou Lu, Yuanyuan Zhang, Yue Zhao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室) University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Southern California(南加州大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于检索-推理框架的合成临床试验生成方法,利用LLM生成标注二元结果的合成试验报告,通过检索模块和推理模块提升生成质量,实验证明合成数据可有效增强真实数据集并提升临床试验预测性能。

Comments Published in ACM BCB 2025. 9 pages, 4 figures, 5 tables (Main paper + Supplementary Materials)

Journal ref Proceedings of the 16th ACM International Conference on Bioinformatics, Computational Biology, and Health Informatics (ACM BCB 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25203 2026-03-27 cs.CV cs.CL 79%

Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection

基于概率概念图推理的多模态虚假信息检测

Ruichao Yang, Wei Gao, Xiaobin Zhu, Jing Ma, Hongzhan Lin, Ziyang Luo, Bo-Wen Zhang, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港浸会大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PCGR框架,通过构建概念图进行多模态虚假信息检测,实现可解释且可进化的方法,提升检测准确性和抗新兴操纵能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05181 2026-03-27 cs.CV 78%

Mario: Multimodal Graph Reasoning with Large Language Models

Mario:基于大语言模型的多模态图推理

Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学) EPFL(瑞士联邦理工学院洛桑)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20423 2026-03-27 cs.CL cs.AI 62%

CodeNER: Code Prompting for Named Entity Recognition

CodeNER: 代码提示用于命名实体识别

Sungwoo Han, Hyeyeon Kim, Jingun Kwon, Hidetaka Kamigaito, Manabu Okumura

机构 * Chungnam National University(忠南大学) Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) Institute of Science Tokyo(东京科学大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 CodeNER通过代码提示提升LLM在命名实体识别中的能力,通过嵌入BIO标注规则改进长距离理解,实验显示在多语言数据集上优于传统文本提示方法。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24856 2026-03-27 cs.AI cs.CY cs.ET cs.MA 57%

SentinelAI: A Multi-Agent Framework for Structuring and Linking NG9-1-1 Emergency Incident Data

SentinelAI:一种多智能体框架,用于结构化和链接NG9-1-1应急事件数据

Kliment Ho, Ilya Zaslavsky

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SentinelAI框架,通过多智能体系统实现应急事件数据的标准化和跨源推理,解决NG9-1-1数据标准下的数据整合难题。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05127 2026-03-27 cs.AI 57%

The Prompt Canvas: A Literature-Based Practitioner Guide for Creating Effective Prompts in Large Language Models

提示画布:基于文献的从业者指南,用于在大型语言模型中创建有效的提示

Michael Hewing, Vincent Leinhos

机构 * FH Münster – University of Applied Sciences(穆斯特应用科学大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Prompt Canvas,通过文献综述整合提示工程方法,为从业者提供结构化指南,促进大语言模型的应用与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12118 2026-03-27 cs.SE 50%

Do Code LLMs Do Static Analysis?

代码LLM进行静态分析吗?

Chia-Yi Su, Collin McMillan

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究代码LLM在代码智能任务中的静态分析能力,发现LLM在静态分析任务中表现不佳,且预训练静态分析任务无法提升代码智能任务性能。

Comments 42 pages, 2 figures, Accepted at Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏