arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-10 至 2026-04-10 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 16 篇

2601.04666 2026-04-10 cs.AI cs.CR 79%

Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought Learning

知彼者智:通过多样化数据合成和指令级推理学习增强大语言模型抗提示注入能力

Zhiyuan Chang, Mingyang Li, Yuekai Huang, Ziyou Jiang, Xiaojun Jia, Qian Xiong, Junjie Wang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory, Institute of Software Chinese Academy of Sciences(中国科学院软件研究所综合信息系统技术国家级重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Beijing Forestry University(北京林业大学)

专题命中 其他推理 :chain-of-thought(title,abstract);分类 cs.AI

AI总结 本文提出InstruCoT方法,通过多样化数据合成和指令级推理学习提升大语言模型对提示注入攻击的防御能力,实验表明其在行为偏差、隐私泄露和有害输出方面显著优于基线方法。

Comments 19 pages, 6 figures; accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06613 2026-04-10 cs.CL cs.AI cs.IT cs.LG math.IT 75%

The Detection-Extraction Gap: Models Know the Answer Before They Can Say It

检测-提取间隙:模型在能说出答案前就已经知道答案

Hanyang Wang, Mingxuan Zhu

机构 * The University of Chicago(芝加哥大学) Imperial College London(伦敦帝国学院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现模型在确定答案后仍生成大量内容,揭示了检测与提取之间的结构性差距,并提出BAEE方法通过利用自由延续提高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08425 2026-04-10 cs.AI cs.CL 73%

Learning Who Disagrees: Demographic Importance Weighting for Modeling Annotator Distributions with DiADEM

学习谁不一致:用于建模标注者分布的群体重要性加权

Samay U. Shetty, Tharindu Cyril Weerasooriya, Deepak Pandita, Christopher M. Homan

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 DiADEM通过学习群体重要性权重,有效建模标注者分歧,优于现有方法,在多个基准上取得显著成果,揭示种族和年龄对标注者分歧的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08333 2026-04-10 cs.CV cs.AI cs.LG 62%

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00084 2026-04-10 cs.CL cs.AI 62%

Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models

视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型

Seyed Amir Ahmad Safavi-Naini, Shuhaib Ali, Omer Shahab, Zahra Shahhoseini, Thomas Savage, Sara Rafiee, Jamil S Samaan, Reem Al Shabeeb, Farah Ladak, Jamie O Yang, Juan Echavarria, Sumbal Babar, Aasma Shaukat, Samuel Margolis, Nicholas P Tatonetti, Girish Nadkarni, Bara El Kurdi, Ali Soroush

机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) University of Texas Health(德克萨斯大学健康科学中心) Virginia Hospital Center(弗吉尼亚医院中心) Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Stanford University(斯坦福大学) Cedars-Sinai Medical Center(西达赛奈医疗中心) Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) University of California–Los Angeles(加州大学洛杉矶分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Columbia University(哥伦比亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。

Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results

Journal ref npj Digital Medicine 8, 797 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07965 2026-04-10 cs.CV cs.AI cs.LG 62%

DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing

DSCA: 动态子空间概念对齐用于终身视觉语言模型编辑

Gyanendra Das, Sai Satyam Jena

机构 * Zynix AI, FL, USA(Zynix AI(美国佛罗里达州))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DSCA通过动态子空间对齐技术,在视觉语言模型中实现精准非干扰编辑,提升终身学习的稳定性与知识保留能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06829 2026-04-10 cs.CL cs.AI 62%

WRAP++: Web discoveRy Amplified Pretraining

WRAP++:增强式网络发现预训练

Jiang Zhou, Yunhao Wang, Xing Wu, Tinghao Yu, Feng Zhang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 WRAP++通过发现跨文档关系增强事实关联上下文,生成跨文档问答数据,提升模型在SimpleQA上的表现。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13040 2026-04-10 cs.LG cs.CL 62%

Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection

用大型语言模型理解结构化金融数据:欺诈检测案例研究

Xuwei Tan, Yao Ma, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Coinbase, Inc.(Coinbase公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FinFRE-RAG方法,通过特征缩减和检索增强学习提升欺诈检测性能,优于直接提示方法并在某些设置中与传统模型竞争。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08545 2026-04-10 cs.CV cs.AI 57%

Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models

明智行动:在代理多模态模型中培养元认知工具使用

Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Accio Team, Alibaba Group(阿里巴巴集团 Accio 团队) Huazhong University of Science and Technology(华中科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HDPO框架,通过解耦优化通道提升代理多模态模型的元认知工具使用能力,减少工具调用并提升推理准确性。

Comments Project Page: https://Accio-Lab.github.io/Metis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08529 2026-04-10 cs.HC cs.AI 57%

PSI: Shared State as the Missing Layer for Coherent AI-Generated Instruments in Personal AI Agents

PSI:作为个人AI代理中协调AI生成工具的缺失层的共享状态

Zhiyuan Wang, Erzhen Hu, Mark Rucker, Laura E. Barnes

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PSI架构,通过共享状态将独立生成的模块转化为连贯的工具,实现持久、连接和聊天互补的跨界面同步操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08395 2026-04-10 cs.CV cs.AI 57%

Phantasia: Context-Adaptive Backdoors in Vision Language Models

幻象:面向视觉语言模型的上下文自适应后门

Nam Duong Tran, Phi Le Nguyen

机构 * Institute for AI Innovation and Societal Impact, Hanoi University of Science and Technology(河内科技大学人工智能创新与社会影响研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Phantasia,一种能根据输入语义动态调整恶意输出的后门攻击方法,提升了攻击隐蔽性和适应性,实验显示其在多种防御设置下均保持良好性能。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08276 2026-04-10 cs.AI cs.CR 57%

ACF: A Collaborative Framework for Agent Covert Communication under Cognitive Asymmetry

ACF:一种在认知不对称下的代理隐蔽通信协作框架

Wansheng Wu, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

机构 * School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ACF框架,解决代理网络中因认知不对称导致的通信同步问题,通过解耦隐蔽通信与语义推理,实现无需认知对称的高效隐蔽通信。

Comments 5 pages, 3 figures. Submitted to IEEE Signal Processing Letters (SPL). Source code is available at https://github.com/Dwinovo/ACF-Stego

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07857 2026-04-10 eess.SY cs.AI cs.SY 57%

Networking-Aware Energy Efficiency in Agentic AI Inference: A Survey

面向网络的代理AI推理能效:综述

Xiaojing Chen, Haiqi Yu, Wei Ni, Dusit Niyato, Ruichen Zhang, Xin Wang, Shunqing Zhang, Shugong Xu

机构 * Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Edith Cowan University(埃迪斯科文大学) Fudan University(复旦大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了代理AI推理中网络感知能效问题,探讨了计算与通信能耗的统一分类,提出跨层协同设计策略,并指出联邦绿色学习、6G代理AI等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03092 2026-04-10 cs.AI cs.AR cs.DC 57%

SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators

SnapStream: 在数据流加速器上高效处理长序列解码

Jonathan Li, Nasim Farahini, Evgenii Iuliugin, Magnus Vesterlund, Christian Häggström, Guangtao Wang, Shubhangi Upasani, Ayush Sachdeva, Rui Li, Faline Fu, Chen Wu, Ayesha Siddiqua, John Long, Tuowen Zhao, Matheen Musaddiq, Håkan Zeffer, Yun Du, Mingran Wang, Qinghua Li, Bo Li, Urmish Thakker, Raghu Prabhakar

机构 * SambaNova Systems, Inc.(SambaNova系统公司) Microsoft AI(微软人工智能) Meta Platforms, Inc.(Meta平台公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了在数据流加速器上实现长序列解码的效率与准确性,提出SnapStream方法,通过压缩KV缓存提升芯片内存利用率,减少精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10183 2026-04-10 cs.CV cs.AI 57%

Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding

通过放大镜:用于无幻觉VLM解码的自适应感知放大

Shunqi Mao, Chaoyi Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney, Australia(澳大利亚悉尼大学计算机科学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出感知放大器PM,通过迭代隔离相关视觉标记并放大相应区域,提升VLM对视觉细节的 scrutiny,从而减少幻觉并增强语言生成与推理能力。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08206 2026-04-10 cs.MA 50%

"Theater of Mind" for LLMs: A Cognitive Architecture Based on Global Workspace Theory

LLM 的 '心灵剧场':基于全局工作空间理论的认知架构

Wenlong Shang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出基于全局工作空间理论的全局工作空间代理(GWA)架构,通过引入熵驱动机制和双层记忆分叉策略,解决LLM自主性不足的问题,实现持续自主认知。

详情

展开后加载摘要…

URL PDF HTML 收藏