arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-06 至 2026-04-06 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 16 篇

2508.03088 2026-04-06 cs.IR 78%

ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning

ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理

Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02834 2026-04-06 cs.AI 70%

ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents

ESL-Bench: 一个基于事件的合成纵向基准用于健康代理

Chao Li, Cailiang Liu, Ang Gao, Kexin Deng, Shu Zhang, Langping Xu, Xiaotong Shi, Xionghao Ding, Jian Pei, Xun Jiang

机构 * Shanda Group(盛大集团)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ESL-Bench通过合成100个用户数据,涵盖健康档案、多阶段叙事计划、日常设备测量、定期检查记录和事件日志,评估健康代理在多源轨迹推理中的性能,发现数据库代理在比较和解释任务中显著优于记忆增强RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03131 2026-04-06 cs.CR cs.AI 57%

A Systematic Security Evaluation of OpenClaw and Its Variants

对OpenClaw及其变种的系统性安全评估

Yuhang Wang, Haichang Gao, Zhenxing Niu, Zhaoxiang Liu, Wenjing Zhang, Xiang Wang, Shiguo Lian

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文系统评估了六个OpenClaw系列代理框架的安全性,发现代理系统存在显著安全漏洞,且其风险高于孤立使用的基础模型。

Comments 39 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02816 2026-04-06 cs.CV cs.AI 57%

QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models

QAPruner: 量化感知的多模态大语言模型视觉标记剪枝

Xinhao Wang, Zhonyu Xia, Zhiwei Lin, Zhe Li, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出QAPruner框架,通过结合量化误差模拟与异常强度指标,实现多模态大语言模型的视觉标记剪枝与后训练量化联合优化,提升低比特下的推理精度。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM 57%

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02423 2026-04-06 cs.CL cs.CY 57%

SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy

SWAY:一种反事实计算语言学方法用于衡量和缓解谄媚倾向

Joy Bhalla, Kristina Gligorić

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :CoT(abstract);分类 cs.CL

AI总结 本文提出SWAY,一种无监督的计算语言学指标,用于衡量和缓解大语言模型的谄媚倾向。通过反事实提示机制,识别模型在正负语言压力下的同意变化,发现谄媚倾向随认知承诺增加而增强,并提出基于反事实的CoT缓解策略,有效降低谄媚倾向而不影响对真实证据的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02367 2026-04-06 cs.NI cs.CL 57%

Evaluating Small Language Models for Front-Door Routing: A Harmonized Benchmark and Synthetic-Traffic Experiment

评估小型语言模型用于前端路由:一个统一的基准和合成流量实验

Warren Johnson, Charles Lee

机构 * Plexor Labs(Plexor实验室) Project Autobots

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过统一基准和合成流量实验,评估小型语言模型在前端路由中的性能,发现Qwen-2.5-3B在准确率、延迟和成本上表现优异,但整体仍存在准确率与延迟的平衡问题。

Comments 23 pages, 1 figure, 9 tables. Article 8 in the TAAC Research Series. Code and data: https://github.com/micoverde/plexor-slm-frontdoor-rct

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17714 2026-04-06 cs.AI 57%

From Virtual Environments to Real-World Trials: Emerging Trends in Autonomous Driving

从虚拟环境到现实世界试验:自动驾驶领域新兴趋势

A. Humnabadkar, A. Sikdar, B. Cave, H. Zhang, N. Bessis, A. Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶、模拟技术和合成数据集的最新发展,探讨了合成数据在感知与规划中的应用、数字孪生模拟系统验证以及领域适应策略,分析了基准设计趋势及关键挑战,旨在推动安全、可推广的自动驾驶系统发展。

Comments Accepted manuscript - Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03198 2026-04-06 cs.CV cs.AI 57%

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02945 2026-04-06 cs.DC 50%

MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理

Zheming Yang, Qi Guo, Jun Wan, Jiarui Ruan, Yunqing Hu, Chang Zhao, Xiangyang Li

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV 50%

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02431 2026-04-06 cs.IR 50%

SelRoute: Query-Type-Aware Routing for Long-Term Conversational Memory Retrieval

SelRoute:基于查询类型的长期对话记忆检索路由

Matthew McKee

专题命中 推理评测 :reasoning(abstract)

AI总结 SelRoute通过根据查询类型选择专用检索管道提升长期对话记忆检索效果,实验显示其在多个基准测试中表现优异,但存在推理密集型检索任务的失败模式。

Comments 12 pages, 12 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24591 2026-04-06 cs.HC 50%

Vibe Coding XR: Accelerating AI + XR Prototyping with XR Blocks and Gemini

Vibe Coding XR: 通过XR Blocks和Gemini加速AI+XR原型设计

Ruofei Du, Benjamin Hersh, David Li, Nels Numan, Xun Qian, Yanhe Chen, Zhongyi Zhou, Xingyue Chen, Jiahao Ren, Robert Timothy Bettridge, Xiang 'Anthony' Chen, Faraz Faruqi, Steve Toh, David Kim

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出XR Blocks框架和Vibe Coding XR工作流,利用LLM将高阶提示转化为功能混合现实应用,通过模拟现实环境减少设备测试摩擦,提供60个原型数据集和自动化评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 10 篇

2505.09339 2026-04-06 cs.NI 78%

RAG-Enabled Intent Reasoning for Application-Network Interaction

支持应用-网络交互的意图推理(RAG)

Salwa Mostafa, Mohamed K. Abdel-Aziz, Mohammed S. Elbamby, Mehdi Bennis

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出基于RAG的意图推理框架,用于自动网络操作与管理。通过结合机器推理、检索增强生成和生成式AI技术,实现不同应用的意图翻译,提升网络交互的智能化和领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02485 2026-04-06 cs.CL cs.LG 62%

Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models

未能证伪:评估和缓解语言模型中的确认偏见

Ayush Rajesh Jhaveri, Anthony GX-Chen, Ilia Sucholutsky, Eunsol Choi

机构 * New York University(纽约大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究评估了大型语言模型是否表现出确认偏见,并提出干预策略以减少其影响,通过实验发现干预可显著提高规则发现率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02339 2026-04-06 cs.LG cs.CL 62%

SIEVE: Sample-Efficient Parametric Learning from Natural Language

SIEVE: 从自然语言中高效参数学习

Parth Asawa, Alexandros G. Dimakis, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SIEVE通过合成数据生成管道实现高效参数学习,仅需三个查询示例即可提升模型性能,适用于需要上下文的推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02783 2026-04-06 cs.HC cs.AI 57%

Disrupting Cognitive Passivity: Rethinking AI-Assisted Data Literacy through Cognitive Alignment

打破认知惰性:通过认知对齐重新思考人工智能辅助的数据素养

Yongsu Ahn, Nam Wook Kim, Benjamin Bach

机构 * Boston College(波士顿学院) Inria(法国国家信息与自动化研究所) University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过认知对齐框架,重新设计人工智能辅助的数据素养,以避免认知惰性,促进主动思考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02678 2026-04-06 stat.ME cs.AI stat.AP 57%

Eligibility-Aware Evidence Synthesis: An Agentic Framework for Clinical Trial Meta-Analysis

有资格意识的证据合成:一个用于临床试验元分析的代理框架

Yao Zhao, Zhiyue Zhang, Yanxun Xu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 EligMeta框架整合了自动化试验发现与有资格意识的元分析,通过自然语言查询生成可复现的试验选择,并基于资格对研究加权,以产生特定群体的汇总估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02674 2026-04-06 cs.MA cs.AI 57%

Do Agent Societies Develop Intellectual Elites? The Hidden Power Laws of Collective Cognition in LLM Multi-Agent Systems

智能体社会是否发展出知识分子?LLM多智能体系统中集体认知的隐藏幂律

Kavana Venkatesh, Jiaming Cui

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究LLM多智能体系统中协调动态,揭示协调遵循幂律级联、集中于知识分子精英及系统规模增长时极端事件频发的三大定律,提出整合瓶颈机制及Deficit-Triggered Integration方法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03045 2026-04-06 cs.CV cs.MM 50%

STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models

STEAR:面向视频大语言模型的层感知时空证据干预以缓解幻觉

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 STEAR通过层感知的时空证据干预框架,缓解视频大语言模型中的空间和时间幻觉,提升解码的准确性与一致性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02665 2026-04-06 cs.SE 50%

AgentSZZ: Teaching the LLM Agent to Play Detective with Bug-Inducing Commits

AgentSZZ: 教授LLM代理通过引发缺陷的提交进行调查

Yunbo Lyu, Jieke Shi, Hong Jin Kang, Ratnadira Widyasari, Junda He, Yuqing Niu, Chengran Yang, Junkai Chen, Zhou Yang, Julia Lawall, David Lo

专题命中 其他推理 :reasoning(abstract)

AI总结 AgentSZZ通过LLM代理探索仓库并识别缺陷引发提交,结合专用工具、领域知识和ReAct循环,提升跨文件和幽灵提交的召回率,实现F1分数提升27.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02547 2026-04-06 cs.SE 50%

Beyond Resolution Rates: Behavioral Drivers of Coding Agent Success and Failure

超越分辨率率:编码代理成功与失败的行为驱动因素

Tural Mehtiyev, Wesley Assunção

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过大规模实证研究分析了9374条轨迹,探讨了编码代理在特定任务中失败的原因,发现行为模式和LLM能力对成功与失败有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00683 2026-04-06 cs.CV 50%

Video Understanding: Through A Temporal Lens

视频理解:通过时间视角

Thong Thanh Nguyen

机构 * Institute of Data Science(数据科学研究所)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过时间视角探讨如何利用视频元素间的时间关系提升视频理解,提出自动标注框架、参数高效微调策略、状态空间层整合、新型对比学习框架及对大视觉-语言模型的全面研究,揭示了视觉-语言接口对时间推理的瓶颈。

Comments PhD Thesis, NUS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏