arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-24 至 2026-06-24 共收录 112 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2606.24820 2026-06-24 cs.CL 新提交 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 57%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24346 2026-06-24 cs.IR cs.CL 新提交 57%

PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation

PETRA: 将网络文本转化为石油工程领域适应的数据集

Kirill Dubovikov, Omar El Mansouri, Hachem Madmoun, Yanda Li, Sandeep Kumar, Aya El Mir, Supriyo Ghosh, Writabrata Bhattacharya, Adrian Garcia-Garcia, Onkar Pandit, Sunil Kumar Sahu, Federico Castanedo, Larry Murray, Martin Takac, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Inception AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对石油工程检索中领域标签稀缺的问题,提出PETRA数据集和流程,通过噪声网络数据构建领域语料和合成监督信号,显著提升检索与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 57%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24066 2026-06-24 cs.SD cs.CL eess.AS 新提交 57%

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集

Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho, Phuong Tuan Dat, Thi Thu Trang Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出无需面部线索的数据集构建流程,利用文本元数据和大型语言模型推理说话人身份,构建包含4715名说话人约902小时语音的越南语数据集VieSpeaker,实验证明其提升模型鲁棒性和泛化能力。

Comments 5 pages, 1 figure, 6 tables, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13189 2026-06-24 cs.CL 新提交 57%

SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection

SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数

Fuqiang Niu, Bowen Zhang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 57%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24295 2026-06-24 cs.CL 版本更新 57%

MERGE: Minimal Expression-Replacement GEneralization Test for Natural Language Inference

MERGE: 自然语言推理的最小表达式替换泛化测试

Mădălina Zgreabăn, Tejaswini Deoskar, Lasha Abzianidze

机构 * Utrecht Institute of Linguistics OTS(乌得勒支语言研究所OTS)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MERGE测试,通过最小表达式替换(MERE)生成高质量变体,评估NLI模型在非对抗性变体上的泛化能力,发现LLM和微调模型泛化较差。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14167 2026-06-24 cs.CL 57%

Synthetic Clarification and Correction Dialogues about Data-Centric Tasks -- A Teacher-Student Approach

数据导向任务的合成澄清与纠正对话——一种教师-学生方法

Christian Poelitz, Nick McKenna

机构 * Microsoft Research(微软研究院) Cambridge UK(剑桥英国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种教师-学生框架,用于合成多轮对话以解决基于表格的问题回答任务,通过强教师模型验证生成对话质量,验证了其在前沿LLM基准中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24742 2026-06-24 cs.RO 新提交 50%

World Value Models for Robotic Manipulation

机器人操作的世界价值模型

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract)

AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交 50%

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22597 2026-06-24 cs.CV 新提交 50%

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?

Srinivas Venkatanarayanan, Clement Pakkam Isaac

机构 * NVIDIA(英伟达) University of Central Florida(中佛罗里达大学) University of South Florida(南佛罗里达大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。

Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09768 2026-06-24 cs.MA 50%

SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis

SAGE: 可扩展的代理基于地面评估用于作物疾病诊断

Muhammad Arbab Arshad, Tirtho Roy, Yanben Shen, Dinakaran Elango, Shivani Chiranjeevi, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde, Arti Singh, Soumik Sarkar

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SAGE框架,通过构建大规模作物疾病图像-症状数据集,结合自动管道生成基于源的症状描述,并引入自主视觉推理代理提升疾病诊断准确性。

Journal ref CVPR 2026 Workshop on Emerging Directions in Data for Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2606.24281 2026-06-24 cs.CL cs.AI 新提交 81%

CALIBER: Calibrating Confidence Before and After Reasoning in Language Models

CALIBER: 在语言模型推理前后校准置信度

Conor Finlay, Joshua Kurien, Saurabh Dash, Marzieh Fadaee, Beyza Ermis

机构 * Cohere Labs(Cohere 实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CALIBER方法,在推理前和推理后分别估计置信度,并匹配相应的监督目标,显著降低期望校准误差(ECE)并提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24605 2026-06-24 cs.AI 新提交 79%

ScaleToT: Generalizing Structured LLM Reasoning for Billion-Scale Low-Activity User Modeling

ScaleToT: 将结构化LLM推理泛化到十亿级低活跃用户建模

Tianbao Ma, Chang Xi, Yichuan Zou, Chengen Li, Linxun Chen, Zilong Lu, Yanan Niu, Zhaojie Liu, Han Li, Kun Gai

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ScaleToT,通过从少量LLM处理子集学习结构化推理并泛化到大规模低活跃用户,使用有界熵引导的思维树和OSIPO训练学生模型,在十亿级广告部署中提升LT30 6.738%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24082 2026-06-24 eess.AS cs.SD 新提交 78%

Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

比较推理:让音频语言模型更擅长比较情感

Abinay Reddy Naini, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Carlos Busso

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) The University of Texas at Dallas(德克萨斯大学达拉斯分校) NVIDIA(英伟达)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出一种推理引导的序数情感识别框架,通过配对语音输入和推理轨迹训练音频语言模型,实现可解释的比较情感判断,仅需传统方法5%的训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21228 2026-06-24 cs.LG 新提交 70%

Sakana Fugu Technical Report

Sakana Fugu 技术报告

Yujin Tang, Edoardo Cetin, Jinglue Xu, Qi Sun, Stefan Nielsen, Vincent Richard, Haruto Goda, Iaroslav Tymchenko, Nhan Nguyen, Hyunin Lee, Mari Ashiga, Shashank Kotyan, So Kuroki, Tarin Clanuwat

机构 * Sakana AI

专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.LG

AI总结 提出Fugu系列协调模型,通过动态代理框架组合多个LLM专长,在多项基准上达到最优性能,并描述其训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24616 2026-06-24 cs.AI cs.PF econ.GN q-fin.EC 新提交 57%

AI Tokenomics: The Economics of Tokens, Computation, and Pricing in Foundation Models

AI Tokenomics:基础模型中的代币、计算与定价经济学

Quanyan Zhu

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI代币经济学框架,研究代币在AI系统中的生成、消耗、定价、分配与优化,揭示代币支出与经济价值的区别,并指出开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24402 2026-06-24 cs.CR 新提交 50%

Poisoned Playbooks: Demystifying Knowledge Poisoning Effects on AI Security Agents

有毒剧本:揭秘知识投毒对AI安全代理的影响

Juho Park, Hyunmin Choi, Kevin Nam

专题命中 其他推理 :reasoning(abstract)

AI总结 研究揭示通过RAG注入单条有毒安全知识可系统性改变AI安全代理行为,提出验证边界(VB)分类法,并评估验证提示与多源检索的防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24165 2026-06-24 cs.CV 新提交 50%

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

多模态大语言模型中基于谱演化引导的令牌剪枝

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) The University of Queensland(昆士兰大学) Singapore Management University(新加坡管理大学) The University of Southern Queensland(南昆士兰大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出跨层谱演化(CLSE)框架,通过频域分析令牌表示在Transformer层间的演化来评估重要性,实现无训练剪枝,在保持性能的同时减少计算开销。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23840 2026-06-24 cs.HC 新提交 50%

Embodied Explainability and Ontological Obstacles: Why We Struggle to Explain the Answers of Large Language Models (LLMs)

具身可解释性与本体论障碍:为何我们难以解释大型语言模型(LLM)的答案

Marvin Pafla, Jesse Hoey, Kate Larson, Mark Hancock

专题命中 其他推理 :reasoning(abstract)

AI总结 本文从具身认知角度论证可解释性是在使用中通过共享实践中的可供性创造的,揭示了解释大型语言模型时的本体论障碍,并强调可解释性应限于在情境实践中提供可供性的设计。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24480 2026-06-24 cond-mat.mtrl-sci 新提交 50%

Breaking Bottlenecks in Solid Electrolyte Discovery with Large Artificial Intelligence Models

利用大型人工智能模型突破固态电解质发现中的瓶颈

Eric Jianfeng Cheng, Min Hong, Zhiquan Zeng, Chuanyu Liu, Qian Wang, Melissa Jane Meadowcroft, Vlad Badilita, Carlos Miguel Costa, Senentxu Lanceros-Méndez, Ying Li, Chenyao Ma, Weibo Gong, Surendra Martha, Aloysius Soon, Piao Ma, Di Zhang, Teguh Ariyanto, Sudaryanto, Hiroshi Kakinuma, Jie Zhao, Jiayu Peng, Pengfei Ou, Jun Lu, Shin-ichi Orimo, Hao Li

专题命中 其他推理 :reasoning(abstract)

AI总结 提出利用大型AI模型(MLIPs和LLMs)构建自主发现框架,通过闭环架构整合候选设计、多尺度模拟、不确定性感知选择和实验验证,实现固态电解质从直觉驱动到数据驱动的自优化发现。

Comments 54 pages, 6 figures. Perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏