arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-21 至 2026-08-21 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2608.19737 2026-08-21 cs.CV cs.AI cs.CL 新提交 62%

TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling

TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击

Ling Zhou, Yihao Huang, Jingling Sun, Zhiwen Tian, Yi Zeng, Qihe Liu, Shijie Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。

Comments 8 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17379 2026-08-21 cs.CL cs.AI 版本更新 62%

PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX

PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配

Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun

机构 * Carnegie Mellon University(卡内基梅隆大学) RadixArk Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23522 2026-08-21 cs.CL cs.AI 版本更新 62%

Qworld: Question-Specific Evaluation Criteria for LLMs

Qworld: 为LLMs设计的问题特定评估标准

Shanghua Gao, Yuchang Su, Pengwei Sui, Curtis Ginder, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院医学部) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究 institute) Broad Institute of MIT and Harvard(MIT 和哈佛大学Broad研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Qworld通过递归扩展树生成问题特定评估标准,覆盖89%专家标准并产生79%新标准,揭示LLM在长期影响、公平性等维度的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 57%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 57%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 57%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 57%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-21 cs.CV cs.AI 版本更新 57%

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19997 2026-08-21 cs.CL 版本更新 57%

When Contextual Inference Fails: Cancelability in Interactive Instruction Following

当情境推理失效时:交互指令跟随中的可取消性

Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Department of Language Science and Technology, Saarland University(萨尔兰大学语言科学与技术系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了在协作积木构建任务中,如何区分字面解释与情境推理,引入了交互基准测试BWIM,发现模型在判断与行动间存在脱节,未能有效利用信息进行澄清。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25340 2026-08-21 cs.MA cs.AI 版本更新 57%

PACT: Phenotype-Aware Contrastive Team Representation for Multi-Phenotype Grouped Ad Hoc Teamwork

PACT:面向多表型分组临时协作的表型感知对比团队表示

Beiwen Zhang, Yongheng Liang, Guowei Zou, Haitao Wang, Liu Cong, Hejun Wu

机构 * Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对多智能体系统中需与多样表型陌生队友协作的MPG-AHT问题,提出PACT方法,经实验验证其在分布外评估与样本效率上均优于现有最优基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-21 cs.SE 版本更新 50%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25619 2026-08-21 cs.CV 版本更新 50%

ScaleHP: Scale-Mediated Optimization of Coupled Errors for Metric-Space Hand Pose Estimation

ScaleHP: 在度量空间中估计手部姿态

Ruitao Jing, Xingyu Chen, Hongyang Li, Qing Jiang, Yukai Shi, Lei Zhang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Visincept International Digital Economy Academy (IDEA Research)(国际数字经济学院(IDEA研究院)) South China University of Technology(华南理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ScaleHP,一种端到端的一阶段手部姿态估计框架,利用手部骨骼内在比例关系作为度量先验,通过尺度token和透视约束最小二乘法在相机坐标系中恢复绝对度量尺度,在多个基准上达到最先进性能。

Comments 19 pages, 9 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 5 篇

2608.19355 2026-08-21 cs.MM cs.CV 新提交 82%

GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering

GRACE:基于适配器组合与证据感知校准的教育视觉问答的接地推理

Xinjin Li, Yudi Xia, Xi Zhao, Yiliu Xu, Yining Liu, Cheng Lu, Yujian Long, Yu Ma, Jinghan Cao, Liang Fan, Yeyun Xu

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对教育视觉问答的问题-选项捷径问题,提出GRACE框架,利用结构化教育状态实现参数高效多模态适配,在ScienceQA上提升了多项准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19408 2026-08-21 cs.AI cs.LG 新提交 81%

Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress

超越模仿:通过推理进度过滤在线策略蒸馏

Chen Yang, Haiyuan Wan, Rengrong Xiong, Yize Chen, Danny H.K. Tsang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对在线策略蒸馏中教师奖励与真实推理进度不匹配的问题,提出R2-OPD方法,通过过滤冲突奖励提升推理性能,实现对标准OPD的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10828 2026-08-21 cs.AI 版本更新 74%

The First Drop of Ink: Nonlinear Impact of Distracting Information in Long-Context Reasoning

第一滴墨水:误导信息在长上下文推理中的非线性影响

Muhan Gao, Zih-Ching Chen, Kuan-Hao Huang

机构 * Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA NVIDIA AI Technology Center, NVIDIA Corporation, Santa Clara, CA, USA

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 研究探讨了误导信息在长上下文推理中的非线性影响,发现误导信息比例增加时,性能在初期急剧下降,后续变化较小。通过理论和实证分析,揭示了误导信息对注意力的 disproportionate 影响,并指出过滤收益主要来自减少上下文长度而非去除误导信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09276 2026-08-21 cs.CL cs.LG 版本更新 62%

Verifiably grounded machine interpretation of lunar geology

月球地质学的可验证机器解释

Tom Sander, Kay Wohlfarth, Christian Wöhler

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19998 2026-08-21 cs.IR 新提交 50%

SCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based Recommendation

SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏

Seunghyun Baek, Gyuseok Lee, Seunghan Lee, Wonbin Kweon, Dong Wang, SeongKu Kang

专题命中 其他推理 :reasoning(abstract)

AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏