arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-06 至 2026-03-06 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2603.05185 2026-03-06 cs.RO 67%

Critic in the Loop: A Tri-System VLA Framework for Robust Long-Horizon Manipulation

循环批评者:一种三系统VLA框架用于鲁棒的长周期操控

Pengfei Yi, Yingjie Ma, Wenjiang Xu, Yanan Hao, Shuai Gan, Wanting Li, Shanlin Zhong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 循环批评者提出了一种三系统VLA框架,通过动态调度VLM和VLA实现鲁棒的长周期操控,提升系统在分布外场景的自主性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04549 2026-03-06 cs.AI cs.CL cs.MA 62%

Adaptive Memory Admission Control for LLM Agents

自适应记忆准入控制用于大语言模型代理

Guilin Zhang, Wei Jiang, Xiejiashan Wang, Aisha Behr, Kai Zhao, Jeffrey Friedman, Xu Chu, Amine Anoun

机构 * Workday AI

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出自适应记忆准入控制框架,通过分解记忆价值因素提升大语言模型代理的长期记忆管理效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13704 2026-03-06 cs.IR cs.AI cs.CV 57%

Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search

Pailitao-VL:统一的嵌入与重排序用于实时多模态工业搜索

Lei Chen, Chen Ju, Xu Chen, Zhicheng Wang, Yuheng Jiao, Hongfeng Zhan, Zhaoyang Li, Shihao Xu, Zhixiang Zhao, Tong Jia, Lin Li, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Pailitao-VL通过统一嵌入与重排序方法,解决多模态工业搜索中的高精度、实时性和抗噪声问题,实现先进检索架构的高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04455 2026-03-06 cs.NI cs.AI cs.GT 57%

Large Language Models as Bidding Agents in Repeated HetNet Auction

大语言模型作为重复HetNet拍卖中的竞价代理

Ismail Lotfi, Ali Ghrayeb, Samson Lasaulce, Merouane Debbah

机构 * College of Science and Engineering(科学与工程学院) Hamad Bin Khalifa University(哈马德·本·卡西姆大学) CNRS(国家科学研究中心) Universite de Lorraine(洛林大学) CRAN(CRAN研究中心) Department of Computer Science(计算机科学系) Khalifa University(卡西姆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型作为竞价代理,在重复频谱拍卖中实现更高效的资源分配与预算优化。

Comments Accepted at WCNC 2026. Code available here: https://github.com/ismail0T/Strategic_Bidding_HetNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21039 2026-03-06 cs.IR cs.LG 57%

Agentic Multi-Persona Framework for Evidence-Aware Fake News Detection

代理多角色框架用于证据感知的虚假新闻检测

Roopa Bukke, Soumya Pandey, Suraj Kumar, Soumi Chattopadhyay, Chandranath Adak

机构 * Dept. of CSE, Indian Institute of Technology Indore(计算机科学与工程系,印度理工学院印度奥尔德分校) Dept. of CSE, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出AMPEND-LS框架,通过LLM与SLM协同作用,实现多模态虚假新闻检测,提升准确率和鲁棒性,增强信息安全性。

Comments 10 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03153 2026-03-06 cs.SE cs.AI 57%

RefAgent: A Multi-agent LLM-based Framework for Automatic Software Refactoring

RefAgent:一种基于大型语言模型的多智能体框架,用于自动软件重构

Khouloud Oueslati, Maxime Lamothe, Foutse Khomh

机构 * Polytechnique Montreal(蒙特利尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 RefAgent是一种基于多智能体的LLM框架,用于自动化软件重构,通过自我反思和工具调用能力提升重构效率和代码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04668 2026-03-06 cs.RO 50%

Python Bindings for a Large C++ Robotics Library: The Case of OMPL

Python绑定用于大型C++机器人库:OMPL案例

Weihang Guo, Theodoros Tyrovouzis, Lydia E. Kavraki

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文利用大语言模型生成Python绑定,提升大型C++机器人库的开发效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03037 2026-03-06 cs.RO 50%

A Bi-directional Adaptive Framework for Agile UAV Landing

双向自适应框架用于敏捷无人机着陆

Chunhui Zhao, Xirui Kao, Yilin Lu, Yang Lyu

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出双向自适应框架,通过重新定义车辆与平台的角色,实现敏捷无人机着陆的高效、精确与鲁棒性提升。

Comments This work has been submitted to the IEEE Robotics and Automation Letters (RA-L) for possible publication

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2510.16714 2026-03-06 cs.CV cs.AI 89%

SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes

SceneCOT: 在3D场景中引导链式推理

Xiongkun Linghu, Jiangyong Huang, Ziyu Zhu, Baoxiong Jia, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。

Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16688 2026-03-06 cs.CV cs.AI 79%

Pursuing Minimal Sufficiency in Spatial Reasoning

追求空间推理的最小充分性

Yejie Guo, Yunzhong Hou, Wufei Ma, Meng Tang, Ming-Hsuan Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) Johns Hopkins University(约翰霍普金斯大学) University of California Merced(加州大学默塞德分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出 MSSR 框架,通过构建最小充分集提升视觉-语言模型的空间推理能力,实现充分性与最小性的平衡,取得最佳性能并生成可解释的推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04614 2026-03-06 cs.CV 78%

SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D

SGR3模型:三维场景图检索-推理模型

Zirui Wang, Ruiping Liu, Yufan Chen, Junwei Zheng, Weijia Fan, Kunyu Peng, Di Wen, Jiale Wei, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Shenzhen University(深圳大学) Hunan University(湖南大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SGR3模型通过多模态大语言模型与检索增强生成技术,实现无需训练的三维场景图生成,提升场景关系推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI 73%

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04917 2026-03-06 cs.HC 50%

Roomify: Spatially-Grounded Style Transformation for Immersive Virtual Environments

Roomify:基于空间的风格转换用于沉浸式虚拟环境

Xueyang Wang, Qinxuan Cen, Weitao Bi, Yunxiang Ma, Xin Yi, Robert Xiao, Xinyi Fu, Hewu Li

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Roomify通过结合3D场景理解、AI推理和风格生成,实现基于用户实际空间的沉浸式虚拟环境转换,提升沉浸感和创意表达性。

Comments Accepted at CHI 2026 (ACM Conference on Human Factors in Computing Systems). 24 pages, 10 figures. Author's version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04695 2026-03-06 cs.RO 50%

Selecting Spots by Explicitly Predicting Intention from Motion History Improves Performance in Autonomous Parking

通过显式预测意图来选择斑点提高了自动驾驶停车的性能

Long Kiu Chung, David Isele, Faizan M. Tariq, Sangjae Bae, Shreyas Kousik, Jovin D'sa

机构 * Honda Research Institute (HRI)(本田研究机构) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出了一种通过显式预测意图来选择停车位的自动驾驶停车方法,提高了停车任务的预测准确性、社会接受度和任务完成度。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22091 2026-03-06 cs.CV 50%

Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

学习驾驶是免费礼物:从未经处理的现实视频中进行大规模无标签自主性预训练

Matthew Strong, Wei-Jer Chang, Quentin Herau, Jiezhi Yang, Yihan Hu, Chensheng Peng, Wei Zhan

机构 * Applied Intuition Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种无标签、教师引导的框架,通过未经处理的现实视频学习自动驾驶表示,无需姿态、标签或LiDAR,实现高效的自动驾驶感知和规划。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2603.04948 2026-03-06 cs.LG 79%

$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space

∇-Reasoner: 通过潜在空间中的测试时间梯度下降进行LLM推理

Peihao Wang, Ruisi Cai, Zhen Wang, Hongyuan Mei, Qiang Liu, Pan Li, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UC San Diego(圣地亚哥大学) TTIC Georgia Tech(佐治亚理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 ∇-Reasoner通过潜在空间中的测试时间梯度下降提升LLM推理能力,实现20%以上的准确率提升并减少模型调用次数。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09016 2026-03-06 cs.LG 79%

SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning

SPEED-RL: 通过在线课程学习加速推理模型训练

Ruiqi Zhang, Daman Arora, Song Mei, Andrea Zanette

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 SPEED-RL通过在线课程学习方法,提升推理模型训练效率,实现2-6倍的加速,同时保持准确性。

Comments There are some bugs in the experiments, and we cannot fix them to make it satisfactory to us

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04977 2026-03-06 cs.CV 75%

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

思考,然后验证:一种用于长视频理解的假设-验证多智能体框架

Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai

机构 * College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江视觉信息智能处理重点实验室) UC Berkeley(伯克利大学) College of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 VideoHV-Agent通过结构化假设-验证流程提升长视频理解的准确性、可解释性和效率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04893 2026-03-06 cs.CL cs.AI 62%

Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models

免费午餐吗?低成本的多样化采样用于扩散语言模型

Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

机构 * Australian National University(澳大利亚国立大学) Defence Science and Technology Group(国防科学与技术集团) Google DeepMind(谷歌DeepMind) BIMLOGIQ

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种低成本方法,通过修改中间样本以增强扩散语言模型的生成多样性,从而提升Pass@$k$任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04772 2026-03-06 cs.CL cs.AI 62%

TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings

TSEmbed: 解锁通用多模态嵌入中的任务扩展

Yebo Wu, Feng Liu, Ziwei Xie, Zhiyuan Liu, Changwang Zhang, Jun Wang, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(物联网科学与技术国家重点实验室,澳门大学) OPPO Research Institute(OPPO研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TSEmbed通过融合MoE与LoRA,结合专家感知负采样策略,提升通用多模态嵌入的任务扩展能力,并在基准和工业数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 8 篇

2510.02282 2026-03-06 cs.CV cs.LG 79%

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04741 2026-03-06 cs.AI cs.DB cs.IR cs.LG 62%

CONE: Embeddings for Complex Numerical Data Preserving Unit and Variable Semantics

CONE:用于复杂数值数据的嵌入方法,保留单位和变量语义

Gyanendra Shrestha, Anna Pyayt, Michael Gubanov

机构 * Florida State University(佛罗里达州立大学) University of South Florida(佛罗里达州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CONE通过复合嵌入方法提升复杂数值数据的语义编码,实现跨领域高精度数值推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18876 2026-03-06 cs.CV cs.AI cs.CL 62%

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Wuhan University(武汉大学) ByteDance(字节跳动)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08762 2026-03-06 q-fin.ST cs.CE cs.CL cs.LG 62%

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

EDINET-Bench:利用日本财务报表评估大语言模型在复杂财务任务中的表现

Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

机构 * Sakana AI Kyoto University(京都大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 EDINET-Bench通过日本财务报表评估大语言模型在复杂财务任务中的表现,揭示其在会计欺诈检测、盈利预测等任务中仍面临挑战,需更真实的模拟和推理支持。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00152 2026-03-06 cs.CV cs.AI 57%

Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design

Dr. Seg: 通过感知导向设计重新审视GRPO训练用于视觉大语言模型

Haoxiang Sun, Tao Wang, Chenwei Tang, Li Yuan, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Dr.Seg通过感知导向设计重新审视GRPO训练,提出简单框架提升视觉任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05232 2026-03-06 cs.LG 57%

SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity

SlideSparse: 快速且灵活的(2N-2):2N结构稀疏

Hanyong Shao, Yingbo Hao, Ting Song, Yan Xia, Di Zhang, Shaohan Huang, Xun Wu, Songchen Xu, Le Xu, Li Dong, Zewen Chi, Yi Zou, Furu Wei

机构 * Peking University(北京大学) South China University of Technology(南方科技大学) Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 SlideSparse通过滑动窗口分解和激活提升技术,在通用GPU上实现(2N-2):2N结构稀疏的高效加速,提升LLM推理效率的同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00121 2026-03-06 cs.MA 50%

Graph-theoretic Agreement Framework for Multi-agent LLM Systems

图论同意框架用于多智能体大语言模型系统

Muhammad Umar Javed

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出图论框架用于分析多智能体大语言模型中的共识稳定性,通过映射Transformer交叉熵到带符号拉普拉斯矩阵,解决不可观测死锁问题,并验证了共识定理和多项式时间算法。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12112 2026-03-06 cs.CR 50%

BRIDG-ICS: AI-Grounded Knowledge Graphs for Intelligent Threat Analytics in Industry~5.0 Cyber-Physical Systems

BRIDG-ICS:面向工业5.0 CPS的AI驱动知识图谱用于智能威胁分析

Padmeswari Nandiya, Ahmad Mohsin, Ahmed Ibrahim, Iqbal H. Sarker, Helge Janicke

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 BRIDG-ICS通过AI驱动的知识图谱实现工业5.0中网络物理系统的智能威胁分析与韧性评估

Comments 44 Pages, To be published in Springer Cybersecurity Journal

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 22 篇

2603.05400 2026-03-06 cs.CL 85%

An Exploration-Analysis-Disambiguation Reasoning Framework for Word Sense Disambiguation with Low-Parameter LLMs

基于低参数LLM的探索-分析-消歧推理框架用于词义消歧

Deshan Sumanathilaka, Nicholas Micallef, Julian Hough

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本研究提出基于低参数LLM的探索-分析-消歧推理框架,通过推理驱动的微调策略,在零样本设置中实现与GPT-4-Turbo相当的词义消歧性能,并展示了对未见词义的稳健泛化能力。

Comments Accepted at LREC 2026, 15 pages, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24210 2026-03-06 cs.CL cs.AI cs.LG 82%

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

超越基准:语言模型推理能力的抗污染评估

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。

Comments Accepted to ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏