arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-29 至 2026-04-29 共收录 95 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 8 篇

2604.22875 2026-04-29 cs.CV cs.AI 57%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00376 2026-04-29 cs.AI 57%

NeuroHex: A Brain-Inspired Hex Coordinate System to Enable Highly Computationally-Efficient World Models for Continuous Online-Adaptive Learning

NeuroHex:一种脑启发的六边形坐标系统,用于构建高效计算的世界模型以支持连续在线自适应学习

Quinn Jacobson, Joe Luo, Jingfei Xu, Shanmuga Venkatachalam, Kevin Wang, Dingchao Rong, John Paul Shen

机构 * NeuroAI Computer Architecture Lab (NCAL)(神经人工智能计算机架构实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 NeuroHex通过六边形坐标系统实现高效世界模型,利用环索引和量化角编码等方法,降低计算成本并支持空间匹配,同时提供OSM2Hex工具将地图数据转换为该坐标系统,提升自主系统空间推理效率。

Comments This is an expanded version of the paper titled "NeuroHex: Highly Efficient Hex Coordinate System for Creating World Models to Enable Adaptive AI" published in the proceedings of the 2026 Neuro Inspired Computational Elements (NICE) [1] conference. This is an archival version of the paper and is currently under review for an ACM journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08323 2026-04-29 cs.CV 50%

Detecting Dental Landmarks from Intraoral 3D Scans: the 3DTeethLand challenge

从口内3D扫描中检测牙齿标志:3DTeethLand挑战

Achraf Ben-Hamadou, Nour Neifar, Ahmed Rekik, Oussama Smaoui, Firas Bouzguenda, Sergi Pujades, Niels van Nistelrooij, Shankeeth Vinayahalingam, Kaibo Shi, Hairong Jin, Youyi Zheng, Tibor Kubík, Oldřich Kodym, Petr Šilling, Kateřina Trávníčková, Tomáš Mojžiš, Jan Matula, Jeffry Hartanto, Xiaoying Zhu, Kim-Ngan Nguyen, Tudor Dascalu, Huikai Wu, and Weijie Liu, Shaojie Zhuang, Guangshun Wei, Yuanfeng Zhou

机构 * Department of Oral Maxillofacial Surgery, Radboud University Medical Center, Geert Grooteplein Zuid 10, 6525 GA Nijmegen, Netherlands organization= State Key Lab of CAD\&CG, Zhejiang University, Hangzhou, 310058 , country= China organization= Department of Computer Graphics Multimedia, Brno University of Technology , city= Brno , country= Czech Republic text= National Dental Centre Singapore organization= Guangxi Colleges Universities Key Laboratory of Intelligent Software ,country= Wuzhou University text= National University of Singapore organization= Department of Computer Science , country = University of Copenhagen organization= School of Software, Shandong University , country= China Centre de Recherche en Num\' e rique de Sfax, Laboratory of Signals, Systems, Artificial Intelligence Inria, Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, France

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出3DTeethLand挑战,通过公开数据集评估牙齿标志检测算法,推动临床应用。挑战引入340个口内3D扫描数据,49支队伍参与,最终6支进入决赛,展示高精度与召回率的平衡方法。

Comments MICCAI 2024, 3DTeethLand, Challenge report, under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 4 篇

2604.25039 2026-04-29 cs.CL cs.AI 92%

Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs

双轨CoT:面向小语言模型的预算感知逐步引导

Sagnik Chatterjee, Atharva Patil, Sricharan Ramesh

专题命中 测试时计算 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双轨CoT方法,旨在通过预算感知的逐步引导提升小语言模型的多步推理能力,解决传统方法在计算和token预算限制下的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14174 2026-04-29 cs.CL cs.LG 88%

Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning

更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL

Yusuf Denizay Dönder, Derek Hommel, Andrea W Wen-Yi, David Mimno, Unso Eun Seo Jo

机构 * Gena Co.(Gena公司) Cornell University(康奈尔大学)

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL 79%

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25634 2026-04-29 cs.CR cs.CL 57%

The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive

大语言模型输出的令人惊讶的普遍性:一种实时验证原语

Alex Bogdan, Adrian de Valois-Franklin

机构 * Evolutionairy AI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大语言模型输出的词频分布符合Mandelbrot分布,提出一种无需GPU的快速验证方法,用于模型指纹识别和黑盒输出评估。

Comments 25 pages, 6 figures, 6 tables, 37 references. Code and data: https://github.com/Evolutionairy-AI/Ranking-Inference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 12 篇

2604.25276 2026-04-29 cs.CV 91%

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

OmniVTG:一种大规模数据集和开放世界视频时间定位的训练范式

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司中央媒体技术研究所) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究所)

专题命中 复杂问题求解 :chain-of-thought(summary_cn,abstract);self-correction(summary_cn,abstract);CoT(abstract,abstract_cn)

AI总结 本文提出OmniVTG数据集和Self-Correction Chain-of-Thought训练范式,通过语义覆盖迭代扩展管道构建大规模数据集,并利用多模态大语言模型的密集描述能力提升视频时间定位性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07499 2026-04-29 cs.CL cs.AI cs.LG 82%

When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs

当思维遇见事实:长上下文语言模型的可重用推理

Soyeong Jeong, Taehee Jung, Sung Ju Hwang, Joo-Kyung Kim, Dongyeop Kang

机构 * KAIST(韩国科学技术院) Amazon(亚马逊) University of Minnesota(明尼苏达大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Thought Templates用于长上下文语言模型的可重用推理,通过迭代更新策略提升多跳推理能力,并展示其在多种基准测试中的优越表现。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22154 2026-04-29 cs.AI cs.CL 81%

Exploring Reasoning Reward Model for Agents

探索用于智能体的推理奖励模型

Kaixuan Fan, Kaituo Feng, Manyuan Zhang, Tianshuo Peng, Zhixun Li, Yilei Jiang, Shuang Chen, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK 机器学习实验室) Meituan(美团) SEEM, CUHK(CUHK 系统工程与工程管理系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agent-RRM模型,通过结构化反馈提升智能体推理能力,采用三种集成策略在12个基准测试中取得显著性能提升。

Comments ACL 2026 Findings, Project page: https://github.com/kxfan2002/Reagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01070 2026-04-29 cs.CL 79%

How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning

如何通过强化学习解锁几何交错推理中的顿悟时刻

Xiangxiang Zhang, Caijun Jia, Siyuan Li, Dingyu He, Xiya Xiong, Zheng Sun, Honghao He, Yuchen Wu, Bihui Yu, Linzhuang Sun, Cheng Tan, Jingxuan Wei

机构 * ByteDance(字节跳动) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) Westlake University(西交大学) University of Chinese Academy of Science(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(教育部计算能力网络与信息安全重点实验室) Shandong Computer Science Center (National Supercomputer Center in Jinan)(山东省计算机科学中心(济南国家超算中心)) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文探讨了在几何交错推理中,通过强化学习框架Faire克服传统监督微调的局限性,实现更深层次的因果对齐,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05205 2026-04-29 cs.CL 79%

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

RELIC:通过上下文语言识别评估复杂推理

Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

机构 * Department of Linguistics(语言学系) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 RELIC通过评估语言是否属于上下文无关文法生成的语言,衡量LLM的复杂推理能力,发现先进模型在任务复杂度增加时推理计算减少,策略转向猜测。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21598 2026-04-29 cs.SE cs.AI 70%

You Don't Need Public Tests to Generate Correct Code

你不需要公共测试来生成正确代码

Kaushitha Silva, Srinath Perera

机构 * WSO2(WSO2公司)

专题命中 复杂问题求解 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出DryRUN框架,通过让大语言模型自主生成测试输入并模拟执行,避免依赖公共测试用例,从而减少过自信偏差并提升代码生成效率。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 67%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05110 2026-04-29 cs.AI 57%

GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts

GlimpRouter: 通过窥视一个思考标记实现高效的协作推理

Wenhao Zeng, Xuteng Zhang, Yuling Shi, Chao Hu, Yuting Chen, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GlimpRouter框架,通过分析推理步骤首个标记的熵值来决定是否调用大模型,从而减少推理延迟并保持精度。

Comments Accepted to ACL 2026 Findings. Code available at https://github.com/Zengwh02/GlimpRouter

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25506 2026-04-29 cs.NI cs.AI 57%

Assistants, Not Architects: The Role of LLMs in Networked Systems Design

助手,而非架构师:大语言模型在联网系统设计中的作用

Pratyush Sahu, Rahul Bothra, Venkat Arun, Brighten Godfrey, Akshay Narayan, Ahmed Saeed

机构 * Georgia Tech(佐治亚理工学院) UIUC(伊利诺伊大学香槟分校) UT Austin(得克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在联网系统架构设计中的局限性,并提出Kepler框架,结合专家驱动的规范与SMT优化,实现可行的设计方案并支持可解释的设计探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25296 2026-04-29 cs.CL 57%

Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

从医学实体树学习:一种以实体为中心的医疗数据工程框架用于多模态大语言模型

Jianghang Lin, Haihua Yang, Deli Yu, Kai Wu, Kai Ye, Jinghao Lin, Zihan Wang, Yuhang Wu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出以实体为中心的医疗数据工程框架,通过构建医学实体树,提升多模态大语言模型在医疗领域的表现,通过实体引导检索、双重过滤和知识感知数据合成等方法,增强模型处理复杂临床问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25256 2026-04-29 cs.AI 57%

AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery

AutoResearchBench:基于复杂科学文献发现的AI代理基准测试

Lei Xiong, Kun Luo, Ziyi Xia, Wenbo Zhang, Jin-Ge Yao, Zheng Liu, Jingying Shao, Jianlyu Chen, Hongjin Qian, Xi Yang, Qian Yu, Hao Li, Chen Yue, Xiaan Du, Yuyang Wang, Yesheng Liu, Haiyu Xu, Zhicheng Dou

机构 * AutoResearchBench Team(AutoResearchBench团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoResearchBench,用于评估AI代理在复杂科学文献发现中的能力,包含深度研究和广泛研究两种任务,相比现有代理网络浏览基准,其研究导向、文献聚焦和开放性特征使其更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25880 2026-04-29 cs.SE 50%

From Threads to Trajectories: A Multi-LLM Pipeline for Community Knowledge Extraction from GitHub Issue Discussions

从线程到轨迹:一个多LLM管道用于从GitHub问题讨论中提取社区知识

Nazia Shehnaz Joynab, Soneya Binta Hossain

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SWE-MIMIC-Bench数据集,通过多LLM管道从GitHub讨论生成问题轨迹,用于提取复杂问题的结构化知识,提升软件工程社区的协作理解与LLM训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 27 篇

2604.25231 2026-04-29 cs.CV cs.AI cs.CL 81%

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

DRAGON:一个用于基于证据的视觉推理的图示基准

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DRAGON基准评估模型在图示中基于证据的视觉推理能力,要求模型定位支持答案的视觉元素,包含图表、地图等,通过标注数据和评估框架检验八种最新视觉语言模型的定位能力。

Comments 22 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07101 2026-04-29 cs.CL cs.AI 81%

Less Is More: Fast and Accurate Reasoning with Cross-Head Unified Sparse Attention

少即是多:基于交叉头统一稀疏注意力的快速准确推理

Lijie Yang, Zhihao Zhang, Arti Jain, Shijie Cao, Baihong Yuan, Yiwei Chen, Zhihao Jia, Ravi Netravali

机构 * DeepSeek-AI DeepMind OpenAI Team

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LessIsMore方法,通过交叉头统一稀疏注意力机制提升长 horizon 推理效率,减少 token 数量同时保持高精度,实现更快的端到端解码速度和稀疏注意力计算速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 79%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 79%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00756 2026-04-29 cs.AI 79%

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents

MPR-GUI:多语言感知与推理GUI代理的基准测试与增强

Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MPR-GUI-Bench,通过六种语言和八个细粒度任务评估多语言GUI代理的感知与推理能力,并提出GUI-XLI方法以缩小跨语言差距。

Comments 35pages, 15figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 79%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 79%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25399 2026-04-29 cs.SE 78%

CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction

CoRE:超越输出预测的细粒度代码推理基准

Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CoRE基准通过实现不变性和过程透明性评估代码推理,揭示大语言模型在等价实现间存在显著鲁棒性差距,并发现模型可能通过表面执行达到正确输出,表明仅评估输出不足以衡量代码推理能力。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21304 2026-04-29 cs.IR 78%

PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs

PaperMind:多模态大语言模型中科学论文代理推理与批判的基准测试

Yanjun Zhao, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He

专题命中 推理评测 :reasoning(title,abstract)

AI总结 PaperMind通过整合多模态信息和跨源推理,评估科学论文的综合推理能力,揭示多模态大语言模型在科学推理和批判中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 73%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24964 2026-04-29 cs.LG cs.CL 73%

Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks

Odysseys:在现实长周期任务上评估网络代理

Lawrence Keunho Jang, Jing Yu Koh, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Odysseys基准,通过200个现实浏览任务评估长周期网络代理,引入基于评分的评估方法,发现传统二元评估不足,且前沿模型在效率上仍有提升空间。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏