arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-24 至 2026-06-24 共收录 113 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 9 篇

2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23997 2026-06-24 cs.IR 新提交 50%

ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs

ChartWalker: 跨图表RAG任务的基准测试

Ning Tang, Chenghan Xie, Hanyang Yuan, Yi Li, Renhong Huang, Qian Kou, Xiaofeng Shi, Hua Zhou, Jiarong Xu

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22337 2026-06-24 econ.TH cs.GT econ.GN q-fin.EC 新提交 50%

Theorist Toolbox: Tools for Agent Based LLM-assisted economic theory Research

理论家工具箱:基于智能体的LLM辅助经济理论研究工具

Moran Koren

专题命中 测试时计算 :verifier(abstract)

AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 10 篇

2605.01482 2026-06-24 cs.AI 版本更新 85%

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

通过群体相对策略优化在结构因果模型中 grounding 多跳推理

Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract_cn);分类 cs.AI

AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00869 2026-06-24 cs.CL 版本更新 79%

What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难

Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Texas A&M University(德克萨斯A&M大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04460 2026-06-24 cs.AI 版本更新 79%

From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control

从“顿悟时刻”到可控思考:通过解耦推理与控制实现大型推理模型中的元认知推理

Rui Ha, Rui Pu, Chaozhuo Li, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对大型推理模型过度思考问题,提出元认知推理框架MERA,通过解耦推理与控制、构建推理-控制交替序列训练,结合控制段策略优化,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24626 2026-06-24 cs.AI 新提交 57%

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

SAFARI: 通过主动调查扩展长时域智能体故障归因

Chenyang Zhu, Jiayu Yao, Kushal Chawla, Youbing Yin, Nathan Wolfe, Pengshan Cai, Jingyu Wu, Spencer Hong, Sangwoo Cho, Shi-Xiong Zhang, Daben Liu, Sambit Sahu, Erin Babinsky

机构 * Department of Engineering Sciences(工程科学系) Applied Mathematics, Northwestern University(应用数学,西北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出SAFARI框架,用工具增强的诊断循环替代线性上下文加载,结合短期记忆解耦诊断准确性与上下文限制,在Who&When和TRAIL GAIA数据集上分别提升20%和19%,并在超出上下文窗口5倍时保持0.58精度。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23759 2026-06-24 cs.AR cs.AI cs.SE 新提交 57%

VeriPilot: An LLM-Powered Verilog Debugging Framework

VeriPilot:一个基于LLM的Verilog调试框架

Yihan Wang, Cheng Liu, Jiazheng Zhang, Lei Zhang, Long Cheng, Xiaowei Li, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所国家专用集成电路设计实验室) University of Chinese Academy of Sciences(中国科学院大学) North China Electric Power University(华北电力大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VeriPilot框架,利用黄金参考模型和LLM实现细粒度Verilog调试,通过内部变量语义对齐和CDFG信号追踪定位并修复错误,在CVDP基准上将GPT-4o修复成功率从54.3%提升至85.71%。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03742 2026-06-24 cs.CL cs.DB 版本更新 57%

ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement

ErrorLLM: 为文本到SQL精炼建模SQL错误

Zijin Hong, Hao Chen, Zheng Yuan, Qinggang Zhang, Luyao Zhuang, Qing Liao, Feiran Huang, Yangqiu Song, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Macau(澳门城市大学) Jilin University(吉林大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beihang University(北航大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 提出ErrorLLM框架,通过专用错误令牌和结构特征显式建模SQL错误,结合静态检测与错误引导精炼,显著提升文本到SQL生成质量。

Comments Accepted to SIGKDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06138 2026-06-24 cs.MM cs.AI cs.HC 版本更新 57%

Multimedia and Visual Analytics in the Agentic Era

代理时代的多媒体与可视化分析

Marcel Worring, Jan Zahálka, Stef van den Elzen, Maximilian T. Fischer, Daniel A. Keim

机构 * University of Amsterdam(阿姆斯特丹大学) Czech Technical University in Prague(布拉格捷克技术大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个框架,将多媒体与可视化分析结合,以支持专业用户从大规模多媒体集合中获取可操作见解,实现人类与AI的真正协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24094 2026-06-24 cs.CV 新提交 50%

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

通用指南驱动图像聚类:基于混合LLM代理

Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarmane, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23866 2026-06-24 cs.LO 新提交 50%

Complex Autonomous UAV Task Execution and Decision-Making With s(CASP)

基于s(CASP)的复杂自主无人机任务执行与决策

Keegan Kimbrell, Alexis R. Tudor, Peter Van, Trevor Bihl, Doug Slattery, Gopal Gupta

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出使用s(CASP)回答集编程系统构建符号状态中心的无人机代理,在虚幻引擎5环境中实现基于约束的常识推理,支持多步骤自主行为并动态调整计划,确保决策正确可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 50%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 31 篇

2606.24759 2026-06-24 cs.CV cs.AI 新提交 81%

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye

机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom organization= SpaceTimeLab, Department of Civil, Environmental Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom

专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24391 2026-06-24 cs.AI cs.CL cs.GT cs.MA 新提交 81%

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试

Arnaud Ricci

机构 * Independent researcher, Switzerland(瑞士独立研究员)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。

Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交 79%

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24526 2026-06-24 cs.CL 新提交 79%

AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning

AGORA:基于档案的智能体工作场所文档推理基准

Honglin Guo, Qi Zhang, Yu Zhang, Weijie Li, Rui Zheng, Zhikai Lei, Qiyuan Peng, Zhiheng Xi, Tao Gui, Qi Zhang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Qiji Zhifeng Co., Ltd.(上海奇绩智峰有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出AGORA基准,包含362个问题、8个领域共9664份真实文档(3.72亿词元),要求智能体在超大档案中主动搜索稀疏证据并推理答案,最强模型准确率仅59.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23716 2026-06-24 cs.CY cs.AI 新提交 79%

Legal Reasoning Is Not Lawyering: Rethinking Legal Benchmarks for Pro Se Access to Justice

法律推理不是律师工作:重新思考面向自助诉讼的司法基准

Andrew Lou, David Shin

机构 * Yale Law School, USA(耶鲁法学院,美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文指出当前法律AI基准仅评估专家预处理后的输入,忽略了自助诉讼者提供的杂乱、有误的提示,导致模型性能高估;通过实验展示上下界差距,呼吁建立直接衡量鲁棒性的基准。

Comments Both authors contributed equally. Accepted to the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24596 2026-06-24 cs.CL 新提交 77%

To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

比较还是不比较:论评估社会偏见的方法论实践

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych

机构 * Tsinghua University(清华大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普适知识处理实验室(UKP Lab),计算机科学系,达姆施塔特工业大学及国家应用网络安全研究中心ATHENE)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 提出统一框架标准化异构基准,揭示孤立评估与强制比较设置间的系统性范式差距,发现比较设置会催化潜在歧视,且链式思维推理加剧偏见,规模越大偏见越强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23695 2026-06-24 cs.CL cs.AI 新提交 73%

Quantifying Prior Dominance in RAG Systems

量化RAG系统中的先验主导性

Barak Or

机构 * ArtificialGate Ltd.(ArtificialGate有限公司)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出归一化上下文利用(NCU)指标,通过连续token对数概率严格量化RAG系统的上下文信息增益,发现小语言模型在严格事实提取中匹配或超越大模型,且先验主导性与模型规模及专有对齐相关。

Comments 15 pages, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10971 2026-06-24 cs.CL cs.AI 版本更新 73%

Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules

Rule2Text:知识图谱规则的自然语言解释生成与评估框架

Nasim Shirvani-Mahdavi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出Rule2Text框架,利用大语言模型将知识图谱挖掘的逻辑规则转化为自然语言解释,通过人类评估和LLM-as-a-judge验证,微调开源模型显著提升解释质量。

Comments arXiv admin note: text overlap with arXiv:2507.23740

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24747 2026-06-24 cs.AI cs.CE 新提交 70%

Scaling Laws for Task-Specific LLM Distillation

任务特定LLM蒸馏的缩放定律

Lavinia Ghita, Dhruv Desai, Ioana Boier

机构 * NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文推导了领域特定LLM压缩的经验缩放定律,通过定量金融领域的实验,比较了基于logit和LoRA的蒸馏方法,并引入混合思维链监督损失,揭示了监督格式对领域知识与通用知识权衡的关键作用。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 70%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24083 2026-06-24 cs.CL cs.AI cs.LG 新提交 67%

CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

CAVEWOMAN: 大型语言模型在语言输入和输出压缩下的行为

Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt

机构 * Independent(独立研究者) Adobe Research(Adobe研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道评估协议CAVEWOMAN,发现输出压缩降低API模型成本(1.4-2.4倍),输入压缩反而增加成本(~1.15倍)并导致准确率下降和文本偏离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18648 2026-06-24 physics.comp-ph 新提交 67%

Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

物理科学中的深度研究:多智能体框架与综合基准

Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang, Weida Wang, Zhiyu Liu, Chuyi Peng, Binzhao Luo, Maoli Gao, Huaihai Huang, Yuqianer Zeng, Ziyang Zheng, Dongchen Huang, Chao Chen, Zichao Liu, Weiping Shen, Shuchen Pu, Siyu Zhou, Runmin Ma, Yusong Hu, Fei Chao, Bo Zhang, Xiawu Zheng, Zifu Wang, Lei Bai, Yunqi Cai, Shufei Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 提出PhySciBench基准评估LLM在物理科学中的深度研究能力,并开发DelveAgent多智能体框架,通过自适应规划、双粒度记忆和分层反思机制提升准确率并降低推理成本。

Comments v3: fix error and add data, codes publicly link on Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10044 2026-06-24 cs.AI cs.CL cs.CY cs.LG 67%

Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety

脚手架下的安全性:评估条件如何影响测量的安全性

David Gringras

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过62,808次盲法预注册评估,测试了六种前沿模型在四种部署配置下的安全性,发现脚手架架构对安全性影响较小,而格式转换(如选择题与开放式问题)可导致5-20个百分点的测量差异,且模型-脚手架间存在显著异质性,质疑了单一综合安全性分数的实用性。

Comments 74 pages including appendices. 6 frontier models, 62,808 primary observations (~89k total). Pre-registered: OSF DOI 10.17605/OSF.IO/CJW92. Code and data: https://github.com/davidgringras/safety-under-scaffolding

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01752 2026-06-24 cs.LG cs.AI cs.CL cs.CR 版本更新 67%

Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training

无窥调优:可证明的泛化边界与鲁棒的大语言模型后训练

Ismail Labiad, Mathurin Videau, Matthieu Kowalski, Marc Schoenauer, Alessandro Leite, Julia Kempe, Olivier Teytaud

机构 * Meta FAIR LISN, Inria, CNRS(LISN,Inria,CNRS) NYU Courant Institute(NYU Courant学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BBoxER黑盒进化方法用于LLM后训练,通过隐式压缩数据诱导信息瓶颈,提供非平凡泛化边界和对数据投毒、提取攻击的鲁棒性理论保证,实验证明其有效性和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06802 2026-06-24 cs.AI 版本更新 65%

Riemann-Bench: A Benchmark for Moonshot Mathematics

Riemann-Bench: 面向登月级数学的基准测试

Suhaas Garre, Erik Knutsen, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI;logical reasoning(comments)

AI总结 提出Riemann-Bench基准,由专家设计研究级数学问题,评估AI系统超越奥数水平的推理能力,结果显示前沿模型得分低于10%。

Comments Accepted to Logical Reasoning of Large Language Models, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24589 2026-06-24 cs.AI cs.CL 新提交 62%

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试

Khanak Khandelwal

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。

Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24033 2026-06-24 cs.LG cs.CL 新提交 62%

RoPE-Aware Bit Allocation for KV-Cache Quantization

RoPE感知的KV缓存量化比特分配

Fengfeng Liang, Yuechen Zhang, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) MiMo, Xiaomi Corporation(小米集团 MiMo)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对RoPE下键缓存量化中不同频率块对误差敏感度不同的问题,提出Block-GTQ比特分配器,通过能量评分和贪心分配提升量化精度,在长上下文任务中显著恢复性能。

Comments Preprint. Code available at https://github.com/JIA-Lab-research/blockgtq

详情

展开后加载摘要…

URL PDF HTML 收藏