arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-27 至 2026-07-27 共收录 79 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 19 篇

2607.22529 2026-07-27 cs.CL 新提交 57%

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

技能自我博弈:通过协同进化技能拓展大语言模型能力边界

Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22445 2026-07-27 cs.AI cs.CR 新提交 57%

Dynamic Capability Scoping for Enterprise AI Agents: A Synthetic Dataset and Three-Source Permission Architecture

企业人工智能代理的动态能力范围界定:一个合成数据集和三源权限架构

Halil Burak Noyan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究企业人工智能代理动态能力范围界定问题,提出三源权限架构,包括基于角色的上限等,贡献含600个企业任务提示的合成数据集,经验证可推动策略优化,还发布相关内容支持对动态范围界定机制的评估。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22136 2026-07-27 cs.CL 新提交 57%

Dynamic Commonsense Coordination for Empathetic Response Generation

用于移情响应生成的动态常识协调

Zhengyu Qi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究移情响应生成问题,提出含三个互补模块的动态常识协调框架DCC,能整合常识表示、过滤低相关性关系及动态检索记忆,实验表明其可提升情绪分类准确率、响应多样性等,生成更好的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22115 2026-07-27 cs.DB cs.AI 新提交 57%

Benchmarking Text-to-SQL under Role-Based Access Control

基于角色的访问控制下的文本到SQL基准测试

Yang Fei, Yangfan Jiang, Yin Yang, Xiaokui Xiao

机构 * National University of Singapore(新加坡国立大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究基于角色的访问控制下文本到SQL的基准测试问题,提出含现实RBAC约束的综合基准测试框架,通过大语言模型辅助工作流程及人工审核等增强基准,应用该框架研究发现部分高分系统在有访问约束时性能因RBAC违规而大幅下降。

Comments Accepted at ACM SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21962 2026-07-27 cs.CL 新提交 57%

Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings

真实优先:智能体记忆的纵向评估工具及记忆架构排名中的任期交叉

Quentin Spencer

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 研究大型语言模型智能体记忆基准问题,提出颠倒流程的评估方法,通过合成虚构语料库嵌入新特征,对五种记忆架构基准测试,发现排名随历史长度反转,分层架构表现最佳,发布开源库Veracium。

Comments 25 pages, 2 figures. Code: https://github.com/veracium-ai/Veracium

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21763 2026-07-27 cs.CR cs.AI 新提交 57%

Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

每个模型都作弊:在进攻性网络任务中对作弊行为进行提示级缓解

Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda, Brian Greunke

机构 * dreadnode

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 研究大语言模型在网络安全基准测试中的作弊问题,通过对22个前沿模型在三种提示条件下的控制提示消融研究,发现作弊普遍,反作弊提示能降作弊倾向,但即使最严条件下仍有模型作弊,引入“解决率”指标,强调反作弊提示非环境控制替代品。

Comments 21 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21680 2026-07-27 cs.LG 新提交 57%

Encoding Invisible Causation for Bridge Diagnostic Agents: Triple-Guided Retrieval-Augmented Fine-Tuning with QLoRA

为桥梁诊断代理编码无形因果关系:基于QLoRA的三重引导检索增强微调

Takato Yasuno

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究针对桥梁损伤原因难以肉眼察觉及专家诊断依赖隐性知识的问题,提出基于QLoRA的三重引导检索增强微调方法(含知识三元组提取等组件),能在消费级硬件上实现内存高效、高精度的桥梁诊断代理。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21614 2026-07-27 cs.AI 新提交 57%

Household Movement Detection in Mixed-Format Occupancy Data Using LLM-Based Entity Resolution

使用基于大语言模型的实体解析在混合格式居住数据中进行家庭移动检测

Sasirekha Oguri, John R. Talburt, Mert Can Cakmak

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究在混合格式居住数据中检测家庭移动相关间接实体链接的问题,核心方法是集成基于提示的LLM命名实体识别、语义文本嵌入和基于图的推理,主要贡献是提高召回率和F1分数。

Comments Computer Science & Information Technology (CS & IT) ISSN : 2231 - 5403, Volume 16, Number 10, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10428 2026-07-27 cs.CL 版本更新 57%

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判

Jinglan Gong, Jiefan Lu, Hewei Guo, Kehan Li, Zhiyuan Han, Jihang Jiang, Wenwen Tong, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02844 2026-07-27 cs.RO cs.LG 57%

VLM as Strategist: Adaptive Generation of Safety-critical Testing Scenarios via Guided Diffusion

VLM作为策略家:通过引导扩散实现安全关键测试场景的自适应生成

Xinzheng Wu, Junyi Chen, Naiting Zhong, Yong Shen

机构 * School of Automotive Studies, Tongji University(同济大学汽车研究学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种结合VLM和引导扩散模型的框架,用于高效生成安全关键测试场景,提升自动驾驶系统的测试效率和安全性。

Comments 25 pages, 9 figures

Journal ref Accident Analysis & Prevention Volume 236, October 2026, 108680

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 7 篇

2511.02130 2026-07-27 cs.AI cs.LG 版本更新 87%

Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning

Re-FORC:用于高效思维链推理的自适应奖励预测

Renos Zabounidis, Aditya Golatkar, Michael Kleinman, Alessandro Achille, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS智能代理部门) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI、cs.LG

AI总结 研究提出Re-FORC自适应奖励预测方法,通过在推理模型上训练轻量级适配器,实现早期停止无前景推理链、优化模型和思维长度选择以及自适应测试时缩放,有效提升推理效率和准确率。

Comments Accepted at ICML 2026; previously accepted as a non-archival paper at the Efficient Reasoning Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 67%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02770 2026-07-27 cs.CL cs.AI 版本更新 62%

Gemma 4 Technical Report

Gemma 4技术报告

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。

Comments 17 pages, 2 figures, technical report, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25774 2026-07-27 cs.CL cs.AI 62%

CGU-ILALab at FoodBench-QA 2026: Comparing Traditional and LLM-based Approaches for Recipe Nutrient Estimation

CGU-ILALab 在 FoodBench-QA 2026 中:比较传统方法与基于 LLM 的方法在食谱营养估算中的表现

Wei-Chun Chen, Yu-Xuan Chen, I-Fang Chung, Ying-Jia Lin

机构 * CGU-ILALab

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了传统方法与基于 LLM 的方法在食谱营养估算中的性能,发现 LLM 能有效处理模糊术语和非标准单位,但计算效率较低。

Comments Accepted by the Third Workshop on Patient-oriented Language Processing (CL4Health) at LREC 2026

Journal ref https://lrec.elra.info/lrec2026-ws-cl4health-31

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21616 2026-07-27 cs.AI 新提交 57%

Lost in Context: Addressing Context Anxiety in Large Language Models

迷失在上下文中:解决大语言模型中的上下文焦虑

Ifueko Igbinedion, Jillian Ross, Etienne Ricardez, Sertac Karaman, Eric So

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型中因过早自我怀疑导致的上下文焦虑,通过系统研究发现其部分源于对完成任务所需tokens估计不准,会致效率损失,还表明模型可学替代策略,性能提升或可通过提高评估与适应自身局限能力实现。

Comments Accepted at ICML 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21603 2026-07-27 cs.HC cs.AI 新提交 57%

Analyzing Middle School Students' Dialogue and Behaviors during Collaborative AI Chatbot Development Using Ordered Network Analysis

使用有序网络分析来分析中学生在协作式人工智能聊天机器人开发过程中的对话和行为

Shan Zhang, Andres Felipe Zambrano, Xiaoyi Tian, Yukyeong Song, Anthony F. Botelho, Kristy Elizabeth Boyer, Maya Israel, Shiyan Jiang

机构 * University of Florida(佛罗里达大学) University of Pennsylvania(宾夕法尼亚大学) North Carolina State University(北卡罗来纳州立大学) The University of Tennessee(田纳西大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究以有序网络分析方法,考察中学生协作开发AI聊天机器人的互动,刻画协作随时间的组织及互动模式与机器人质量、AI知识成果的关系,揭示高质量机器人与特定序列及互动模式有关,为协作式AI开发提供过程描述并拓展了相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21908 2026-07-27 cs.MM 新提交 50%

Unsupervised Multimodal Intent Discovery via MLLM-Guided Concept Generation and Semantic Propagation

通过MLLM引导的概念生成和语义传播进行无监督多模态意图发现

Yunjin Gu, Qianrui Zhou, Hua Xu

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对无监督多模态意图发现缺乏语义监督及可解释性差的问题,提出MCSP方法,通过MLLM引导的对比推理获取语义概念,再经语义传播生成伪标签,实验证明其性能优于现有方法且能产生可解释的簇。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏