arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 260 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 34 篇

2608.01260 2026-08-04 cs.IR cs.AI 新提交 57%

Auditing Semantic Gains in Sequential Recommendation: A Lightweight Recovery Test

审计序列推荐中的语义增益:一种轻量级恢复测试

Kong Wang, Zhongke He, Xiang Chen, Hongwei Zeng, Kai Deng, Long Wang, Kehua Yang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出轻量级可审计恢复测试LIME-Rec,结合三类专家模型在三个Amazon数据集上验证语义推荐增益源于真实物品-文本对应,为序列推荐的语义增益归因提供了透明方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01112 2026-08-04 cs.AI 新提交 57%

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究

Tobias Braun, Jonas Grebe, Louis Rethfeld, Marcus Rohrbach

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00902 2026-08-04 cs.CL 新提交 57%

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

面向LLM智能体的实用在线KV缓存压缩:一项实证研究

Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) LinkedIn(领英公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24341 2026-08-04 cs.AI 版本更新 57%

Simulating Tenant Responses to Energy Policy Interventions with Transaction-Cost-Aware LLM Agent

使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应

Weijie Xia, Stefanie Horian, Hanyue Huang, Queena K. Qian, Jie Yang, Pedro P. Vergara

机构 * Mistral AI(米斯特拉尔人工智能公司) Ollama(奥拉马)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23671 2026-08-04 cs.CL 版本更新 57%

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

LLM 能否可靠地自我报告对抗性预填充,以及如何实现?

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim

机构 * KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07666 2026-08-04 cs.CR cs.AI 版本更新 57%

SoK: DARPA's AI Cyber Challenge (AIxCC): Competition Design, Architectures, and Lessons Learned

SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训

Cen Zhang, Younggi Park, Fabian Fleischer, Yu-Fu Fu, Jiho Kim, Dongkwan Kim, Youngjoon Kim, Qingxiao Xu, Andrew Chin, Ze Sheng, Hanqing Zhao, Michael Pelican, David J. Musliner, Jeff Huang, Jon Silliman, Mikel Mcdaniel, Jefferson Casavant, Isaac Goldthwaite, Nicholas Vidovich, Matthew Lehman, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德克萨斯大学) Smart Information Flow Technologies (SIFT)(智能信息流技术公司) Kudu Dynamics(Kudu动态公司) Microsoft(微软)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。

Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)

Journal ref USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10036 2026-08-04 cs.NI cs.AI 版本更新 57%

Bridging the Cognitive Gap: A Unified Memory Paradigm for 6G Agentic AI-RAN

弥合认知鸿沟:面向6G智能AI-RAN的统一记忆范式

Xijun Wang, Zhaoyang Liu, Chenyuan Feng, Xiang Chen, Howard H. Yang, Tony Q. S. Quek

机构 * Sun Yat-sen University, China(中山大学,中国) Zhejiang University, China(浙江大学,中国) University of Exeter, U.K.(埃克塞特大学,英国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) Purple Mountain Laboratories, Nanjing, China(紫金山实验室,南京,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种统一记忆范式,通过将生物记忆层次映射到异构计算架构,弥合感知与推理之间的鸿沟,实现6G网络中自主决策的跨时间尺度状态共享。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11083 2026-08-04 cs.LG cs.CR 版本更新 57%

Token-Efficient Change Detection in LLM APIs

LLM API中的令牌高效变化检测

Timothée Chauvin, Clément Lalanne, Erwan Le Merrer, Jean-Michel Loubes, François Taïani, Gilles Tredan

机构 * Université de Rennes, Inria, CNRS/IRISA(里昂大学、法国国家信息与自动化技术研究院、法国国家科学研究中心/IRISA) Equipe Regalia, Inria(Regalia团队、法国国家信息与自动化技术研究院) LAAS, CNRS(拉劳斯研究中心、法国国家科学研究中心) Univ Toulouse, INUC, UT2J, INSA Toulouse, TSE, CNRS, IMT(图卢兹大学、INUC、UT2J、图卢兹国家高等工业学院、TSE、法国国家科学研究中心、IMT)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出基于边界输入的黑盒变化检测方案B3IT,在仅观察输出令牌的条件下实现低成本、高性能的LLM变化检测。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11389 2026-08-04 cs.CL 版本更新 57%

Curriculum-Guided Layer Scaling for Language Model Pretraining

用于语言模型预训练的课程引导层缩放

Karanpartap Singh, Neil Band, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 受人类认知发展启发,提出课程引导层缩放框架,通过渐进式层堆叠使数据难度与模型增长同步,在不同参数规模预训练并分层数据,提升模型泛化及零样本性能。

Comments Accepted to ICML 2026. Code available at https://github.com/su-karanps/cgls

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06423 2026-08-04 cs.CL 版本更新 57%

On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation

在想象之翼上:用于幽默标题生成的冲突脚本多角色框架

Wenbo Shang, Yuxi Sun, Jing Ma, Xin Huang

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。

Comments Paper published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23310 2026-08-04 stat.ML cs.LG 版本更新 57%

Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards

OBLR-PO:大型语言模型后训练稳定强化学习的理论框架

Zixun Huang, Jiayi Sheng, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 OBLR-PO通过理论框架优化学习率和基线,提升大型语言模型后训练的稳定性与性能。

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01747 2026-08-04 eess.SP 新提交 50%

Ten Years of Deep Learning for Wireless Communications: From Learned Blocks to Deployable Wireless Intelligence

十年深度学习在无线通信中的应用:从学习模块到可部署的无线智能

Hao Ye, Geoffrey Ye Li, Biing-Hwang Juang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文梳理了十年间深度学习在无线通信领域从替代孤立模块到开发无线智能的三次转变,指出未来无线AI发展需结合物理基础、智能体能力与标准化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01964 2026-08-04 cs.CV 新提交 50%

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

LongHorizon-Harness:推进面向真实世界任务的长时程智能体

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01906 2026-08-04 cs.CV 新提交 50%

Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery

结合先进深度学习技术的优势,从无人机影像中评估灾后建筑物损毁情况

Huy Quang Ung, Guillaume Habault, Roberto Legaspi, Hao Niu, Lian Cao, Masato Taya

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出将CV模型与LVLM结合的混合框架,在RescueNet、FloodNet基准上评估,可准确统计灾后建筑物损毁情况,性能优于单独基准模型且仅需少量标注数据,相关资源公开。

Comments Accepted at ECMLPKDD 2026, 31 pages (including appendix), 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01785 2026-08-04 cs.DC 新提交 50%

HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving

HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统

Yuning Zhang, Dong Yuan

专题命中 其他推理 :reasoning(abstract)

AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01639 2026-08-04 cs.CR cs.OS 新提交 50%

Mutate to Bypass: Autonomous Endpoint Evasion via Knowledge-Driven Multi-Agent Orchestration

变异规避:基于知识驱动多智能体编排的自主端点规避

Weifeng Yuan, Wenbo Guo, Qingyun Du, Jun Chen, Feng Dong, Haoyu Wang, Yang Liu

专题命中 其他推理 :reasoning(abstract)

AI总结 研究针对商用EDR系统的自动化弹性评估难题,提出AutoBypass多智能体框架,经实验可高比例绕过多款商用EDR,还能提升开源模型的规避成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01526 2026-08-04 cs.NI 新提交 50%

An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界

Siddhant Ray, Nick Feamster, Junchen Jiang

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新 50%

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11025 2026-08-04 cs.CV 版本更新 50%

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00919 2026-08-04 cs.CV cs.RO 版本更新 50%

DriveCode: Domain Specific Numerical Encoding for LLM-Based Autonomous Driving

DriveCode: 针对基于LLM的自动驾驶的领域特定数值编码

Zhiye Wang, Yanbo Jiang, Rui Zhou, Bo Zhang, Fang Zhang, Zhenhua Xu, Yaqin Zhang, Jianqiang Wang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) The School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) DiDi, Beijing, China(滴滴出行) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出DriveCode,一种将数字表示为专用嵌入而非离散文本标记的新型数值编码方法,提升LLM在自动驾驶中的数值推理与解码效率。

Comments The project page is available at https://shiftwilliam.github.io/DriveCode

详情

展开后加载摘要…

URL PDF HTML 收藏