Auditing Semantic Gains in Sequential Recommendation: A Lightweight Recovery Test
审计序列推荐中的语义增益:一种轻量级恢复测试
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出轻量级可审计恢复测试LIME-Rec,结合三类专家模型在三个Amazon数据集上验证语义推荐增益源于真实物品-文本对应,为序列推荐的语义增益归因提供了透明方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
审计序列推荐中的语义增益:一种轻量级恢复测试
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出轻量级可审计恢复测试LIME-Rec,结合三类专家模型在三个Amazon数据集上验证语义推荐增益源于真实物品-文本对应,为序列推荐的语义增益归因提供了透明方法。
以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。
面向LLM智能体的实用在线KV缓存压缩:一项实证研究
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; LinkedIn(领英公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。
使用具有交易成本意识的大语言模型模拟租户对能源政策干预的反应
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Ollama(奥拉马)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究利用感知交易成本,开发摩擦感知角色建模方法,以模拟租户对能源政策干预的反应。通过荷兰公民调查数据,比较不同模型和设置,发现纳入该方法能提升模型性能,为政策理论与LLM政策模拟搭建桥梁。
LLM 能否可靠地自我报告对抗性预填充,以及如何实现?
机构 * KAIST(韩国科学技术院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。
Comments Under review
SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Texas A&M University(德克萨斯大学) ; Smart Information Flow Technologies (SIFT)(智能信息流技术公司) ; Kudu Dynamics(Kudu动态公司) ; Microsoft(微软)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。
Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)
Journal ref USENIX Security 2026
弥合认知鸿沟:面向6G智能AI-RAN的统一记忆范式
机构 * Sun Yat-sen University, China(中山大学,中国) ; Zhejiang University, China(浙江大学,中国) ; University of Exeter, U.K.(埃克塞特大学,英国) ; Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) ; Purple Mountain Laboratories, Nanjing, China(紫金山实验室,南京,中国)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种统一记忆范式,通过将生物记忆层次映射到异构计算架构,弥合感知与推理之间的鸿沟,实现6G网络中自主决策的跨时间尺度状态共享。
Comments This work has been submitted to the IEEE for possible publication
LLM API中的令牌高效变化检测
机构 * Université de Rennes, Inria, CNRS/IRISA(里昂大学、法国国家信息与自动化技术研究院、法国国家科学研究中心/IRISA) ; Equipe Regalia, Inria(Regalia团队、法国国家信息与自动化技术研究院) ; LAAS, CNRS(拉劳斯研究中心、法国国家科学研究中心) ; Univ Toulouse, INUC, UT2J, INSA Toulouse, TSE, CNRS, IMT(图卢兹大学、INUC、UT2J、图卢兹国家高等工业学院、TSE、法国国家科学研究中心、IMT)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 提出基于边界输入的黑盒变化检测方案B3IT,在仅观察输出令牌的条件下实现低成本、高性能的LLM变化检测。
Comments ICML 2026
用于语言模型预训练的课程引导层缩放
机构 * Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 受人类认知发展启发,提出课程引导层缩放框架,通过渐进式层堆叠使数据难度与模型增长同步,在不同参数规模预训练并分层数据,提升模型泛化及零样本性能。
Comments Accepted to ICML 2026. Code available at https://github.com/su-karanps/cgls
在想象之翼上:用于幽默标题生成的冲突脚本多角色框架
机构 * Hong Kong Baptist University(香港 Baptist 大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。
Comments Paper published as a conference paper at ICLR 2026
OBLR-PO:大型语言模型后训练稳定强化学习的理论框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 OBLR-PO通过理论框架优化学习率和基线,提升大型语言模型后训练的稳定性与性能。
Comments 28 pages, 16 figures
十年深度学习在无线通信中的应用:从学习模块到可部署的无线智能
专题命中 其他推理 :reasoning(abstract)
AI总结 本文梳理了十年间深度学习在无线通信领域从替代孤立模块到开发无线智能的三次转变,指出未来无线AI发展需结合物理基础、智能体能力与标准化机制。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
机构 * Alibaba Group(阿里巴巴集团)
专题命中 其他推理 :reasoning(abstract)
AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。
Comments 29 pages
结合先进深度学习技术的优势,从无人机影像中评估灾后建筑物损毁情况
机构 * KDDI Research, Inc.(KDDI研究所)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出将CV模型与LVLM结合的混合框架,在RescueNet、FloodNet基准上评估,可准确统计灾后建筑物损毁情况,性能优于单独基准模型且仅需少量标注数据,相关资源公开。
Comments Accepted at ECMLPKDD 2026, 31 pages (including appendix), 18 figures
HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统
专题命中 其他推理 :reasoning(abstract)
AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。
变异规避:基于知识驱动多智能体编排的自主端点规避
专题命中 其他推理 :reasoning(abstract)
AI总结 研究针对商用EDR系统的自动化弹性评估难题,提出AutoBypass多智能体框架,经实验可高比例绕过多款商用EDR,还能提升开源模型的规避成功率。
面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界
专题命中 其他推理 :reasoning(abstract)
AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。
大型音频语言模型综述:通用性、可信度与展望
机构 * Nanyang Technological University(南洋理工大学) ; Independent Researcher(独立研究者) ; The University of Melbourne(墨尔本大学) ; North China Electric Power University(华北电力大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai AI Laboratory(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; Fortemedia Singapore(富媒体新加坡) ; Tencent(腾讯) ; Fudan University(复旦大学) ; Wuhan University(武汉大学) ; Chinese University of Hong Kong(香港中文大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。
图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境
机构 * Tsinghua University(清华大学) ; Beijing University of Technology(北京工业大学)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。
DriveCode: 针对基于LLM的自动驾驶的领域特定数值编码
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; The School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; DiDi, Beijing, China(滴滴出行) ; State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出DriveCode,一种将数字表示为专用嵌入而非离散文本标记的新型数值编码方法,提升LLM在自动驾驶中的数值推理与解码效率。
Comments The project page is available at https://shiftwilliam.github.io/DriveCode