arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 486 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 486 篇

2606.07526 2026-06-09 cs.CL cs.AI 新提交 62%

GraphLoRA: Structure-Aware Low-Rank Adaptation for Large Language Model Recommendation

GraphLoRA: 面向大语言模型推荐的结构感知低秩适配

Lin Mu, Guoji Wang, Li Ni, Lei Sang, Zhize Wu, Peiquan Jin, Yiwen Zhang

机构 * Anhui University(安徽大学) Hefei University(合肥大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出GraphLoRA框架,通过在低秩适配路径中嵌入可训练的图消息传递网络,实现结构信号传播,从而深度融合图结构与文本语义,提升LLM推荐性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13472 2026-08-14 eess.SY cs.AI cs.SY 新提交 57%

AaLLM: An End-to-End Analog Circuit Design Framework from Topology Generation to Sizing Using Large Language Models

AaLLM:基于大语言模型的从拓扑生成到尺寸确定的端到端模拟电路设计框架

Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AaLLM,一种端到端多智能体LLM工作流,自动完成模拟电路拓扑生成与尺寸确定,可减少SPICE调用次数和运行时间,创新拓扑性能与传统拓扑相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13118 2026-08-14 cs.LG 新提交 57%

Branch and Bound for Relational Verification of Neural Networks

神经网络关系验证的分支定界法

Kota Fukuda, Zhenya Zhang, Guanqin Zhang, Jianjun Zhao

机构 * Graduate School and Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学情报科学与电气工程研究院及学部) National Institute of Informatics(信息学研究所) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出分支定界(BaB)框架,通过关系神经元拆分及对应选择策略,在817个跨多数据集的验证问题上,使SaBRe在已解决实例数和效率上优于基线方法,提升神经网络关系验证效果。

Comments The full version of the paper accepted by EMSOFT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13101 2026-08-14 cs.CL eess.AS 新提交 57%

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

CASA:结合语音编码器与大语言模型的内容-语音口语评估

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

机构 * Aalto University(阿尔托大学) University of Helsinki(赫尔辛基大学) Walton Institute(沃尔顿研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。

Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12990 2026-08-14 cs.CL 新提交 57%

LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation

LycheeMemory V2:基于语义片段级整合的LLM智能体高效长期记忆

Dongfang Li, Zixuan Liu, Junmai Wang, Jiahe Huang, Fuhao Li, Bonian Jia, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LycheeMemory V2用语义片段级整合替代轮次级整合,降低LLM编码成本,在LoCoMo、LongMemEval-S上实现SOTA性能,构建token用量较A-Mem大幅减少且未增加查询开销。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12571 2026-08-14 cs.DL cs.CL 新提交 57%

Is this Citation on Point?

该引用是否相关?

Apurv Verma

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文针对现有大语言模型法律用例评估忽视的“指向真实案件却不支持主张”的引用问题,通过扰动真实法律引用验证14种模型配置,发现模型易混淆主题识别与页码级支持验证能力,规模与推理能力仅能部分缩小错精准页码扰动的检测差距。

Comments Accepted to the 1st Workshop on AI for Law at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12435 2026-08-14 cs.LG 新提交 57%

MARCH: Scaling Recurrent Memory with Content-Routed State Anchors

MARCH:通过内容路由状态锚点扩展循环记忆

Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Ning Ding, Xia Hu, Bowen Zhou, Chaochao Lu, Youbang Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MARCH架构,通过内容路由状态锚点扩展循环记忆,在长序列上保持计算效率,经预训练后在多个长程任务中优于线性注意力变体,增强了循环长程记忆能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12350 2026-08-14 cs.CY cs.AI 新提交 57%

From Caveman to Expert Analyst: Energy Consumption of Variable LLM Tasks

从原始人到专家分析师:可变大语言模型任务的能耗

Diego Manya, Ethan I. Thorpe, Ji Zhang, Myranda Shirk, Jiamian He, Angel Hsu, Michael P. Vandenbergh

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究测试四类高可塑性用户行为评估AI能耗减排潜力,发现非推理模型能耗仅为推理模型的二十分之一,简单提示修改可进一步降65%能耗,最佳实践可减4%-35%电力需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12344 2026-08-14 cs.CL cs.CY stat.AP 新提交 57%

Predicting consumer-technology ownership without a diffusion history

基于扩散历史预测消费技术拥有情况

Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究利用人类及Anthropic Claude Opus 4.7、OpenAI GPT-5.5两款语言模型对消费技术的属性评分,通过符号约束惩罚回归预测技术拥有率,其效果优于上市年限基准模型,还对2025-2026年新品做了2027年拥有率预测。

Comments 31 pages, 4 figures, supplementary material included (Tables S1-S6, Figure S1), data and code at https://osf.io/dr5ct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11758 2026-08-13 cs.CL 新提交 57%

AWARe: Mitigating Catastrophic Forgetting via Activation-Weighted Adaptive REtention

AWARe:基于激活加权的自适应保留缓解灾难性遗忘

Juncheng Liao, Jinfan Lv, Guoming Wang, Jupeng Zheng, Ling Xiao, Siliang Tang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多模态大语言模型微调时的灾难性遗忘问题,提出无需修改架构的AWARe方法,通过激活加权控制参数更新,在保留上游能力的同时提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11676 2026-08-13 cs.AI 新提交 57%

XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication

XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器

Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Capital One AI Foundations(Capital One AI 基金会)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10949 2026-08-12 cs.CV cs.CL 新提交 57%

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

StreamFlow:用于流视频理解的动态内存流

Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10462 2026-08-12 cs.CL 新提交 57%

Calibrating Post-Training Feature Shifts for LLM Data Contamination Detection

校准用于大语言模型数据污染检测的训练后特征偏移

Zhen Yang, Mengqi Wang, Gengda Zhao, Mo Zhou, Jianwei Wang, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对训练后处理导致的LLM数据污染检测中特征偏移问题,提出CalibDCD校准框架,经实验可提升现有检测器的AUC和TPR@5%FPR指标。

Comments 14 pages, 7 figures. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10120 2026-08-12 cs.LG cs.NI 新提交 57%

ChronoSSM: Training for Temporally Aware Representations in Autoregressive State Space Models

ChronoSSM:自回归状态空间模型中用于时间感知表示的训练方法

Adrien Schoen, Nachiketa Ratnakar Patil, Arjun Bhagoji, Francesco Bronzino

机构 * ENS de Lyon(里昂高等师范学院) CNRS(法国国家科学研究中心) UCBL1(里昂第一大学) Indian Institute of Technology Bombay(印度理工学院孟买分校) Institut universitaire de France(法国大学研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 ChronoSSM是一种自回归状态空间模型,通过联合建模事件与时间戳的共享主干,在四个领域的实验中,能生成更具时间信息的表示且不降低内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09532 2026-08-11 cs.DB cs.AI 新提交 57%

Carnot: Interpretable, Interactive, and Optimized Execution of Deep Research Queries

Carnot:深度研究查询的可解释、交互式且优化的执行系统

Matthew Russo, Yash Agarwal, Tianyu Li, Zhuohan Gu, Michael Cafarella, Omar Khattab, Tim Kraska, Samuel Madden

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Carnot,一款可解释交互式的AI分析执行引擎,可编译自然语言查询为执行图,支持用户干预流程并优化成本与延迟,助力企业高效获取可验证数据洞察。

Comments 4 pages, 2 figures, published as a demo paper in VLDB 2026

Journal ref Proceedings of the VLDB Endowment, Vol. 19, No. 12 pages 4642 - 4645, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09227 2026-08-11 cs.AI 新提交 57%

Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器

Puneet Mathur, Manan Suri, Dinesh Manocha

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08612 2026-08-11 cs.CV cs.AI 新提交 57%

REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering

REVEAL:用于长视频问答的基于 rubric(评分标准)的显式证据充分性验证智能体

Caijun Yan, Yang Zhou, Meixing Shi, Haoran Sun, Yichen Li, Yuxiang Cai, Yankai Jiang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对长视频问答中现有方法割裂事件、忽略证据充分性的问题,提出REVEAL框架,通过自适应分块的结构化记忆与rubric引导的证据验证,实现更可靠的推理且性能优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08466 2026-08-11 cs.AI 新提交 57%

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

分层自改进:一种面向任务特定可进化智能体控制框架的方法

Tailin Zhou

机构 * HKUST(香港科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出HSI框架,使冻结LLM的任务特定控制框架可进化,在中等难度任务上取得性能提升,超出模型能力时无增益,为改进冻结LLM智能体提供可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08254 2026-08-11 cs.AI 新提交 57%

Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?

你的提示并非唯一提示:大型语言模型对结构化输出模式描述的权重有多大?

Sin-Ying Lin

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究测试LLM对结构化输出模式描述的权重,发现模式影响具模型依赖性,模式设计是更强杠杆,建议将提示与模式视为统一指令表面并实证验证其放置与字段设计。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07855 2026-08-11 cs.LG 新提交 57%

CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents

CommitKV:面向多轮智能体的、基于提交转换的生命周期感知KV缓存压缩

Weizhong Huang, Jinchao Zhang, Xiawu Zheng

机构 * Xiamen University(厦门大学) WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 CommitKV通过提交转换识别KV生命周期,区分休眠与可安全移除信息,在多轮智能体中降低内存占用、加速推理且准确率优于现有KV缓存压缩方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07478 2026-08-11 cs.CV cs.CL 新提交 57%

PragyaDoc: A Universal Document Intelligence Framework for Multilingual Medical Document Understanding in Low-Resource Settings

PragyaDoc:低资源场景下多语种医学文档理解的通用文档智能框架

Jagpal Singh Jhala

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对低资源场景下多语种医学文档理解问题,提出PragyaDoc通用文档智能框架,采用四层流水线实现医学文档的多语种理解,解决了印度因语言差异导致的医学文档可及性障碍。

Comments 7 pages 4 images/figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06922 2026-08-10 cs.AI 新提交 57%

Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation

或许与我成交:情绪在多智能体谈判中的作用

Massimiliano Luca, Apoorva Singh, Bruno Lepri

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06557 2026-08-10 cs.DC cs.LG 新提交 57%

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务

Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05418 2026-08-07 cs.AI 新提交 57%

Negotiating Risk Boundaries in AI for Policing Through Mixed-Stakeholder Deliberation

通过混合利益相关者协商确定警务AI的风险边界

Mackenzie Jorgensen, Jo Reilly, Alex Sutherland, Miri Zilka

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过包含社区代表、警察和学者的混合利益相关者协商研讨会,评估13个警务AI用例的种族偏见风险,发现多数参与者支持AI采用,仅拒绝3个用例,强调种族公平可优化AI风险-收益分析。

Comments Accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 57%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04368 2026-08-06 cs.LG 新提交 57%

EvtGraph: Event-Adaptive Compression for Sparse Temporal Graph Learning in Multimodal Time Series

EvtGraph:面向多模态时间序列稀疏时序图学习的事件自适应压缩方法

Ziqian Wang, Tingxiong Xiao, Yuxiao Cheng, Jinli Suo

机构 * Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究针对多模态时序数据均匀离散化效率低的问题,提出EvtGraph框架,通过事件自适应压缩等技术实现预算约束下的高效图学习,在多模态临床等基准上性能优于基线且效率显著提升。

Comments 9 page, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04255 2026-08-06 cs.CR cs.LG 新提交 57%

PriDyG: Privacy-preserving Dynamic Graph Inference with LLM-GNN Collaboration

PriDyG:结合大语言模型与图神经网络的隐私保护动态图推理

Yuyang Xia, Ruixuan Liu, Li Xiong

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 PriDyG是结合GNN结构学习与LLM语义推理的隐私保护动态图推理框架,可在边级差分隐私约束下,在节点分类等任务中降低累计隐私开销并保持良好效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03844 2026-08-05 cs.AI 新提交 57%

MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents

MAFIA:针对经审计的大语言模型智能体的、基于探测与事实注入的仅查询内存攻击

Jiaming Chen, Yisen Gao, Yanping Li, Zifan Liu, Yumeng Zhang, Jun Zhang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对经审计的LLM智能体,提出MAFIA攻击框架,通过放置策略与伪装有效载荷实现高攻击成功率,大幅降低审计检测率,揭示智能体内存系统的关键漏洞。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03632 2026-08-05 cs.AI 新提交 57%

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

当教师误导时:感知虚假信号的在线策略蒸馏

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对在线策略蒸馏中存在的虚假信号问题,提出SA-OPD框架,通过输入接地性代理过滤误导性token级监督,实验表明其性能优于普通OPD及其他选择性方法。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03624 2026-08-05 cs.CL 新提交 57%

LoopMTP: A looped transformer guided by latent multi-token prediction

LoopMTP:由潜在多令牌预测引导的循环Transformer

Behzad Shomali, Markus Frey, David Berghaus, Joachim Koehler, Mehdi Ali

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LoopMTP针对循环Transformer的潜在过度思考问题,通过潜在多令牌预测实现软对齐与轻量门控,使平均准确率提升最高8.1%,15次循环内训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏