arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 413 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 20 篇

2605.05499 2026-05-08 cs.AI 85%

FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

FoodCHA:多模态LLM代理用于细粒度食物分析

Woojin Lee, Pranav Mekkoth, Ye Tian, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 长上下文与记忆 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出FoodCHA,一种多模态代理框架,通过分层决策过程提升食物识别的细粒度属性区分能力,实验显示其在类别和子类识别精度上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06313 2026-05-08 cs.IR cs.AI cs.CL 82%

Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering

超越分块:面向长文档问答的篇章意识层次检索

Huiyao Chen, Yi Yang, Yinghui Li, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能研究院,哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳环形区研究院(SLAI))

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种篇章意识层次检索框架,利用修辞结构理论处理长文档问答,通过 discourse parsing 和 LLM 增强实现结构与语义信息的融合,实验表明在多种语言和文档类型上均取得显著提升。

Comments 21 pages, 9 figures. Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05794 2026-05-08 cs.LG cs.AI 82%

Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

揭示大语言模型中模块梯度噪声不平衡:通过信噪比校准Adam

Ziqing Wen, Zhouyang Liu, Jiahuan Wang, Ping Luo, Li Shen, Dongsheng Li, Tao Sun

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究大语言模型中模块梯度噪声不平衡问题,提出基于信噪比的模块学习率校准方法,提升收敛速度和泛化能力,兼容高效内存训练算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04400 2026-05-08 cs.IT cs.LG math.IT 81%

Contextual Memory-Enhanced Source Coding for Low-SNR Communications

上下文记忆增强的信源编码用于低信噪比通信

Ziqiong Wang, Rongpeng Li

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种内存增强的信源编码方案,通过内部化上下文模式提升信源编码的鲁棒性,减少残余信道错误对解码的影响,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22457 2026-05-08 cs.DC cs.ET 80%

CCCL: Node-Spanning GPU Collectives with CXL Memory Pooling

CCCL: 基于CXL内存池的节点跨度GPU集体通信

Dong Xu, Han Meng, Xinyu Chen, Dengcheng Zhu, Wei Tang, Fei Liu, Liguang Xie, Wu Xiang, Rui Shi, Yue Li, Henry Hu, Hui Zhang, Jianping Jiang, Dong Li

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CCCL库,利用CXL共享内存池实现跨节点GPU操作,解决同步、数据交错和通信并行化问题,实验显示在多个节点上性能提升显著,证明CXL在可扩展内存导向GPU通信中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06611 2026-05-08 cs.LG cs.AI stat.ML 73%

The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity

注意力陷阱的结构起源:方差差异、超级神经元和维度不均等

Siquan Li, Kaiqi Jiang, Jiacheng Sun, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示了大语言模型中注意力陷阱现象的结构成因,通过分析自注意力机制中的方差差异和前馈网络中超级神经元的激活,证明了维度不均等导致注意力陷阱的形成,并提出head-wise RMSNorm架构改进以稳定值聚合。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03482 2026-05-08 cs.CR cs.AI cs.LG 73%

MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents

MEMSAD: 基于梯度耦合的内存污染异常检测用于检索增强型智能体

Ishrith Gowda

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系) University of California, Berkeley(加州大学伯克利分校) Berkeley AI Research(伯克利人工智能研究)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出MEMSAD,通过梯度耦合定理实现内存污染攻击的检测,证明其在对抗策略下的正确分类保证,并通过实验验证复合防御在所有攻击下的高检测率和低误报率。

Comments 28 pages, 9 figures, 6 theorems. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14724 2026-05-08 cs.CV cs.AI cs.CL 73%

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

HERMES: KV缓存作为分层内存用于高效视频流理解

Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HERMES提出一种无需训练的架构,通过将KV缓存视为分层内存框架,实现视频流的实时准确理解,提升处理速度并降低内存消耗。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06554 2026-05-08 cs.CL 70%

Long Context Pre-Training with Lighthouse Attention

长上下文预训练与Lighthouse注意力

Bowen Peng, Subho Ghosh, Jeffrey Quesnelle

机构 * Nous Research(Nous研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Lighthouse注意力机制,通过分层选择策略实现高效长序列训练,减少计算复杂度,提升并行效率,并在训练后期恢复完整注意力模型,实验证明其在训练速度和最终损失上的优势。

Comments 18 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06365 2026-05-08 cs.AI cs.MA cs.SE 70%

From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work

从代理循环到确定性图:可重复AI原生工作的执行轨迹

Josh Rosen, Seth Rosen

机构 * ThruWire, Inc.(ThruWire公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出执行轨迹模型,通过有向无环图表示AI生成工作,确保在变化中保持稳定性。对比实验显示,DAG在保持最终结果和中间状态一致性方面优于循环更新方法。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06342 2026-05-08 cs.CL 70%

Don't Lose Focus: Activation Steering via Key-Orthogonal Projections

不要失去焦点:通过键正交投影进行激活引导

Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出SKOP方法,通过约束有害的注意力重路由,减少激活引导对推理和检索性能的负面影响,实现最佳的引导-实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12635 2026-05-08 cs.AI 70%

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

记忆作为行动:面向长周期智能任务的自主上下文编纂

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Hithink Research(慧思科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Lab(鹏城实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MemAct框架,将工作记忆管理作为可学习的策略动作,通过端到端强化学习优化信息保留与任务表现,实验显示其在保持准确性的同时显著减少上下文长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03354 2026-05-08 cs.AI 70%

What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis

代理记忆内部发生了什么?从涌现到诊断的电路分析

Xutao Mao, Jinman Zhao, Gerald Penn, Cong Wang

机构 * City University of Hong Kong(香港城市大学) University of Toronto(多伦多大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示了代理记忆中控制与内容电路的因果关系及共享枢纽的机制,开发出76.2%准确率的无监督诊断工具,优于监督基线13分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14337 2026-05-08 cs.CV 67%

On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs

关于塑造 Omni-LLMs 解码策略的注意力 sink 性质

Suho Yoo, Youngjoon Jang, Joon Son Chung

机构 * KAIST(韩国科学技术院) VGG, University of Oxford(牛津大学视觉感知实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文研究 Omni-LLMs 中注意力 sink 的行为,发现其不仅反映头部冗余,还承担额外功能,提出 OutRo 方法通过特征空间对齐和放松因果掩码提升解码性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06614 2026-05-08 cs.AI cs.CL 62%

SkillOS: Learning Skill Curation for Self-Evolving Agents

SkillOS: 为自演化代理学习技能编目

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 SkillOS通过经验驱动的强化学习方法,解决自演化代理中复杂长期技能编目的学习问题,优于记忆-free和强记忆基线,在效果和效率上均表现优异,技能库逐步演变成更丰富的Markdown文件。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06316 2026-05-08 cs.LG cs.AI 62%

Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

Pro-KLShampoo:利用正交化恢复白化过程的投影KL-Shampoo

Ruotong Sun, Ermin Wei

机构 * Department of Electrical & Computer Engineering, Northwestern University(电气与计算机工程系,西北大学) Department of Industrial Engineering & Management Sciences, Northwestern University(工业工程与管理科学系,西北大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Pro-KLShampoo,通过正交化恢复白化过程,改进了KL-Shampoo的Kronecker预置器结构,实验证明其在预训练任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06416 2026-05-08 cs.CL 57%

MiA-Signature: Approximating Global Activation for Long-Context Understanding

MiA-Signature:近似全局激活以实现长上下文理解

Yuqing Li, Jiangnan Li, Mo Yu, Zheng Lin, Weiping Wang, Jie Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Pattern Recognition Center, WeChat AI, Tencent(微信AI模式识别中心) Hunyuan Team, Tencent(腾讯文心一言团队)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 本文提出MiA-Signature,通过压缩表示近似全局激活对下游处理的影响,提升长上下文理解任务的性能。

Comments This is a work in progress; we will continue to revise and improve the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04334 2026-05-08 cs.CV cs.LG 57%

Submanifold Sparse Convolutional Networks for Automated 3D Segmentation of Kidneys and Kidney Tumours in Computed Tomography

子流形稀疏卷积网络用于计算机断层扫描中肾脏及肾肿瘤的自动三维分割

Saúl Alonso-Monsalve, Leigh H. Whitehead, Adam Aurisano, Lorena Escudero Sanchez

机构 * ETH Zürich, Institute for Particle Physics and Astrophysics(苏黎世联邦理工学院,粒子物理与天体物理研究所) University of Cambridge, Department of Physics(剑桥大学,物理系) University of Cincinnati, Department of Physics(辛辛那提大学,物理系) University of Cambridge, Department of Radiology(剑桥大学,放射学系)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 本文提出基于体素稀疏化和子流形稀疏卷积网络的两阶段3D分割方法,用于提高CT图像中肾脏及肿瘤的分割效率与精度,实验表明其在速度和内存使用上均优于现有方法。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 62 篇

2605.05920 2026-05-08 cs.AR cs.AI cs.PF 92%

LLM-Driven Design Space Exploration of FPGA-based Accelerators

基于FPGA的加速器的LLM驱动的设计空间探索

Vinamra Sharma, Xingjian Fu, Jude Haris, José Cano

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SECDA-DSE框架,利用大语言模型自动化FPGA加速器的设计空间探索,通过结构化探索器和LLM栈实现高效配置生成与优化。

Comments Accepted to the Workshop on Intelligent System Design (InSyDe) co-located with EuroSys '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10241 2026-05-08 cs.CL cs.IR 92%

ImCoref-CeS: An Improved Lightweight Pipeline for Coreference Resolution with LLM-based Checker-Splitter Refinement

ImCoref-CeS: 一种改进的轻量级管道用于基于LLM的检查-分割细化的指代消解

Kangyang Luo, Yuzhuo Bai, Shuzheng Si, Cheng Gao, Zhitong Wang, Yingli Shen, Wenhao Li, Zhu Liu, Yufeng Han, Jiayi Wu, Cunliang Kong, Maosong Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI, Tsinghua University(清华大学人工智能研究院) East China Normal University(华东师范大学) Jiangsu Collaborative Innovation Center for Language Ability(江苏省语言能力协同创新中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出ImCoref-CeS框架,结合增强的监督模型与LLM推理,通过改进的指代消解方法和LLM多角色检查-分割代理提升性能。

Comments Accepted by ACL2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19918 2026-05-08 cs.AI cs.LG 92%

Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models

Meta-Reasoner:用于大型语言模型推理时间优化的动态指导

Yuan Sui, Yufei He, Tri Cao, Simeng Han, Yulin Chen, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出Meta-Reasoner框架,通过动态调整推理策略提升大语言模型的推理效率,实验显示在数学和科学任务中准确率提升9-12%,推理时间减少28-35%。

Comments Accepted by ACL'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06024 2026-05-08 cs.AI 92%

Strat-LLM: Stratified Strategy Alignment for LLM-based Stock Trading with Real-time Multi-Source Signals

Strat-LLM:基于实时多源信号的LLM股票交易分层策略对齐

Wenliang Huang, Zengyi Yu

机构 * School of Economics(经济学院) Zhejiang University of Technology(浙江工业大学) Faculty of Education(教育学院) East China Normal University(华东师范大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Strat-LLM框架,通过分层策略对齐提升LLM在股票交易中的表现,实验显示不同模式下模型在风险控制和收益获取上的差异。

Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06350 2026-05-08 cs.LG cs.AI cs.CL 90%

Is Escalation Worth It? A Decision-Theoretic Characterization of LLM Cascades

代价是否值得?一种LLM级联的决策理论刻画

Dylan Bouchard

机构 * Dylan Bouchard

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过决策理论框架分析LLM级联的代价与性能平衡,提出级联前沿的分段凹性及影子价格关系,验证了级联策略在不同数据集上的表现,发现结构成本是限制级联性能的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05737 2026-05-08 cs.AI cs.CL 90%

ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning

ReFlect:一种有效的复杂长周期LLM推理Harness系统

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 ReFlect通过创建确定性封装逻辑,有效检测和恢复LLM推理中的错误,提升多阶段任务的成功率,尤其在SWE-bench中显著提高代码补全质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07830 2026-05-08 cs.AI 90%

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

通过过程可验证的思维数据合成与调度实现时间序列推理

Jiahui Zhou, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Lin Li, Zhuomin Chen, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VeriTime框架,通过数据合成、调度和强化学习训练,提升LLM在时间序列推理任务中的性能,使小模型达到或超越大模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05410 2026-05-08 cs.AI cs.HC physics.ed-ph 90%

LaTA: A Drop-in, FERPA-Compliant Local-LLM Autograder for Upper-Division STEM Coursework

LaTA:一个符合FERPA规定的本地LLM自动评分器,用于大二STEM课程作业

Jesse A. Rodríguez

机构 * School of Mechanical, Industrial, and Manufacturing Engineering(机械、工业与制造工程学院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 LaTA是一种本地LLM自动评分器,可有效减轻大二STEM课程的评分负担,通过本地运行和LaTeX流程,实现零成本评分,提升学生自信心并提高考试成绩。

Comments Submitted to Computers & Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03227 2026-05-08 cs.AI 89%

Evaluating Prompting and Execution-Based Methods for Deterministic Computation in LLMs

评估基于提示和执行的方法在LLM中确定性计算中的表现

Hongkun Yu

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(title_cn,comments);large language model(abstract);language model(abstract)

AI总结 本文评估了多种提示策略在需要精确输出的任务中的表现,发现PoT通过生成可执行代码实现完美准确率,而其他方法存在误差积累或计算开销大等问题。

Comments 8 pages, 1 figure. Code and dataset available at https://github.com/bigbird231/llm-exact-computation-dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05216 2026-05-08 cs.LG 89%

SAT: Sequential Agent Tuning for Coordinator Free Plug and Play Multi-LLM Training with Monotonic Improvement Guarantees

SAT: 为无协调自由插拔多LLM训练的单调改进保证的序列代理调优

Yi Xie, Yangyang Xu, Yi Fan, Bo Liu

机构 * Department of Electrical \& Computer Engineering, University of Arizona Tucson, Arizona USA Department of Mathematical Sciences, Rensselaer Polytechnic Institute Troy, New York USA Amazon Web Services New York USA Department of Electrical \& Computer Engineering, University of Arizona Department of Mathematical Sciences, Rensselaer Polytechnic Institute Amazon Web Services

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SAT方法,通过因子化策略和块坐标更新实现无协调的分布式训练,保证训练过程单调改进和插拔不变性,实验表明其在AIME24/25基准上性能优于Qwen3-32B。

Comments Published at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02079 2026-05-08 cs.CL cs.AI 88%

Argumentative Large Language Models for Explainable and Contestable Claim Verification

用于可解释和可争议主张验证的论证大型语言模型

Gabriel Freedman, Adam Dejl, Deniz Gorur, Xiang Yin, Antonio Rago, Francesca Toni

机构 * Department of Computing, Imperial College London, UK(伦敦帝国学院计算机系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出论证大型语言模型(ArgLLMs),通过引入论证推理增强LLMs,使其决策可解释且可争议,通过实验验证其在主张验证任务中的性能。

Comments 18 pages, 18 figures. Accepted as an oral presentation at AAAI 2025

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(14), 14930-14939. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10443 2026-05-08 cs.SE cs.AI 88%

Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?

大型语言模型在语义保持变异下的理解鲁棒性如何?

Pedro Orvalho, Marta Kwiatkowska

机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在Python程序上的推理能力,通过五种语义保持的代码变异测试,发现模型在语义变换下表现出显著的脆弱性,正确预测基于 flawed reasoning 的比例在10%-50%之间,且预测稳定性差。

Comments 17 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏