arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-14 至 2026-04-14 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 17 篇

2508.13755 2026-04-14 cs.LG cs.AI 81%

Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration

在RLVR中深度与广度的协同作用:通过自适应探索解锁LLM推理增益

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * Sun Yat-Sen University(中山大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心) University of California, Merced(加州大学默塞德分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARS方法,通过自适应探索提升LLM推理能力,发现扩大批量大小能显著提升Pass@1指标,同时结合DARS-Breadth方法实现深度与广度的协同增益。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01544 2026-04-14 cs.AI 79%

Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards

通过去噪过程奖励推进扩散语言模型的推理能力

Shaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04842 2026-04-14 cs.LG cs.AI 79%

Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers

为RL重新注入价值:通过统一LLM推理器与验证器实现更好的测试时间扩展

Kusha Sareen, Morgane M Moss, Alessandro Sordoni, Rishabh Agarwal, Arian Hosseini

机构 * Mila, McGill University(Mila,麦吉尔大学) Mila, Université de Montréal(Mila,蒙特利尔大学) Microsoft Research, Mila(微软研究院,Mila) Google DeepMind, Mila(谷歌DeepMind,Mila)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RL$^V$方法,通过联合训练LLM作为推理器和生成验证器,提升测试时间计算效率和任务准确性,实现20%以上的MATH准确率提升和8-32倍的计算效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10034 2026-04-14 cs.AI 70%

AI Achieves a Perfect LSAT Score

人工智能实现完美LSAT分数

Bonmu Ku

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文首次展示语言模型在公开LSAT考试中取得满分,通过QLoRA微调的奖励模型提升逻辑推理能力,证明机器可超越人类认知极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09748 2026-04-14 cs.CR cs.AI 70%

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward

在RLVR中存在后门:从可验证奖励中对LLM的后门攻击

Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种在RLVR框架中通过注入污染数据植入后门的新方法,展示了该攻击在不同模型规模上高效且具有泛化能力,导致安全性能下降73%。

Comments 20 pages,8 figures, publish in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11012 2026-04-14 cs.AI cs.CL cs.LG 67%

Min-$k$ Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics

Min-k Sampling: 通过相对Logit动态解耦截断与温度缩放

Yuanhao Ding, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang

机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Min-k采样,通过分析排序后的Logit分布局部形状,识别语义悬崖,动态确定截断边界,实现严格温度不变性,并在多个任务中提升文本质量。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07794 2026-04-14 cs.CL cs.AI cs.LG 67%

HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation

HiPRAG:分层过程奖励用于高效代理检索增强生成

Peilin Wu, Mian Zhang, Kun Wan, Wentian Zhao, Kaiyu He, Xinya Du, Zhiyu Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Inc.(Adobe公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiPRAG通过引入细粒度的知识引导过程奖励,优化代理检索增强生成的推理过程,提升搜索效率并减少无效搜索。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11104 2026-04-14 cs.AI cs.IR cs.LG cs.NE 62%

Frugal Knowledge Graph Construction with Local LLMs: A Zero-Shot Pipeline, Self-Consistency and Wisdom of Artificial Crowds

基于本地LLM的节约知识图谱构建:零样本流水线、自一致性与人工群体智慧

Pierre Jourlin

机构 * Avignon Université, Laboratoire d’Informatique d’Avignon (LIA)(阿维尼翁大学,阿维尼翁计算机科学实验室(LIA))

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模型零样本流水线,用于知识图谱构建与利用,通过本地推理在消费级硬件上执行。研究了自一致性与人工群体智慧在多跳推理中的应用,展示了系统在零样本条件下的性能提升及碳足迹。

Comments Source code and raw results available: https://github.com/jourlin/synsynth (licence Hypocratic)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05837 2026-04-14 cs.CL 57%

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

EEPO:通过采样后遗忘的探索增强策略优化

Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong Baptist University(香港浸会大学) LMU Munich(慕尼黑大学) MoE Key Laboratory of High Confidence Software Technologies(教育部高可信软件技术重点实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 EEPO通过两阶段 rollout 和自适应遗忘机制提升探索能力,在五个推理基准中超越 GRPO,取得显著性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07153 2026-04-14 cs.AI 57%

ANCHOR: Branch-Point Data Generation for GUI Agents

ANCHOR:用于GUI代理的分支点数据生成

Jinbiao Wei, Yilun Zhao, Kangqi Ni, Arman Cohan

机构 * Yale University(耶鲁大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 ANCHOR通过分支点生成高质量交互数据,提升桌面环境GUI代理的训练效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20567 2026-04-14 cs.CL 57%

KCS: Diversify Multi-hop Question Generation with Knowledge Composition Sampling

KCS: 通过知识组合采样多样化多跳问题生成

Yangfan Wang, Jie Liu, Chen Tang, Lian Yan, Jingchi Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室)

专题命中 测试时计算 :planning(abstract);分类 cs.CL

AI总结 本文提出KCS框架,通过采样不同知识组合提升多跳问题生成的多样性,改进知识组合选择的准确率,并在HotpotQA和2WikiMultihopQA数据集上提升数据增强效果。

Comments Accept by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07251 2026-04-14 cs.HC 50%

MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences

MeepleLM:一种模拟多样化主观体验的虚拟玩家测试者

Zizhen Li, Chuanhao Li, Yibin Wang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Yifei Huang, Kaipeng Zhang

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出MeepleLM,通过整合规则书和玩家反馈数据,模拟多样化玩家体验,提升棋盘游戏设计的协作效率与批判性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 30 篇

2604.11716 2026-04-14 cs.AI cs.CL 86%

SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context

SWE-AGILE:一种用于高效管理动态推理上下文的软件代理框架

Shuquan Lian, Juncheng Liu, Yazhe Chen, Yuhong Chen, Hui Li

机构 * Microsoft(微软)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 SWE-AGILE通过动态推理上下文策略平衡推理深度与效率,实现高效多轮软件工程任务处理,实验证明其在SWE-Bench-Verified上优于7B-8B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06840 2026-04-14 cs.CR 85%

MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning

MirageBackdoor: 一种诱导“思考良好但回答错误”推理的隐蔽攻击

Yizhe Zeng, Wei Zhang, Yunpeng Li, Juxin Xiao, Xiao Wang, Yuling Liu

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出MirageBackdoor攻击,通过解锁模型后输出空间和定制训练流程,使模型在保持清洁推理过程的同时,选择性地将最终答案导向特定目标,显著提升攻击隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 85%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11547 2026-04-14 cs.LG cs.CL 84%

Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach

通过知识增强的数据合成 eliciting 医学推理:一种半监督强化学习方法

Haolin Li, Shuyang Jiang, Ruipeng Zhang, Jiangchao Yao, Ya Zhang, Yanfeng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Radiology, Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院放射科) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MedSSR框架,利用稀有疾病知识生成可控推理问题,并通过自监督和监督强化学习提升医学推理能力,在十个医疗基准测试中取得显著提升。

Comments Accepted to ACL 2026 as a Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11686 2026-04-14 cs.IR 82%

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment

EA-Agent:一种用于实体对齐的结构化多步推理代理

Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。

Comments ACL 2026,Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 82%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 复杂问题求解 :chain-of-thought(title,abstract);CoT(abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27269 2026-04-14 cs.CL cs.AI cs.LG 82%

Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?

为何多语言推理模型中会出现多语言推理差距?

Deokhyung Kang, Seonjeong Hwang, Daehui Kim, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) Agentic AI Lab, KT(KT公司Agentic AI实验室) Department of Computer Science and Engineering, POSTECH(浦项工业大学计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了多语言推理模型中存在多语言推理差距的原因,发现语言理解失败是主因,并提出Selective Translation策略有效缓解了这一问题。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11737 2026-04-14 cs.LG cs.AI cs.CL 82%

TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning

TokUR:用于大语言模型推理的令牌级不确定性估计

Tunyu Zhang, Haizhou Shi, Yibin Wang, Hengyi Wang, Xiaoxiao He, Zhuowei Li, Haoxian Chen, Ligong Han, Kai Xu, Huan Zhang, Dimitris Metaxas, Hao Wang

机构 * Rutgers University(罗格斯大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Red Hat AI Innovation(红帽AI创新)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TokUR框架,通过引入低秩随机权重扰动生成令牌级不确定性分布,提升大语言模型在数学推理中的可靠性和可解释性。

Comments Accepted to International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22403 2026-04-14 cs.LG 79%

MoveFM-R: Advancing Mobility Foundation Models via Language-driven Semantic Reasoning

MoveFM-R: 通过语言驱动的语义推理推进移动基础模型

Fanjin Meng, Yuan Yuan, Jingtao Ding, Jie Feng, Chonghua Han, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系,BNRist) New York University (NYU)(纽约大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 MoveFM-R通过语言驱动的语义推理解决移动基础模型中地理坐标与语言 token 的词汇不匹配及潜在向量与语义世界之间的表示差距问题,实现更全面、可解释的人类移动建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10436 2026-04-14 cs.CV 78%

SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units

SignReasoner:通过功能结构单元实现复杂交通标志理解的组合推理

Ruibin Wang, Zhenyu Lin, Xinhai Zhao

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出SignReasoner,通过功能结构单元实现复杂交通标志的组合推理,提升自动驾驶安全。核心方法是功能结构单元,通过分解标志为基本功能块,增强模型对未知配置的泛化能力。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09704 2026-04-14 cs.CV 78%

Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank

多粒度推理用于图像质量评估:通过属性感知的强化学习排序

Xiangyong Chen, Xiaochuan Lin, Haoran Liu, Xuan Li, Yichen Su, Xiangwei Guo

机构 * Henan Polytechnic University(河南理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出MG-IQA框架,通过属性感知强化学习排序实现图像质量及细粒度属性的联合评估,提升整体质量预测和属性评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10690 2026-04-14 cs.AI 77%

Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks

大型语言模型构建空间世界模型了吗?基于网格世界迷宫任务的证据

Weijiang Li, Yilin Zhu, Rajarshi Das, Parijat Dube

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) MQube Cognition(MQube认知实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过迷宫任务评估LLM的空间理解能力,发现其空间推理依赖于表示形式而非任务类型,表明LLM缺乏稳健的空间世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08339 2026-04-14 cs.CL 77%

What Factors Affect LLMs and RLLMs in Financial Question Answering?

影响LLMs和RLLMs在金融问答中的因素是什么?

Peng Wang, Xuesi Hu, Jiageng Wu, Yuntao Zou, Qiancheng Zhang, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, China(澳门科技大学计算机科学与工程学院) SKLPlanets, Macau University of Science and Technology, China(澳门科技大学月球与行星科学国家重点实验室) School of Economics, Anhui University, China(安徽大学经济学院) School of Energy and Power Engineering, Huazhong University of Science and Technology, China(华中科技大学能源与动力工程学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究探讨了提示方法、代理框架和多语言对齐方法对LLMs和RLLMs在金融问答任务中的影响,发现提示方法和代理框架能提升LLMs性能,而RLLMs自身具备Long CoT能力,传统方法对其提升有限。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10508 2026-04-14 cs.SE cs.AI 70%

How Many Tries Does It Take? Iterative Self-Repair in LLM Code Generation Across Model Scales and Benchmarks

需要多少次尝试?跨模型规模和基准的LLM代码生成中的迭代自修复

Johin Johny Arimbur

机构 * Independent Researcher(独立研究员)

专题命中 复杂问题求解 :chain-of-thought(abstract);self-correction(abstract);分类 cs.AI

AI总结 研究探讨了在不同模型规模和基准测试中,通过迭代自修复提高代码生成正确率的方法,发现自修复显著提升了通过率,且现代模型无需微调即可实现有效自修复。

Comments 11 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-04-14 cs.CL cs.AI 62%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10874 2026-04-14 cs.CL cs.AI 62%

AOP-Smart: A RAG-Enhanced Large Language Model Framework for Adverse Outcome Pathway Analysis

AOP-Smart:一种增强检索的大型语言模型框架用于不良后果路径分析

Qinjiang Niu, Lu Yan

机构 * Nanyang Normal University(南阳师范学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AOP-Smart框架,通过检索增强生成技术提升大型语言模型在不良后果路径分析中的可靠性与准确性,实验表明其显著缓解了模型幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23516 2026-04-14 cs.CL cs.AI cs.IR 62%

MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens

MSA:内存稀疏注意力用于高效端到端内存模型扩展至100M标记

Yu Chen, Runkai Chen, Sheng Yi, Xinda Zhao, Xiaohong Li, Jianjin Zhang, Jun Sun, Chuanrui Hu, Yunyun Han, Lidong Bing, Yafeng Deng, Tianqiao Chen

机构 * Evermind Shanda Group(盛大集团) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSA,一种高效的端到端可训练内存模型框架,通过可扩展稀疏注意力和文档级RoPE实现线性复杂度,支持从16K到100M标记的扩展,同时保持稳定性,且在100M标记推理中实现2xA800 GPU的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10031 2026-04-14 cs.CL cs.AI 62%

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

CoSToM: 为大语言模型内在理论思维对齐的因果导向引导

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * National Engineering Research Center for Big Data Technology and System, Services Computing Technology and System Lab, Cluster and Grid Computing Lab, Huazhong University of Science and Technology(华中科技大学国家大数据技术与系统工程技术研究中心、服务计算技术与系统实验室、集群与网格计算实验室) Singapore Management University(新加坡管理大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSToM框架,通过因果追踪和激活引导提升大语言模型的社会推理能力与对话质量。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏