arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-17 至 2026-04-17 共收录 128 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 36 篇

2510.14664 2026-04-17 cs.SD eess.AS 67%

SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation

SpeechLLM-as-Judges: 向通用和可解释的语音质量评估迈进

Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SpeechLLM-as-Judges框架,利用大语言模型进行结构化语音质量评估,构建了包含多语言语音片段的SpeechEval数据集,并开发了SQ-LLM模型,在多种任务和语言上表现出色。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15309 2026-04-17 cs.CV cs.AI cs.CL 62%

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent:一种用于网页生成的分层多模态网络代理

Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Tongji University(同济大学) Microsoft Corporation(微软公司)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14922 2026-04-17 cs.LG cs.CL 62%

LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

LongAct:利用内在激活模式促进长上下文强化学习

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LongAct方法,通过利用长上下文推理中的稀疏结构,改进大语言模型的训练,提升长上下文处理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14199 2026-04-17 q-fin.CP cs.AI cs.LG 62%

PolyBench: Benchmarking LLM Forecasting and Trading Capabilities on Live Prediction Market Data

PolyBench:基于实时预测市场数据的LLM预测与交易能力基准测试

Pu Cheng, Juncheng Liu, Yunshen Long

机构 * College of Electrical Engineering, Sichuan University(四川大学电气工程学院) School of Economics, Sichuan University(四川大学经济学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PolyBench基准测试,通过实时预测市场数据评估七种先进LLM的预测与交易能力,发现仅两种模型在严格市场状态下实现正收益,揭示了语言流畅性与真实概率推理之间的差距。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14158 2026-04-17 cs.CL cs.AI 62%

MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios

MemGround:用于大型语言模型在游戏化场景中的长期记忆评估套件

Yihang Ding, Wanke Xia, Yiting Zhao, Jinbo Su, Jialiang Yang, Zhengbo Zhang, Ke Wang, Wenming Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) CASIA

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MemGround通过游戏化交互场景评估LLM的长期记忆能力,提出三级框架和多维指标,揭示先进模型在动态跟踪和复杂推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15946 2026-04-17 cs.LG cs.AI cs.CR 62%

Fall into a Pit, Gain in a Wit: Cognitive-Guided Harmful Meme Detection via Misjudgment Risk Pattern Retrieval

跌入陷阱,获得智慧:通过误判风险模式检索的认知引导有害迷因检测

Wenshuo Wang, Ziyou Jiang, Junjie Wang, Mingyang Li, Jie Huang, Yuekai Huang, Zhiyuan Chang, Feiyan Duan, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory(集成信息系统技术研究所) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PatMD方法,通过学习并主动缓解潜在误判风险,识别有害迷因的深层误判风险模式,提升多模态大语言模型的检测能力,实验显示在5项有害检测任务中,F1-score和准确率均显著提升。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05015 2026-04-17 cs.LG cs.AI 62%

SPaCe: Unlocking Sample-Efficient Large Language Models Training With Self-Pace Curriculum Learning

SPaCe:通过自适应课程学习解锁高效大语言模型训练

Dai Do, Manh Nguyen, Svetha Venkatesh, Hung Le

机构 * Deakin Applied AI Initiative, Deakin University, Australia(德金应用人工智能倡议,德金大学,澳大利亚)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SPaCe通过自适应课程学习框架,优化数据选择与训练时机,提升大语言模型的训练效率,实验表明其在多个推理基准上性能优于现有方法,样本使用减少达100倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15222 2026-04-17 cs.SE cs.AI 57%

AI-Assisted Requirements Engineering: An Empirical Evaluation Relative to Expert Judgment

人工智能辅助的需求工程:与专家判断的实证评估

Oz Levy, Ilya Dikman, Natan Levy, Michael Winokur

机构 * Faculty of Industrial Engineering and Technology Management, Holon Institute of Technology (HIT)(工业工程与技术管理学院,霍隆理工学院(HIT))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过对比AI辅助与专家评估,探讨AI在需求质量评估中的作用,证明其在一致性与快速性上的优势,但强调专家判断在上下文解释中的必要性。

Comments 13 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15203 2026-04-17 cs.CL 57%

MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events

MADE:一个多标签文本分类的活体基准,用于具有不确定性量化的医疗设备不良事件

Raunak Agarwal, Markus Wenzel, Simon Baur, Jonas Zimmer, George Harvey, Jackie Ma

机构 * Department of Artificial Intelligence(人工智能系) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) Berlin(柏林)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MADE基准,用于多标签文本分类,通过持续更新医疗设备不良事件报告,避免训练数据污染,评估不同模型在不确定性量化中的表现。

Comments Accepted at ACL 2026 Mains

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10866 2026-04-17 cs.CL 57%

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation

OccuBench:通过语言环境模拟评估AI代理在真实世界专业任务中的表现

Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

机构 * Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 OccuBench通过语言环境模拟评估AI代理在100个真实世界专业任务场景中的表现,涵盖10个行业类别和65个专业领域,发现大模型、新版本和高推理能力提升性能,但强代理不等于强环境模拟器。

Comments 23 pages, 8 figures, 2 tables. Project page: https://gregxmhu.github.io/OccuBench-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22175 2026-04-17 cs.CL 57%

DySCO: Dynamic Attention-Scaling Decoding for Long-Context Language Models

DySCO:动态注意力缩放解码用于长上下文语言模型

Xi Ye, Wuwei Zhang, Fangcong Yin, Howard Yen, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿语言与智能,普林斯顿大学) Department of Computer Science, New York University(纽约大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 DySCO通过动态调整注意力机制提升长上下文推理能力,利用检索头识别关键token并增强其权重,在多个基准测试中取得25%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09363 2026-04-17 cs.AI cs.SY eess.SY 57%

BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems

BarrierBench: 评估大型语言模型在动态系统安全验证中的性能

Ali Taheri, Alireza Taban, Sadegh Soudjani, Ashutosh Trivedi

机构 * Isfahan University of Technology(伊斯法罕技术大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BarrierBench基准,评估大型语言模型在动态系统安全验证中的能力,通过100个动态系统案例测试语言模型在生成安全证书和协调策略中的有效性。

Comments 8th Annual Learning for Dynamics & Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14846 2026-04-17 cs.CV cs.AI 57%

Zero-Shot Retail Theft Detection via Orchestrated Vision Models: A Model-Agnostic, Cost-Effective Alternative to Trained Single-Model Systems

通过协调视觉模型实现零样本零售盗窃检测:一种无需训练单个模型的低成本替代方案

Haileab Yagersew

机构 * Paza AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Paza框架,通过协调多个现有模型实现零样本零售盗窃检测,降低训练成本,利用多信号预过滤减少昂贵视觉语言模型调用次数,提升效率和准确性。

Comments 16 pages, 3 figures, Code to be released at https://github.com/xHaileab/Paza-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14709 2026-04-17 cs.AI 57%

HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试

Fan Cui, Hongyuan Hou, Zizhang Luo, Chenyun Yin, Yun Liang

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI 57%

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14513 2026-04-17 cs.CL 57%

PeerPrism: Peer Evaluation Expertise vs Review-writing AI

PeerPrism:同行评价专业性与审稿写作AI

Soroush Sadeghian, Alireza Daqiq, Radin Cheraghi, Sajad Ebrahimi, Negar Arabzadeh, Ebrahim Bagheri

机构 * University of Toronto, Reviewerly(多伦多大学,Reviewerly)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PeerPrism基准测试,通过20690篇同行评审数据,区分思想来源与文本来源,揭示现有检测方法在混合场景下的不足,强调需多维度建模作者身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14455 2026-04-17 cs.AI 57%

AIBuildAI: An AI Agent for Automatically Building AI Models

AIBuildAI: 一个用于自动构建AI模型的AI代理

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AIBuildAI通过分层代理架构自动构建AI模型,超越传统AutoML,实现端到端自动化,展示出在Kaggle风格任务中63.1%的获奖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14222 2026-04-17 cs.IR cs.AI 57%

Adaptive Query Routing: A Tier-Based Framework for Hybrid Retrieval Across Financial, Legal, and Medical Documents

自适应查询路由:一种分层框架,用于金融、法律和医疗文档的混合检索

Afshan Hashmi

机构 * TRDC, Tuwaiq Academy(TRDC,图瓦伊克学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种分层框架,通过比较三种检索架构在金融、法律和医疗领域的表现,揭示了不同检索方法在不同复杂度层级上的性能差异,强调了树状推理和混合检索在跨参考和多段查询中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09643 2026-04-17 cs.ET cs.AI 57%

MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings

MM-tau-p$^2$: 人格自适应提示用于双控制设置中多模态代理的鲁棒性评估

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出MM-tau-p$^2$基准,通过12个新指标评估多模态代理在双控制环境中的鲁棒性,结合用户输入解决查询,并展示即使使用前沿LLM,多模态鲁棒性等指标仍需考虑。

Comments A benchmark for evaluating multimodal both voice and text LLM agents in dualcontrol settings. We introduce persona adaptive prompting and 12 new metrics to assess robustness safety efficiency and recovery in customer support scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04578 2026-04-17 cs.CL 57%

LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence

LexGenius:一种大型语言模型在法律通用智能方面的专家级基准

Wenjin Liu, Haoran Luo, Xin Feng, Xiang Ji, Lijuan Zhou, Rui Mao, Jiapu Wang, Shirui Pan, Erik Cambria

机构 * Hainan University(海南大学) Nanyang Technological University(南洋理工大学) Nanjing University of Science and Technology(南京理工大学) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LexGenius,一个涵盖七个维度、十一项任务和二十项能力的中文法律基准,用于评估大型语言模型的法律通用智能,发现LLM在法律智能能力上存在显著差异,甚至优于人类法律专业人士。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15825 2026-04-17 cs.AI 57%

IMACT-CXR: An Interactive Multi-Agent Conversational Tutoring System for Chest X-Ray Interpretation

IMACT-CXR:一种用于胸部X光解读的交互式多智能体对话教学系统

Tuan-Anh Le, Anh Mai Vu, David Yang, Akash Awasthi, Hien Van Nguyen

机构 * University of Houston(德克萨斯大学休斯敦分校) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 IMACT-CXR通过整合空间标注、注视分析、知识检索和图像基础推理,构建了一个基于AutoGen的工作流,帮助学员提升胸部X光解读能力,实现了精准的教学反馈与知识强化。

Comments Accepted at IEEE ISBI 2026. This version corresponds to the accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14751 2026-04-17 cs.CL 57%

Query pipeline optimization for cancer patient question answering systems

癌症患者问答系统中的查询管道优化

Maolin He, Rena Gao, Mike Conway, Brian E. Chapman

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Health Data Science and Biostatistics, University of Texas Southwestern Medical Center(德克萨斯西南医学中心健康数据科学与生物统计学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种针对癌症患者问答系统的RAG查询管道三方面优化方法,通过改进文档检索、段落检索和语义表示,提升了回答准确性。

Comments This paper has been accepted as a Findings Paper in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14872 2026-04-17 cs.HC 50%

SkillDroid: Compile Once, Reuse Forever

SkillDroid: 一次编译,永久复用

Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci

专题命中 推理评测 :reasoning(abstract)

AI总结 SkillDroid通过编译成功的人工智能引导GUI轨迹为参数化技能模板,实现无需LLM调用的复用,显著提升任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14408 2026-04-17 cs.SE 50%

ToxiShield: Promoting Inclusive Developer Communication through Real-Time Toxicity Filtering

ToxiShield:通过实时毒性过滤促进包容性开发者沟通

MD Awsaf Alam Anindya, Showvik Biswas, Anindya Iqbal, Jaydeb Sarker, Amiangshu Bosu

专题命中 推理评测 :reasoning(abstract)

AI总结 ToxiShield通过实时毒性过滤工具提升软件工程团队的沟通效率,采用深度学习和大语言模型实现毒性检测、沟通指导和文本重构,验证了其在促进包容性和健康协作中的有效性。

Journal ref FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20122 2026-04-17 cs.CV 50%

MEBench: A Novel Benchmark for Understanding Mutual Exclusivity Bias in Vision-Language Models

MEBench:一种新的评估视觉-语言模型互斥偏差的基准

Anh Thai, Stefan Stojanov, Zixuan Huang, Bikram Boote, James M. Rehg

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 MEBench通过引入空间推理提升评估难度,评估视觉-语言模型对互斥偏差的处理能力,发现模型存在弱互斥偏差但能利用额外空间上下文解决歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 13 篇

2604.10681 2026-04-17 cs.CR cs.AI 93%

Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models

Critical-CoT: 一种针对大语言模型推理层后门攻击的稳健防御框架

Vu Tuan Truong, Long Bao Le

机构 * INRS, University of Quebec(INRS大学魁北克分校)

专题命中 其他推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Critical-CoT,通过双阶段微调提升大语言模型的批判性思维,使其能自动识别潜在后门并拒绝生成恶意推理步骤,有效防御推理层后门攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06153 2026-04-17 cs.CR 91%

SLIP: Soft Label Mechanism and Key-Extraction-Guided CoT-based Defense Against Instruction Backdoor in APIs

SLIP: 软标签机制和关键提取引导的基于CoT的API指令后门防御

Zhengxian Wu, Juan Wen, Wanli Peng, Haowei Chang, Yinghan Zhou, Yiming Xue

专题命中 其他推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SLIP机制,通过软标签和关键提取引导CoT方法,有效对抗API中的指令后门,实验显示攻击成功率降低至25.13%,清洁准确率提升至87.15%。

Comments This paper has been accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08310 2026-04-17 cs.LG cs.AI 88%

ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning

ORBIT:可控多预算推理的在线探索-利用

Kun Liang, Clive Bai, Xin Xu, Chenming Tang, Sanwoo Lee, Weijie Liu, Saiyong Yang, Yunfang Wu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) LLM Department, Tencent(腾讯LLM部门) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 ORBIT提出可控多预算推理框架,通过多阶段强化学习发现帕累托最优推理行为,并通过在线蒸馏融合行为,实现可控推理行为、高推理密度和统一模型集成。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04689 2026-04-17 cs.CL cs.AI cs.LG 88%

Improving Language Models with Intentional Analysis

通过意图分析改进语言模型

Yuwei Yin, Giuseppe Carenini

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出意图分析(IA)方法,通过显式调用意图感知分析和推理提升语言模型性能,实验表明IA在多个基准和模型上均优于CoT,有效解决意图误解等问题。

Comments Code at https://github.com/YuweiYin/IA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14631 2026-04-17 cs.CL cs.AI 81%

StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation

StoryCoder: 为LLM代码生成中的结构化推理提供叙述改写

Geonhui Jang, Dongyoon Han, YoungJoon Yoo

机构 * Dept. of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系) NAVER AI Lab(NAVER AI 实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 StoryCoder通过将代码生成问题转化为连贯的自然语言叙述,提升模型推理和规划能力,实验显示在多个数据集上平均提升18.7%的零样本准确率,且改进了算法策略和代码结构。

Comments 21 pages, 12 figures. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏