arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 152 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 152 篇

2604.07960 2026-04-21 cs.CV cs.AI cs.CL 93%

TOOLCAD: Exploring Tool-Using Large Language Models in Text-to-CAD Generation with Reinforcement Learning

TOOLCAD: 探索用于文本到CAD生成的工具使用大型语言模型与强化学习

Yifei Gong, Xing Wu, Wenda Liu, Kang Tu

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本文提出TOOLCAD框架,利用LLM作为工具使用代理进行文本到CAD生成,并通过交互式CAD建模环境和强化学习提升模型性能。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17794 2026-04-21 cs.CL cs.AI 93%

Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling

通过测试时间扩展弥合越南语中的推理差距

Bui The Trung, Do Minh Duc, Nguyen Van Vinh, Bui Nguyen Quoc Trinh

机构 * Computer Science and Engineering(计算机科学与工程) Information Science Faculty(信息科学系) Faculty of Information(信息学院) Faculty of Advanced Technologies and Engineering(先进技术和工程学院) VNU Vietnam(越南VNU) Japan University(日本大学) JAIST VNU University of Engineering and Technology(VNU工程大学) VNU Vietnam Japan University(越南日本大学) Hanoi, Vietnam(越南河内) Ishikawa, Japan(日本石川)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SFT(summary_cn,abstract);LLM(abstract)

AI总结 本文研究了在越南小学数学中通过测试时间扩展策略提升小语言模型推理能力,提出Vi-S1K和Vi-Elementary-Bench基准,发现SFT显著提升解释质量,证明简化测试时间扩展优于复杂代理流程。

Comments FJICAI conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17819 2026-04-21 cs.CL cs.AI 92%

PDDL-Mind: Large Language Models are Capable on Belief Reasoning with Reliable State Tracking

PDDL-Mind:大型语言模型在具有可靠状态跟踪的信念推理中表现出色

Wang Bill Zhu, Qiutong Tony Yi, Robin Jia, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 PDDL-Mind通过将叙述描述转换为显式状态和动作,为LLM提供了一致的世界状态表示,从而在信念推理任务中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17807 2026-04-21 cs.CV cs.RO 92%

Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement

Re²MoGen:通过LLM推理和物理感知细化的开放词汇运动生成

Jiakun Zheng, Ting Xiao, Shiqin Cao, Xinran Li, Zhe Wang, Chenjia Bai

机构 * East China University of Science and Technology(东华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 Re²MoGen通过LLM推理生成初始运动计划,并利用强化学习细化物理合理性,实现开放词汇运动生成的高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10779 2026-04-21 cs.CL cs.AI 92%

Improving Speech Recognition of Named Entities in Classroom Speech with LLM Revision and Phonetic-Semantic Context

通过LLM修订和音义上下文提高课堂语音中命名实体的语音识别

Viet Anh Trinh, Xinlu He, Jacob Whitehill

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM修订和音义上下文提升课堂语音中命名实体的识别准确率,通过MIT课程数据集验证,实现30%的WER降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14913 2026-04-21 cs.CL 92%

Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages

弥合文化鸿沟:一种基于LLM的数学应用题社会文化本地化的框架

Israel Abebe Azime, Tadesse Destaw Belay, Dietrich Klakow, Philipp Slusallek, Anshuman Chhabra

机构 * Saarland University(萨尔兰大学) Saarland Informatics Campus(萨尔兰信息技术校园) Instituto Politécnico Nacional(墨西哥理工学院) University of South Florida(佛罗里达州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的数学应用题社会文化本地化框架,通过自动构建包含本地名称、组织和货币的本地化数据集,缓解英语中心主义偏差并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11038 2026-04-21 cs.CL 92%

Budget-Aware Anytime Reasoning with LLM-Synthesized Preference Data

具有预算意识的任意时间推理与LLM合成的偏好数据

Xuanming Zhang, Shwan Ashrafi, Aziza Mirsaidova, Amir H. Rezaeian, Miguel Ballesteros, Lydia B. Chilton, Zhou Yu, Dan Roth

机构 * Columbia University(哥伦比亚大学) Oracle AI

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究在有限计算预算下LLM的推理行为,提出任意时间推理框架和Anytime Index指标,通过LLM合成的偏好数据提升推理效率与质量。

Comments ACL 2026 Findings, 13 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI 91%

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17255 2026-04-21 cs.CL 91%

Are Emotion and Rhetoric Neurons in LLM? Neuron Recognition and Adaptive Masking for Emotion-Rhetoric Prediction Steering

LLM中是否存在情绪与修辞神经元?神经元识别与自适应遮蔽用于情绪-修辞预测引导

Li Zheng, Xin Zhang, Shuyi He, Fei Li, Chong Teng, Jiangming Yang, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算 key laboratory,教育部,武汉大学计算机科学与工程学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究LLM中情绪与修辞神经元的表示机制及内在关联,提出神经元识别框架与自适应遮蔽方法,实现神经元功能的可靠验证,通过神经元调控提升情绪任务与修辞表达的精细控制。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02871 2026-04-21 cs.CL cs.AI 91%

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning

位置:多模态大语言模型可以显著推动科学推理

Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文探讨多模态大语言模型在科学推理中的应用,提出四阶段研究路线,指出当前模型在跨领域推理中的潜力与挑战,为实现通用人工智能提供新视角。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09351 2026-04-21 cs.CL 90%

ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering

ReTraceQA:评估小语言模型在常识问答中的推理轨迹

Francesco Maria Molfese, Luca Moroni, Ciro Porcaro, Simone Conia, Roberto Navigli

机构 * Sapienza NLP Group(萨皮恩扎大学自然语言处理小组) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 ReTraceQA通过引入过程级评估,揭示小语言模型在常识推理中存在大量推理过程错误,但最终答案正确的情况,表明现有评价方法高估了模型能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22297 2026-04-21 cs.AI 90%

Large Language Models as Nondeterministic Causal Models

大型语言模型作为非确定性因果模型

Sander Beckers

机构 * University College London(伦敦大学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于非确定性因果模型的简单方法,用于生成大型语言模型的反事实,该方法无需修改黑盒模型,且能基于其预期语义进行反事实推理。

Comments Accepted at KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16929 2026-04-21 cs.CL 90%

MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning

MeasHalu:通过增强推理缓解大型语言模型中的科学测量幻觉

Ruijun Huang, Zhiqiao Kang, Yuxuan Zhu, Junxiong Li, Jiahao Zhao, Minghuan Tan, Feng Jiang, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL

AI总结 本文提出MeasHalu框架,通过增强推理和针对性优化缓解LLM的科学测量幻觉问题,改进测量提取的准确性。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23808 2026-04-21 cs.LG cs.CL 90%

Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning

在RLVR中对LLM推理进行语义空间探索与利用

Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Shenzhen Technology University(深圳技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。

Comments Accepted as an ACL 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19944 2026-04-21 q-fin.TR q-fin.ST 90%

Large Language Models and Stock Investing: Is the Human Factor Required?

大语言模型与股票投资:是否需要人类因素?

Ricardo Crisostomo, Diana Mykhalyuk

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究大语言模型能否生成可靠的股市预测,发现其预测能力受限于推理错误,需人类监督以提升表现。

Comments 33 pages; 6 tables; 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18464 2026-04-21 cs.LG 90%

Semantic Step Prediction: Multi-Step Latent Forecasting in LLM Reasoning Trajectories via Step Sampling

语义步预测:通过步采样进行LLM推理轨迹中的多步潜在预测

Yidi Yuan

机构 * Home Team Science and Technology Agency(家庭团队科技机构)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过步采样改进语义管预测方法,提升多步潜在预测的准确性,并提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17364 2026-04-21 cs.AI cs.MA cs.PL 90%

LLM-Guided Strategy Synthesis for Scalable Equality Saturation

基于大型语言模型的策略合成用于可扩展的等式饱和

Chenyun Yin, Youwei Xiao, Yuze Luo, Yuyang Zou, Yun Liang

机构 * Peking University(北京大学) School of Integrated Circuits(集成电路学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EggMind框架,通过领域特定语言EqSatL和LLM引导的代理工作流,高效合成可重用的等式饱和策略,提升资源质量平衡,减少成本和内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04825 2026-04-21 cs.CL cs.AI 90%

Plausibility as Commonsense Reasoning: Humans Succeed, Large Language Models Do not

可解释性作为常识推理:人类成功,大语言模型却不成功

Sercan Karakaş

机构 * University of Chicago(芝加哥大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型是否能像人类一样在歧义解析中结合世界知识与句法结构。通过土耳其前置定语从句附着歧义,发现人类表现出显著的可解释性效应,而大语言模型则表现不一致。

Comments Accepted to The Workshop on Cognitive Modeling and Computational Linguistics co-located with LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL 89%

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14628 2026-04-21 cs.PL cs.AI cs.CR cs.LO 89%

s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs

s2n-bignum-bench:评估LLM低级代码推理能力的实用基准

Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出s2n-bignum-bench基准,用于评估LLM在工业级低级密码学汇编代码中的定理证明能力,通过形式化验证挑战证明生成。

Comments Accepted as a Workshop paper at AIPV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17243 2026-04-21 cs.CV 89%

RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation

RemoteShield:为地球观测启用鲁棒的多模态大语言模型

Rui Min, Liang Yao, Shiyu Miao, Shengxiang Xu, Yuxuan Liu, Chuanyi Zhang, Shimin Di, Fan Liu

机构 * Hohai University(河海大学) Nanjing University(南京大学) Southeast University(东南大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 本文提出RemoteShield,一种针对地球观测的鲁棒多模态大语言模型,通过偏好学习提升在现实输入变化下的稳定性与一致性,实验显示其在多模态扰动下表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17501 2026-04-21 cs.CL 89%

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

CoAct:基于人机协同的LLM偏好学习

Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

机构 * Northwestern University(西北大学) Google(谷歌) University of Southern California(南加州大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出CoAct框架,通过策略性的人机协作结合自奖励与主动学习,提升LLM在不同任务中的对齐效果,在三个推理基准测试中取得显著提升。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO 88%

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17159 2026-04-21 cs.CR cs.AI cs.CL 88%

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks

前沿大语言模型在进攻性网络任务中的系统能力评估

Tyler H. Merves, Michael H. Conaway, Joseph M. Escobar, Hakan T. Otal, Unal Tatar

机构 * Department of Cybersecurity(网络安全系) Department of Information Sciences and Technology(信息科学与技术系) College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院) University at Albany, SUNY(阿尔巴尼大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文系统评估了10个前沿大语言模型在进攻性网络任务中的表现,发现环境工具和模型选择是性能的主要驱动因素,而提示工程在装备良好的环境中效果下降。

Comments 6 pages, 4 figures. Submitted to the IEEE Systems and Information Engineering Design Symposium (SIEDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08299 2026-04-21 cs.CL cs.AI 88%

SeLaR: Selective Latent Reasoning in Large Language Models

SeLaR:大语言模型中的选择性潜在推理

Renyu Fu, Guibo Luo

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸式媒体技术重点实验室) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SeLaR通过引入熵门机制和熵感知对比正则化,解决大语言模型中链式推理的稳定性与探索性问题,优于标准CoT和训练自由方法。

Comments Camera-ready for ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16995 2026-04-21 cs.CL cs.LG 88%

SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

SPS:通过引导概率压缩在大型语言模型强化学习中的更好探索

Yifu Huo, Chenglong Wang, Ziming Zhu, Shunjie Xing, Peinan Feng, Tongran Liu, Qiaozhi He, Tianhua Zhou, Xiaojia Chang, Jingbo Zhu, Zhengtao Yu, Tong Xiao

机构 * Northeastern University(东北大学) CAS Key Laboratory of Behavioral Science(中国科学院行为科学重点实验室) Independent Researcher(独立研究员) Kunming University of Science and Technology(昆明理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SPS方法,结合传统强化学习与逆强化学习,通过引导轨迹分布提升探索能力,改进多样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11140 2026-04-21 cs.CL cs.AI 88%

Follow the Path: Reasoning over Knowledge Graph Paths to Improve Large Language Model Factuality

跟随路径:通过知识图谱路径推理提升大语言模型事实性

Mike Zhang, Johannes Bjerva, Russa Biswas

机构 * University of Copenhagen(哥本哈根大学) Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出fs1方法,通过收集大推理模型的推理轨迹并将其锚定在知识图谱路径上,提升大语言模型的事实性,在六个复杂开放领域问答基准测试中表现优异。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17884 2026-04-21 cs.AI 88%

SPREG: Structured Plan Repair with Entropy-Guided Test-Time Intervention for Large Language Model Reasoning

SPREG:基于熵引导的测试时干预的结构化计划修复用于大语言模型推理

Xuan Wang, Yu Ming, Xinhao Zhong, Xinyu Yu, Wenjie Wang, Shuai Chen, Wei Lin

机构 * Meituan(美团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SPREG通过熵引导的测试时干预,解决大语言模型在长链推理中的逻辑幻觉和随机漂移问题,通过动态修复机制提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05543 2026-04-21 cs.CL cs.SD eess.AS 88%

Closing the Modality Reasoning Gap for Speech Large Language Models

弥合语音大语言模型的模态推理差距

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出TARS框架,通过不对称奖励设计对齐文本和语音条件轨迹,显著缩小模态推理差距并在7B级语音大语言模型中取得最佳性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04509 2026-04-21 cs.CL 88%

ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection

ErrorRadar:通过错误检测基准测试多模态大语言模型的复杂数学推理能力

Yibo Yan, Shen Wang, Jiahao Huo, Hang Li, Boyan Li, Jiamin Su, Xiong Gao, Yi-Fan Zhang, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang, Hui Xiong, Philip S. Yu, Xuming Hu, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MSU(密歇根州立大学) UCAS(中国科学技术大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ErrorRadar通过错误检测任务评估多模态大语言模型在复杂数学推理中的能力,包含2500个高质量K-12数学问题,实验显示GPT-4o仍比人类评价差10%。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏