arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11496 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2608.11655 2026-08-13 cs.CV cs.AI 新提交 92%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.AI

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08786 2026-08-11 cs.AI 新提交 92%

SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

SymDiag:基于神经符号验证的LLM推理可解释诊断

Wenyao Cui, Huaping Zhang, Yongyi Huang, Qiuchi Li, Jian Xu, Cheng-Lin Liu, Chunxiao Gao, Juan Wang, Baohua Zhang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Xinjiang Future Enterprise Incubator Co., Ltd.(新疆未来企业孵化器有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SymDiag是一种神经符号框架,将LLM推理验证重构为结构化故障诊断,可定位推理故障步骤、分离翻译与推理错误,在多类基准中提升了不可靠推理检测与推理修复反馈效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07520 2026-08-11 cs.CY cs.AI 新提交 92%

KumbhDoot: A Scale-Ready, LLM-Bounded Architecture for Mass-Gathering Public-Service Assistants

KumbhDoot:面向大规模集会公共服务助手的可扩展、大语言模型(LLM)限定架构

Saurabh Sakalkar, Abhishek Singh, Ramesh Raskar

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大壶节这类高风险低连接性的大规模集会,提出KumbhDoot架构,以相似度优先、LLM限定为核心,解决默认LLM助手成本高、易幻觉等问题,适配公共服务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03550 2026-08-05 cs.AI 新提交 92%

Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve

随着大型语言模型(LLM)性能提升,软引导开始优于思维链(CoT)提示

Denys Pushkin, Albert Q. Jiang, Aryo Lotfi, Colin Sandon, Emmanuel Abbé

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究发现,随着LLM性能提升,标准CoT提示的干扰作用凸显,推理专用模型在零样本设置下的数学推理性能优于少样本CoT提示。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28908 2026-08-03 cs.LG 新提交 92%

Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds

反思还是重新生成?为什么大型语言模型(LLM)的修正会失败,而人类的修正却能成功

Yefan Tao, Gerald Friedland, Madhusudhanan Chandrasekaran, Luyang Kong

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出人类-LLM反思框架(HRF)对比人类与LLM的修正,发现LLM反思在客观任务增益近零、主观任务增益为负,本质是条件重新生成,而非真正的错误驱动修正。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27879 2026-07-31 cs.AR cs.AI 新提交 92%

ARES: Adaptive Reasoning-Effort Steering for PPA- and Cost-Aware RTL Optimization with LLM Agents

ARES:面向PPA和成本感知的LLM智能体RTL优化的自适应推理力度调控

Stef Cuyckens, Mihaela Jivanescu, Jun Yin, Chao Fang, Marian Verhelst

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARES是一款面向PPA和成本感知的LLM智能体RTL优化框架,通过自适应调控推理力度,在相同成本下提升优化效果,缩小了LLM生成与手工优化单元的差距。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27760 2026-07-31 cs.IR cs.AI 新提交 92%

Hierarchical Latent Reasoning for LLM-based Recommendation

面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法

Peiyu Hu, Siying Gu, Weihai Lu, Zhuodong Liu, Yuntian Tang, Jiahao Liang, Yiying Xie, Jiang Rong, Zhaokai Luo, Zhiyong Wang, Jia Wang

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08068 2026-07-09 cs.LG 新提交 92%

DICE: Entropy-Regularized Equilibrium Selection for Stable Multi-Agent LLM Coordination

DICE: 用于稳定多智能体LLM协调的熵正则化均衡选择

Yi Xie, Zhanke Zhou, Chentao Cao, Bo Liu, Bo Han

机构 * University of Arizona(亚利桑那大学) Hong Kong Baptist University(香港浸会大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DICE框架,通过熵正则化均衡选择(HQRE)解决多智能体LLM协调中的不稳定性,实现线性收敛和有限贝叶斯遗憾,在11个基准上平均提升4.3-8.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00937 2026-07-02 cs.CL 新提交 92%

Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions

不受欢迎的人:多选问答中LLM角色驱动生成在不同维度上不稳定

César Guerra-Solano, Xiang Lorraine Li

机构 * Department of Computer Science, University of Pittsburgh(匹兹堡大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出三个指标评估LLM在MCQA任务中角色驱动生成的不稳定性,发现模型家族、大小、问题领域及提示格式均影响稳定性,且不稳定性与任务准确性相关。

Comments 23 pages, 12 figures. Under review at ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31073 2026-07-01 cs.AI cs.MA cs.RO 新提交 92%

MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning

MultiUAV-Plat:面向多无人机协同任务规划的LLM平台、基准测试与框架

Sheng Zhang, Qinglin Li, Yuechao Zang, Xueqin Huang, Yijia Fu, Cheng Zhu

机构 * National Key Laboratory of Information Systems Engineering, National University of Defense Technology(国防科技大学信息系统工程国家重点实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MultiUAV-Plat平台与基准测试,以及Agent4Drone框架,通过LLM驱动的工具交互实现多无人机协同任务规划,在任务通过率等指标上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26590 2026-06-26 cs.LG cs.CR 新提交 92%

Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

实证软件工程 TerraProbe: 用于检测LLM辅助Terraform中欺骗性修复的分层Oracle框架

Manar Alsaid, Chimdumebi Nebolisa, Faris Abbas

机构 * East Texas A&M University(东德克萨斯农工大学) Texas Woman’s University(德克萨斯女子大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TerraProbe五层Oracle框架,评估LLM辅助Terraform安全修复,发现71.4%的真实修复为欺骗性修复,并建立四维欺骗性修复分类法。

Comments 34 pages, 12 figures, 14 tables. Journal-first manuscript submitted to Empirical Software Engineering. Primary classification: cs.SE; cross-list: cs.CR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15862 2026-06-23 cs.AI 新提交 92%

RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments

RetailBench: 在真实零售环境中评估LLM代理的长期推理与连贯决策能力

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RetailBench基准,模拟单店超市运营,评估LLM代理在长期决策中的表现,发现多数模型无法持续生存,与最优策略差距显著。

Comments The submission of this paper was a mistake. This is the second version of arXiv:2603.16453, so it should have replaced the original 2603 version through a replacement submission, rather than being published as a new paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17682 2026-06-17 cs.CL 新提交 92%

From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning

从受训者到训练者:用于多智能体推理的LLM设计的强化学习训练环境

Chao Chen, Chengzu Li, Zhiwei Li, Yinhong Liu, Zhijiang Guo

机构 * LARK, HKUST (GZ)(香港科技大学(广州)LARK实验室) University of Cambridge(剑桥大学) HKUST(香港科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LLM-as-Environment-Engineer框架,让策略模型自动分析失败轨迹并修改训练环境配置,在MAPF-FrozenLake测试平台上用Qwen3-4B实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16545 2026-06-16 cs.CL 新提交 92%

Can LLM Coding Agents Reason About Time Series?

LLM 编码智能体能否推理时间序列?

Filip Rechtorík, Ondřej Dušek, Zdeněk Kasner

机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15258 2026-06-16 cs.AI 新提交 92%

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线

Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13607 2026-06-16 cs.AI 新提交 92%

Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning

推理即模式匹配:人类与LLM日常推理中的共享机制

Zach Studdiford, Gary Lupyan

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过比较人类和25个LLM在日常因果推理中的错误模式,发现两者均表现出模式匹配而非抽象世界模型驱动的推理,并识别出LLM中驱动响应的注意力头可预测人类推理错误。

Comments 13 pages main text, 51 pages supplementary text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10507 2026-06-10 cs.AI 新提交 92%

HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning

HIPIF: 面向长视界LLM智能体学习的层次化规划与信息折叠

Juncheng Diao, Zhicong Lu, Peiguang Li, Yongwei Zhou, Changyuan Tian, Qingbin Li, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出层次化规划与信息折叠方法,通过子目标分解和历史折叠减少长上下文干扰,结合层次化反思和子目标过程奖励,提升LLM在多轮长视界任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08596 2026-06-09 cs.AI cs.HC 新提交 92%

Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration

将LLM推理蒸馏为可解释的策略树用于人机协作

Beiwen Zhang, Yongheng Liang, Guowei Zou, Haitao Wang, Hejun Wu

机构 * Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Co-pi-tree方法,通过将大语言模型推理蒸馏为可执行策略树,在Overcooked-AI中平均奖励提升35.4%,同时减少77.7%的LLM查询和97.1%的测试延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05391 2026-07-08 cs.AI cs.CL cs.LG cs.MA cs.RO 新提交 91%

LLM-as-a-Verifier: A General-Purpose Verification Framework

LLM-as-a-Verifier:一种通用验证框架

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(英伟达研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。

Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18232 2026-08-20 cs.MA 新提交 91%

Contracting for LLM Delegation: Moral Hazard in Technology and Effort Choice

LLM委托的契约:技术与努力选择中的道德风险

Nanda Kishore Sreenivas, Kate Larson

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究扩展委托-代理框架至LLM委托场景,推导最优线性契约,用MATH、MMLUPro基准校准模型,证明线性契约可激励智能体的技术感知委托行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17154 2026-08-19 cs.CR 新提交 91%

Beyond the Hype: Evaluating LLM Integration and Practical Limitations in Security Operation Centers

超越炒作:评估安全运营中心(SOC)中大型语言模型(LLM)的集成与实际局限性

Elnaz Rabieinejad, Ali Dehghantanha, Fattane Zarrinkalam, Sarina Dastgerdy

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过对20位不同类型SOC从业者的半结构化访谈,分析了LLM在SOC中的应用现状、存在的局限性,提出了LLM集成成熟度标准及相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13791 2026-08-17 eess.IV cs.CV 新提交 91%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06760 2026-08-10 cs.NI 新提交 91%

A Parameter-Specific Retrieval and Knowledge-Guided Reasoning Framework for LLM-Based GPSR Optimization in FANETs

面向FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架

Zhipeng Lin, Bin Duo, Tong Liu, Jie Lin, Jianting Yuan, Xiaojun Yuan

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对FANET中现有GPSR协议难以适配动态环境的问题,提出基于LLM的PMKR-GPSR框架,通过参数特定多索引检索和知识引导约束图实现协议一致的路由参数适配,在高移动性场景下提升了数据包投递率并降低了端到端时延。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27684 2026-06-29 cs.IR 新提交 91%

Intuition-Guided Latent Reasoning for LLM-Based Recommendation

直觉引导的潜在推理用于基于LLM的推荐

Chang Liu, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Qifan Wang, Fuli Feng, Wenge Rong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出IntuRec框架,通过提取用户历史生成候选集作为直觉,注入偏好对齐的直觉嵌入初始化潜在推理起点,提升LLM推荐推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25489 2026-06-25 cs.HC 新提交 91%

When LLM Rationales Become User-Facing: Effects on Trust Perception, Decision-Making, and Gaze Behaviors

当LLM推理理由面向用户时:对信任感知、决策和注视行为的影响

Xin Sun, Ting Pan, Yajing Wang, Shu Wei, Jos A. Bosch, Isao Echizen, Abdallah El Ali, Saku Sugawara

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过两项实验(在线和眼动追踪)探讨LLM推理理由的呈现方式、正确性和确定性框架对用户信任、决策和注视行为的影响,发现不正确理由降低信任并增加认知负荷,挑战了“更多推理更好”的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21451 2026-06-23 cs.AR 新提交 91%

Closing the Loop on LLM-Generated RTL Assertions with Quality-Aware Formal Verification

用质量感知的形式化验证闭环LLM生成的RTL断言

Ramesh Krishnamurthy, Danial Chitnis, Themis Prodromakis

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM生成RTL断言中的虚假通过、证明成本差异大和失败轨迹难解释问题,提出轻量级开源框架,通过突变引导精炼、求解器选择和因果叙事合成来提升断言质量和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19514 2026-06-19 cs.HC 新提交 91%

LLM-Mediated Human-AI Interaction in Search and Rescue: Impact of Expertise on Attentional Allocation

LLM介导的人机交互在搜索与救援中的应用:专业知识对注意力分配的影响

Elahe Oveisi, Hemanth Manjunatha

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过模拟搜索救援任务,比较有无大语言模型(LLM)指导的条件,结合眼动追踪和行为分析,发现LLM提升任务效率但未增加总救援人数,并揭示了注意力-指导权衡,其中专业知识调节了用户对AI的依赖模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11755 2026-06-11 cs.SE 新提交 91%

Acoda: Adversarial Code Obfuscation for Defending against LLM-based Analysis

Acoda:对抗性代码混淆防御基于LLM的分析

Hongzhou Rao, Zikan Dong, Yanjie Zhao, Haodong Li, Haoyu Wang

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出基于遗传算法的对抗性代码混淆框架Acoda,通过8种语义保留的混淆方法迭代优化,有效诱导LLM拒绝或误判代码分析,在7个先进LLM上攻击成功率高达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10264 2026-06-10 cs.CR cs.SE 新提交 91%

RECON: An LLM-Enhanced Backward Constraint Analysis Framework

RECON:一种增强LLM的逆向约束分析框架

Babangida Bappah, Lamine Noureddine, Umar Farooq, Aisha Ali-Gombe

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出RECON框架,结合LLM语义理解与静态分析,从Android字节码中提取精确执行约束,比传统符号执行快5.8倍且成功率达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20520 2026-07-24 cs.AI cs.HC cs.PL 新提交 91%

Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving

数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性

Sagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。

Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏