Semantic Anomaly Detection with Large Language Models
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Work in Progress. Version 2
专题命中 推理与问题求解 :language model(title,abstract);prompting(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Walmart Global Tech(沃尔玛全球科技)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments Keywords: text-to-SQL LLM, fine-tuning, meta-aware leanring, metadata, chain-of-thought, BigQuery SQL, business database
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments Accepted to EMNLP 2023 (Main Conference). Code available at https://github.com/romanlee6/multi_LLM_comm
Journal ref in Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, Page 180-192, ACL
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
Comments Published in NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following
一种用于隐私风险分析的人-大语言模型(LLM)协同框架:以基于央行数字货币(CBDC)的福利方案为例
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出用于隐私风险分析的人-LLM协同框架PRIAM,以CBDC福利方案为例验证,该框架通过人机迭代协作优化隐私风险评估,为相关领域提供基础贡献。
Comments 10 pages
重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。
BRA-Audit:基于累积暴露审计点放置的LLM多智能体系统预算运行时审计
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 BRA-Audit是一种预算感知的LLM多智能体系统运行时审计框架,通过贪心调度放置审计点,在保障防护性能的同时降低了17.2%-40.6%的端到端token消耗。
提示的价值:一种大语言模型(LLM)相对柯尔莫哥洛夫复杂度的方法
机构 * Cornell Tech(康奈尔科技学院) ; Technion(以色列理工学院) ; TAU(特拉维夫大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 该研究提出LLM相对的概率性Levin–柯尔莫哥洛夫复杂度pKt,将提示价值定义为相对于pKt的算法互信息,可高效估算,且提示价值b位对应无提示时复制z的中位数token成本为有提示时的2^b倍。
Second Thought:LLM智能体行动与观察时的并行推理
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。
LLM-Advisor: 一种用于多地形高效路径规划的LLM基准
机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) ; Department of Information and Communication Engineering, The University of Tokyo(东京大学信息与通信工程系)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 LLM-Advisor利用大型语言模型优化多地形路径规划,提升路径成本效率,适用于现实场景。
Comments This paper has been accepted by IEEE Transactions on Automation Science and Engineering
大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。
Comments 17 pages, 8 figures, 8 tables
就绪队列:在LLM智能体控制中限定GPU机会并避免主机往返
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 该研究针对LLM智能体控制,提出就绪队列边界的形式化方法,通过实验验证设备驻留路由决策路径可提升效率,为GPU智能体控制确立了两个可测量门限。
Comments 14 pages, 4 figures. Includes formal proofs, trace provenance, and a reproducibility appendix. Code and artifacts: https://github.com/josefchen/ready-cohorts ; processed evidence: https://huggingface.co/datasets/josefchen/ready-
智能体技能可能有害:LLM智能体中技能诱导故障的实证研究
机构 * Huazhong University of Science and Technology(华中科技大学) ; Microsoft Research(微软研究院) ; Microsoft(微软) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。
REATS:基于大语言模型推理的集成学习用于自适应时间序列预测
机构 * Fudan University(复旦大学) ; Microsoft Research(微软研究院) ; Nankai University(南开大学) ; Jilin University(吉林大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.LG
AI总结 该研究针对单一时间序列预测模型的局限性,提出基于LLM推理的REATS集成方法,通过三方面设计实现样本自适应可解释加权,在八个基准测试上优于竞争基线,具备强泛化与迁移能力。
思维简写:通过熵引导的超令牌压缩LLM推理
机构 * Writer, Inc.(Writer公司)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出通过熵引导的超令牌压缩技术,减少LLM推理过程中的计算开销,同时保留推理结构信息,提升可解释性和效率。
Comments Accepted to COLM 2026. Code available at https://github.com/Writer/shorthand-for-thought
从相关性到执行效用:面向基于技能的大语言模型智能体的奖励感知动态执行门控
机构 * Tongji University(同济大学) ; The University of Sydney(悉尼大学) ; University of Science and Technology of China(中国科学技术大学) ; Nankai University(南开大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City University of Hong Kong(香港城市大学) ; University of Surrey(萨里大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对基于技能的LLM智能体执行决策难题,提出RADEG轻量型决策层,通过学习代理模型预测执行效用,在288个rollout的评估中减少不必要执行并优于基线方法
用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由
机构 * Duke University(杜克大学) ; Netflix(网飞公司)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。
Comments 20th ACM Conference on Recommender Systems (RecSys 2026)
Agent-MD:用于有状态GCMC-MD模拟流程的带事件驱动升级机制的选择性大语言模型干预框架
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Agent-MD框架将LLM推理选择性用于GCMC-MD分子模拟流程的构建与事件审查,结合确定性执行,在蒙脱石水蒸汽脱附模拟中完成多周期计算,识别问题并揭示体系依赖的低湿度响应,实现可复现的代理辅助分子模拟。
Comments 7 figures, 2 tables
PPDL:基于大语言模型的流作为概率程序
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出用于编程基于LLM的流的概率语言PPDL,可量化传播流中不确定性,无需额外代码即可尝试推理缩放技术,还通过实验及面向Rocq的定理证明智能体案例验证了其能力。
Comments Published at ICML 2026
HyperAgent:面向工具-模式超图的规划与执行,用于工具使用型大语言模型智能体
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 HyperAgent是一种基于工具-模式超图的LLM智能体框架,通过构建相关图引导任务规划与执行,在AppWorld实验中提升了任务完成性能并降低了资源消耗。
X-KGRank:一种基于知识图谱检索增强的推荐框架,通过模式挖掘与大语言模型重排序实现可解释推荐
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 X-KGRank是一种知识图谱检索增强推荐框架,结合协同过滤与LLM解释,在MovieLens-1M数据集上提升了推荐指标,且小参数LLM可实现相当的解释质量但更易产生事实错误。
AMTFV:面向LLM自校正的智能体数学工具流验证
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究针对LLM数学答案验证难题,提出AMTFV方法,通过MTF接口解耦验证建模与执行,在5个数学推理数据集上较基线提升最高8.3个百分点,验证复杂度越高增益越显著。
Comments 19 pages, 9 figures
通过互补驱动的迭代协作挖掘大语言模型群体的智慧
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对现有LLM组合方法忽略动态互补性的问题,提出WILC框架,通过迭代反思优化与双门互补模型选择机制,在四个基准上性能优于现有方法,成本仅为GPT-5.2的约1/7,扩展了群体智慧理论并提供多AI协调设计原则。
通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。
开源大语言模型驱动的形式化验证:用于RTL修复的多智能体流水线
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出将LLM与开源形式化后端结合的多智能体RTL修复流水线,通过反例引导迭代实现RTL修复,经ALU案例及6基准测试验证可行性并分析失效模式。
Comments 6 pages, 3 figures
在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计
机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Springbrand Inc.(春品牌公司) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北京航空航天大学) ; Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) ; Microsoft(微软公司)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。
Comments 11 pages