arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1562 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1562 篇

2606.24420 2026-06-24 cs.CL 新提交 87%

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎

Nitesh Kumar

机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。

Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22570 2026-06-23 cs.CL 新提交 87%

What are Key Factors for Updates in RL for LLM Reasoning?

RL提升LLM推理能力的关键更新因素是什么?

Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15633 2026-06-18 cs.LG 新提交 87%

Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning

形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理

Donald Loveland, Puja Trivedi, Ari Weinstein, Edward W Huang, Danai Koutra

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17514 2026-06-17 cs.SE cs.AI 新提交 87%

Unlocking LLM Code Correction with Iterative Feedback Loops

解锁大语言模型代码修正的迭代反馈循环

Le Zhang, Suresh Kothari

机构 * Iowa State University(爱荷华州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。

Comments 22 pages, 14th Computing Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12935 2026-06-12 cs.AI 新提交 87%

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略

Wenbo Chen, Puheng Li, Mengyang Liu, Weijie Su, Tianpei Xie

机构 * Amazon(亚马逊) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08543 2026-06-09 cs.AI 新提交 87%

PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR

PAEC:面向RLVR中LLM推理的位置感知熵校准

Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出位置感知熵校准(PAEC),通过局部top-p熵和top-2候选竞争构建软掩码,并施加基于锚点的下界惩罚,防止决策相关位置熵崩溃,提升数学推理性能。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08122 2026-06-09 cs.AI 新提交 87%

Think Before You Act: Intention-Guided Reasoning for LLM-Based Location Prediction

三思而后行:基于意图引导推理的LLM位置预测

Qingxiang Liu, Anqi Liang, Zhuoyang Jiang, Yutian Jiang, Sisuo Lyu, Yu Ji, Haomin Wen, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出IntentPOI框架,通过两阶段意图引导推理(先推断用户出行意图,再基于意图选择POI),将位置预测从直接轨迹匹配转化为意图推理,在三个真实数据集上超越11个基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07190 2026-06-08 cs.CL 新提交 87%

From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

从正确性到效用:基于增益的LLM推理前缀评估

Yuhang Zhou, Yixin Cao, Guangnan Ye

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出前缀增益概念,训练前缀效用模型(PUM)通过成对排序目标评估推理前缀对成功率的提升,在数学推理任务中优于传统正确性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06745 2026-06-08 cs.CL 新提交 87%

When to Think Deeply: Inhibitory Deliberation for LLM Reasoning

何时深度思考:用于LLM推理的抑制性深思

Zhixuan He, Yue Feng

机构 * University of Birmingham, United Kingdom(英国伯明翰大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出IDPR框架,通过抑制控制器根据快速答案决定是否启动慢速推理,在数学推理测试集上仅调用8.20%的慢速推理,准确率从47.90%提升至48.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交 87%

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11027 2026-08-12 cs.LG cs.CL 新提交 87%

Mapping and Measuring the Behavioral Evolution of Large Language Models

大型语言模型行为演化的映射与测量

Dong Qiao, Chris Ding, Jicong Fan

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09779 2026-08-11 cs.CL cs.AI 新提交 87%

KGCaRe: Explainable Complex Conditional Question Answering using Automatic Knowledge Graph Construction and Context Retrieval with LLMs

KGCaRe:结合自动知识图谱构建与大语言模型上下文检索的可解释复杂条件问答方法

Ghanshyam Verma, Simanta Sarkar, Devishree Pillai, Hotaka Shiokawa, Yourong Xu, Fiona Veazey, Peter Hubbert, Hui Su, Paul Buitelaar

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM与RAG处理复杂条件问答时在特定领域表现不佳的问题,提出KGCaRe混合方法,结合KG构建、迭代图遍历与神经检索,在多类LLM及数据集上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01598 2026-08-04 cs.CL cs.AI 新提交 87%

PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge

PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力

Eojin Jeon, SangKeun Lee

机构 * Korea University(高丽大学)

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28648 2026-08-03 cs.HC cs.AI cs.CL 新提交 87%

Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversations

为何会痛苦:识别情感支持对话中消极想法的驱动因素

Hainiu Xu, Zhaoyue Sun, Hanqi Yan, Jinhua Du, Caroline Catmur, Yulan He

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM情感支持任务中认知评估维度显著性被忽视的问题,推出AppraiSal基准并提出基于贝叶斯逆规划的多智能体概率框架PRISM,提升了LLMs识别情境特定显著评估维度的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28638 2026-08-03 cs.CL cs.LG 新提交 87%

Learning Stateful Predictive Knowledge From Experience

从经验中学习有状态的预测知识

Yan Song, Xidong Feng, Bo Liu, Xinyu Cui, Haotian Fu, Zichen Liu, Mengyue Yang, Cheng Deng, Jian Zhao, Jun Wang

机构 * University College London(伦敦大学学院) National University of Singapore(新加坡国立大学) Chinese Academy of Sciences(中国科学院) Brown University(布朗大学) University of Bristol(布里斯托尔大学) University of Edinburgh(爱丁堡大学) Zhongguancun Academy(中关村科学院) The Yangtze River Delta(长三角)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM智能体现有轨迹级反思学习的缺陷,提出SKL方法,通过两种算法训练智能体学习有状态预测知识,在多任务上性能优于现有范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27790 2026-07-31 cs.CL cs.AI 新提交 87%

Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis

面向多模态情感分析的语义对齐结构抽象

Wei Chen, Junkai Li, Tongguan Wang, Hui Liu, Feiyue Xue, Chuanxiang Ma, Ying Sha

机构 * Huazhong Agricultural University(华中农业大学) Hubei University(湖北大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对现有多模态情感分析方法无法建模情感语义的局限,提出SentiLLM框架,通过双流显著性-上下文校准机制实现语义对齐结构抽象,在四个数据集上取得优异性能。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17946 2026-07-21 cs.LG cs.AI 新提交 87%

A Geometric Perspective on Stabilizing Value Conflict Resolution

稳定价值冲突解决的几何视角

Saket Reddy, Andy Liu

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。

Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13394 2026-07-16 cs.CL cs.LG 新提交 87%

GFlowRL: Scaling Distribution-Matching RL to Large Language Models

GFlowRL:将分布匹配强化学习扩展到大型语言模型

Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :large language model(title);language model(title);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究旨在将GFlowNet风格的RL扩展到大型语言模型,提出GFlowRL算法,去除辅助分区网络,用批内蒙特卡罗估计替代学习的分区函数,并通过两个稳定器实现奖励分布匹配,在多个基准测试中表现出色,能稳定扩展到不同架构。

Comments 31 pages, 8 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13034 2026-07-15 cs.AI cs.CL cs.SE cs.SY eess.SY 新提交 87%

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

人工智能代理知道任务何时简单吗?迈向复杂性感知推理与执行

Junjie Yin, Xinyu Feng

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM代理缺乏任务感知执行范围估计能力,提出E3方法,在MSE-Bench基准测试及真实模型工具中验证,该方法能在保证成功率时大幅降低成本,推动迈向工程基础人工智能,还发布了框架和基准。

Comments 27 pages, 8 figures, 8 tables. Code and benchmark: https://github.com/eejyin/Do-AI-Agents-Know-When-a-Task-Is-Simple-Toward-Complexity-Aware-Reasoning-and-Execution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10386 2026-07-14 cs.CL cs.AI 新提交 87%

Structured Thoughts For Improved Reasoning And Context Pruning

用于改进推理和上下文修剪的结构化思维

Zain Sarwar, Supriyo Chakraborty, Berkcan Kapusuzoglu, Chia-Hsuan Lee, Anirban Das, Stephen Rawls, Kartik Balasubramaniam, Sambit Sahu

机构 * University of Chicago(芝加哥大学) Capital One(第一资本金融公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究针对大语言模型长推理痕迹的问题,引入结构化思维框架,通过构建数据集微调模型,使其采用结构化推理风格提升性能,还能实现上下文修剪,在数学任务中可节省内存并保持一定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22485 2026-06-25 cs.AI cs.CL cs.DB cs.LO 新提交 87%

VADAOrchestra: Neurosymbolic Orchestration of Adaptive Reasoning Workflows

VADAOrchestra:自适应推理工作流的神经符号编排

Teodoro Baldazzi, Luigi Bellomarini, Andrea Coletta, Michela Iezzi, Carsten Maple, Alessandro Pesare, Emanuel Sallinger

机构 * TU Wien(维也纳工业大学) Banca d’Italia(意大利央行) University of Warwick(华威大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出VADAOrchestra框架,结合LLM灵活性与Datalog+/-符号推理,实现可审计、可扩展的自适应工作流编排,在金融场景中验证了忠实性、可扩展性和可解释性。

Comments Accepted at KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21867 2026-06-23 cs.AI cs.CL cs.SC 新提交 87%

ForEx: A Formal Verification Framework for Explainable Reasoning in Logical Fallacy Detection and Annotation

ForEx:逻辑谬误检测与可解释推理的形式验证框架

Pei-Cing Huang, Chienyu Liu, Chan Hsu, Ci-Siang Chen, Pei-Ju Lee, Yihuang Kang

机构 * Department of Information Management(信息管理系) National Sun Yat-Sen University(国立中山大学) National Chung Hsing University(中国科技大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ForEx框架,将LLM生成的解释翻译为Lean4并验证其形式可推导性,通过论证验证矩阵区分标签一致性与形式验证状态,揭示形式可推导性与标签一致性之间的系统性差距。

Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18372 2026-06-18 cs.CL cs.AI 新提交 87%

Redact or Keep? A Fully Local AI Cascade for Educational Dialogue De-Identification

保留还是删除?用于教育对话去标识的完全本地AI级联框架

Haocheng Zhang, Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, René F. Kizilcec

机构 * Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对教育对话中课程术语与个人身份信息混淆的问题,提出一种完全本地的级联框架,通过召回优先的联合提议器和上下文感知审查器实现约束性隐私分类,在数学辅导对话上达到0.958的宏F1,优于商业API和纯LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15419 2026-06-16 cs.CL cs.AI 新提交 87%

Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering

让LLMs互相评判:面向医学问答的多智能体同行评审推理

Zaifu Zhan, Shuang Zhou, Rui Zhang

机构 * University of Minnesota(明尼苏达大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体同行评审推理方法,让多个LLM独立生成思维链推理并相互评估,选择最优推理链输出答案,在三个医学问答数据集上优于单模型和多数投票方法。

Comments Accepted by the Journal of the American Medical Informatics Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10956 2026-06-10 cs.AI cs.CL 新提交 87%

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

注意差距:前沿大语言模型能否通过标准化办公能力考试?

Tengchao Lv, Dongdong Zhang, Jiayu Ding, Yilin Jia, Yuzhong Zhao, Yupan Huang, Wenshan Wu, Xiangyang Zhou, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13607 2026-08-17 cs.AI cs.CL cs.LG 新提交 87%

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

没有通用信号可预测版本更新下的样本级大语言模型退化

Jia Sheng, Yiwei Lu

机构 * University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09942 2026-08-12 cs.CL cs.AI cs.LG 新提交 87%

When Chain-of-Thought Helps and When It Hurts: An Empirical Investigation of the Serial-Depth Bottleneck in LLM Reasoning

思维链(CoT)何时有助、何时有害:大语言模型推理中序列深度瓶颈的实证研究

Tughanbulut Kurtulush

机构 * Vistula University(维斯图拉大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过实证发现,思维链(CoT)是带宽旁路而非通用推理增强器,在高深度推理任务中可提升大语言模型准确率,在浅层任务中冗余,其效果与任务序列深度、模型规模相关。

Comments 15 pages, 3 figures, 5 tables. Pre-registered study (OSF: https://osf.io/92jdk). Data and code: https://osf.io/hteuj

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04309 2026-08-06 cs.RO cs.SY eess.SY 新提交 87%

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

面向隐藏目标下零样本人机协作的结构化大语言模型推理

Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo, Vaibhav Srivastava

机构 * Michigan State University(密歇根州立大学) UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 该研究针对隐藏目标下的零样本人机协作,提出结构化LLM架构,通过Dec-POMDP分解决策,实验显示其交互步骤更少、人类信任度更高,优于无ToM推理的变体和离线训练的多智能体强化学习策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02974 2026-08-05 cs.SE 新提交 87%

ConFL: Explainable Concurrent Fault Localization via Hierarchy-Guided LLM Reasoning

ConFL:基于层次引导大语言模型推理的可解释并发故障定位框架

Shuai Shao, Dingbang Wang, Yiming Zeng, Tingting Yu

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 ConFL是一种可解释的并发故障定位框架,通过构建并发知识库与LLM引导的层次检索,在8个Java项目的并发漏洞实验中,其MRR达0.503、MAP达0.486,性能优于同类基线方法且鲁棒性良好。

Comments Accepted at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26553 2026-07-30 cs.SD 新提交 87%

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架

Yuxiong Xu, Kaiqing Lin, Bin Li, Haodong Li, Sheng Li

机构 * Shenzhen University(深圳大学) Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。

Comments Accepted by ACM MM 2026, 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏