arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2605.10574 2026-06-16 cs.AI 版本更新 57%

LLM Jaggedness Unlocks Scientific Creativity

LLM Jaggedness Unlocks Scientific Creativity

Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai, Kevin G. Yager

机构 * Center for Functional Nanomaterials, Brookhaven National Laboratory(功能纳米材料中心,布鲁赫萨尔国家实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型(LLMs)在科学创意生成中的不规则进步现象,提出了SciAidanBench基准测试集,通过评估不同模型在科学问题上的创意生成能力,揭示了模型在跨任务、提示和领域层面的不均衡表现,并展示了如何通过推理计算、知识聚合和头脑风暴等机制利用这种不规则性来提升科学创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14629 2026-06-15 cs.CR cs.AI 新提交 57%

When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks

当好的验证器变坏:自我改进的视觉语言模型可能在新任务上退步

Jianzhe Lin

机构 * MetaAI(Meta)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文发现验证器驱动的自我DPO中,验证器质量具有任务特异性,在低准确率任务上会导致学生模型性能退步,并给出机制解释和部署建议。

Comments 12 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01455 2026-06-15 cs.CL 版本更新 57%

Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal

大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架

Markus Oehri, Giulia Conti, Kaviraj Pather, Alexandre Rossi, Laia Serra, Adrian Parody, Rogvi Johannesen, Aviaja Petersen, Arben Krasniqi

机构 * University of Liechtenstein(列支敦士登大学) University of the Republic of San Marino(圣马尔科共和国大学) University of Mauritius(毛里求斯大学) International University of Monaco(摩纳哥国际大学) University of Andorra(安道尔大学) University of Gibraltar(直布罗陀大学) University of the Faroe Islands(法罗群岛大学) Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学)) University of Prizren(普里兹伦大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出UniCR框架,融合多种不确定性证据为校准的正确概率,并通过原则性拒绝满足用户指定的错误预算,无需微调基础模型,在短问答、代码生成和检索增强长问答中提升校准指标并降低风险-覆盖曲线下面积。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12507 2026-06-12 cs.LG 新提交 57%

Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers

基于评分标准的自蒸馏:无需评分标准验证器的后训练

MohammadHossein Rezaei, Anas Mahmoud, Zihao Wang, Utkarsh Tyagi, Advait Gosai, Razvan-Gabriel Dumitru, Aakash Sabharwal, Bing Liu, Yunzhong He

机构 * Scale AI

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出RGSD方法,通过将评分标准作为条件蒸馏到学生模型,无需验证器即可实现密集逐令牌学习,在医学和科学领域达到与基于评判的GRPO相当的评分标准满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26940 2026-06-12 cs.CL 版本更新 57%

Select to Think: Unlocking SLM Potential with Local Sufficiency

Select to Think: 利用局部充分性解锁小语言模型潜力

Wenxuan Ye, Yangyang Zhang, Xueli An, Georg Carle, Yunpu Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出Select to Think (S2T)方法,通过将大语言模型角色从生成转为选择,并蒸馏选择逻辑到小语言模型,使其在推理时无需依赖大模型,显著提升性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/YeRona/Select-to-Think

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12003 2026-06-11 cs.CL 新提交 57%

Agreement in Representation Space for Open-Ended Self-Consistency

表示空间中的一致性:面向开放式自洽性

Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(HiTZ中心 - Ixa,巴斯克大学(UPV/EHU))

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对开放式生成任务,提出基于嵌入的协议(EBA),通过聚类采样生成的嵌入表示来估计自洽性,无需训练即可鲁棒地选择更可靠的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11724 2026-06-11 cs.AI 新提交 57%

Mind the Perspective: Let's Reason Recursively for Theory of Mind

注意视角:递归推理实现心智理论

Chao Lei, Guang Hu, Meng Yang, Yanbei Jiang, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息系统学院) SensiLab, Monash University, Australia(蒙纳士大学SensiLab)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出RecToM框架,通过递归视角构建建模嵌套信念,将高阶信念问题转化为实际世界问题,在多个ToM基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20241 2026-06-11 cs.LG cs.DC 版本更新 57%

Energy Use of AI Inference, Efficiency Pathways, and Test-Time Scaling

AI推断的能耗:效率路径与测试时计算

Felipe Oviedo, Fiodar Kazhamiaka, Esha Choukse, Allen Kim, Amy Luers, Melanie Nakagawa, Ricardo Bianchini, Juan M. Lavista Ferres

机构 * Microsoft(微软)

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 本文提出基于令牌吞吐量的底层方法,估算大规模大语言模型的每查询能耗,揭示测试时扩展场景下的能耗变化及效率提升潜力。

Comments A preprint version with DOI is available at Zenodo: https://doi.org/10.5281/zenodo.17188770

Journal ref Joule (2026) 102430

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11176 2026-06-10 cs.CV cs.CL cs.CY cs.HC 新提交 57%

Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

数据记者智能体:将数据转化为可验证的多模态故事

Kevin Qinghong Lin, Batu EI, Yuhong Shi, Pan Lu, Philip Torr, James Zou

机构 * University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出多智能体框架Data2Story,通过证据链验证声明并自动生成多模态文章,在18篇文章上评估,证明其在透明性和可审计性上接近人类记者。

Comments Project page: https://data2story.github.io Github: https://github.com/QinghongLin/data2story-skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10875 2026-06-10 cs.CL 新提交 57%

Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation

通过经验知识集成与激活推动LLM工具调用极限

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究如何通过经验知识获取、激活和内化提升LLM多步工具调用性能,提出知识增强工具执行框架KATE,结合宽度扩展推理与知识感知训练,在BFCL-V3和AppWorld上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10662 2026-06-10 cs.MA cs.AI 新提交 57%

Decentralized Multi-Agent Systems with Shared Context

具有共享上下文的去中心化多智能体系统

Yuzhen Mao, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出DeLM框架,通过并行智能体、共享上下文和任务队列去中心化协调,解决集中式MAS的瓶颈,在软件工程和长上下文推理中提升性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20098 2026-06-10 cs.AI 版本更新 57%

Neurosymbolic Learning for Inference-Time Argumentation

用于推理时间论证的神经符号学习

Gabriel Freedman, Adam Dejl, Adam Gould, Mansi, Lihu Chen, Junqi Jiang, Francesca Toni

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于三元主张验证的可训练神经符号框架,通过在训练和推理过程中结合形式论证语义来指导大语言模型生成论证并分配基础分数,从而提高三元预测的准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-06-10 cs.CL 版本更新 57%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-06-09 cs.CL 新提交 57%

Forward-Free Diffusion Language Models

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07974 2026-06-09 cs.RO cs.AI 新提交 57%

PRISM: PRior-guided Imagination Sampling in world Models

PRISM:世界模型中基于先验引导的想象采样

Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye

机构 * Northeastern University(东北大学) University of California, Berkeley(加州大学伯克利分校) Qiyuan Lab(启元实验室) University of Florida(佛罗里达大学)

专题命中 测试时计算 :planning(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过从世界模型编码器提取状态条件高斯先验,并利用精度加权高斯乘积更新规划器的采样分布,在不增加架构复杂度的情况下显著提升基于模型的连续控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12453 2026-06-09 cs.CL 版本更新 57%

CSE-UOI at SemEval-2026 Task 6: A Two-Stage Heterogeneous Ensemble with Deliberative Complexity Gating for Political Evasion Detection

CSE-UOI在SemEval-2026任务6中的表现:一种双阶段异构集成与 deliberative 复杂性门控的政治理论逃避检测方法

Christos Tzouvaras, Konstantinos Skianis, Athanasios Voulodimos

机构 * University of Ioannina(伊奥安纳大学) National Technical University of Athens(雅典国家技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种双阶段异构集成方法,结合自我一致性与加权投票,以及新颖的后处理修正机制Deliberative Complexity Gating,用于政治逃避检测,最终在评估集上获得0.85的Macro-F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11208 2026-06-08 stat.ML cs.LG 版本更新 57%

Predictable Compression Failures: Order Sensitivity and Information Budgeting for Evidence-Grounded Binary Adjudication

可预测的压缩失败:基于证据的二元裁决的顺序敏感性与信息预算

Leon Chlon, Ahmed Karim, Maggie Chlon, MarcAntonio Awada

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 研究证据顺序对基于Transformer的二元裁决模型的影响,提出QMV界和EDFL定律,通过信息充分率门控实现低幻觉率下的答案/弃权决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06079 2026-06-05 cs.CL 57%

SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization

SkillComposer: 学习演化智能体技能以实现特化与泛化

Qi Zhang, Zhaopeng Feng, Xiaonan Shi, Xiaomeng Hu, Chu Liu, Pengjun Xie, Xiaobin Wang, Jieping Ye, Bryan Hooi, Haobo Wang, Junbo Zhao

机构 * Zhejiang University(浙江大学) Tongyi Lab(通义实验室) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出SkillComposer框架,通过创建、改进和合并三种可学习操作,使语言模型在推理时自我演化技能,支持离线、在线和混合部署模式,在多个基准上提升性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05054 2026-06-04 cs.CL 57%

Boosting Self-Consistency with Ranking

通过排序提升自洽性

Maria Marina, Daniil Moskovskiy, Sergey Pletenev, Mikhail Salnikov, Alexander Panchenko, Viktor Moskvoretskii

机构 * AIRI Skoltech(斯克利切夫斯基因工大学) EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出RISC方法,将自洽性中的答案选择转化为排序问题,使用轻量级LambdaRank模型结合五个特征,在多个数据集上实现了比标准自洽性更好的准确率-效率权衡。

Comments 16 pages, 13 figures, accepted at ACL Student Research Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04036 2026-06-04 cs.LG 57%

Self-Distilled Policy Gradient

自蒸馏策略梯度

Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Princeton AI Laboratory, Princeton University, Princeton, NJ, USA(普林斯顿大学普林斯顿AI实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出SDPG框架,结合组相对验证器优势、归一化标准差、精确全词汇在线自蒸馏和参考策略KL正则化,提升稀疏奖励强化学习的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30947 2026-06-04 cs.CL 57%

Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship

将人工智能研究扩展到人文学科:一个用于证据基础学术的多智能体框架

Yating Pan, Jiajun Zhang, Jun Wang, Qi Su

机构 * Department of Information Management(信息管理系) Research Center for Digital Humanities(数字人文研究中心) School of Foreign Languages(外国语言学院) Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出SPIRE多智能体框架,通过将人文学科操作建模为协作智能体角色,结合多尺度细读检索,实现基于证据的论证,在古典文献基准上优于现有方法。

Comments 28 pages, 3 figures. Code, data catalogues, and reproduction scripts: https://github.com/YatingPan/SPIRE. Lead corresponding author: Jun Wang; corresponding author: Qi Su

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03102 2026-06-03 cs.CL 57%

Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling

小规模RL控制器,大语言模型:基于RL引导的自适应采样用于测试时扩展

Runpeng Dai, Tong Zheng, Rui Liu, Chengsong Huang, Hongtu Zhu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland College Park(马里兰大学学院市分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出将自适应采样建模为马尔可夫决策过程,使用强化学习训练轻量级控制器,在答案正确性、延迟和计算成本之间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02646 2026-06-03 physics.soc-ph cs.AI cs.MA 57%

The Ringelmann Effect in Multi-Agent LLM Systems: A Scaling Law for Effective Team Size

多智能体大语言模型系统中的林格曼效应:有效团队规模的缩放定律

Blaž Bertalanič, Carolina Fortuna

机构 * Jozef Stefan Institute(乔泽夫·斯蒂芬研究所)

专题命中 测试时计算 :self-correction(abstract);分类 cs.AI

AI总结 本文推导出两参数缩放定律 $R(N) = N_\text{eff}/N = 1/(1+c(N-1)N^{-\beta})$,将多智能体LLM系统分为三种渐近状态,并通过44个实验单元验证了该定律,发现密集辩论无法增加答案多样性,噪声安慰剂可模拟自我修正效果,且仅异构团队能突破硬上限。

Comments 41 pages, 9 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27762 2026-06-03 cs.AI 57%

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

PEAM: 通过经验对比内化的参数化具身智能体记忆在Minecraft中的应用

Yuchen Guo, Junli Gong, Weicheng Wang, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出PEAM框架,通过对比内化失败-纠正轨迹对,将经验转化为参数化技能,实现Minecraft中具身智能体的持续学习与高效执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05207 2026-06-03 cs.IR cs.CL 57%

Core-based Hierarchies for Efficient GraphRAG

基于核心的高效图RAG层次结构

Jakir Hossain, Ahmet Erdem Sarıyüce

机构 * University at Buffalo(布法罗大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对图RAG中Leiden聚类不可复现的问题,提出用k-core分解替代,构建确定性、密度感知的层次结构,并设计轻量级启发式方法,在保证连接性的同时降低LLM成本,提升答案全面性和多样性。

Comments Accepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16014 2026-06-03 cs.CL 57%

Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains

无排序RAG:用选择替代重排序以应用于敏感领域

Yash Saxena, Ankur Padia, Mandar S Chaudhary, Kalpa Gunaratna, Srinivasan Parthasarathy, Manas Gaur

机构 * University of Washington(华盛顿大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出METEORA框架,通过DPO微调LLM生成检索理由、统计肘部检测自适应截断和验证器过滤,在敏感领域实现可解释、高效且鲁棒的证据选择,无需重排序。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11346 2026-06-03 cs.LG 57%

Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits

基于概率电路的快速且富有表现力的多字节预测

Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

机构 * University of Cambridge(剑桥大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出MTPC框架,利用概率电路编码未来令牌的联合分布,在字节级LLM中实现快速生成,同时保持表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00971 2026-06-02 cs.CL 57%

HypothesisMed: Inference-Time Answer Fusion and Structured Hypothesis-Space Reporting for Biomedical Question Answering

HypothesisMed:生物医学问答中的推理时答案融合与结构化假设空间报告

Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系雷士打理工学院) Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系雷士打理工学院)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 提出HypothesisMed推理时可靠性流水线,通过答案融合和SPACE标签(有效/不完整/矛盾)提升生物医学多项选择问答的准确率、可解析性和结构化可靠性报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00739 2026-06-02 cs.LG 57%

Score $\times$ Decoder: A Unified View of Unsupervised Inference-Time Scaling for Hallucination Mitigation

Score × Decoder:无监督推理时缩放缓解幻觉的统一视角

Yun-Chen Cheng, Che-Yu Lin, Cheng-Lin Yang

机构 * CyCraft AI Lab, Taiwan(CyCraft人工智能实验室,台湾)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出Score×Decoder框架,通过配对四种内在分数(困惑度、对比度、幂分布似然、自验证)与三种解码族(优化、采样、共识),在无监督条件下选择最佳组合以缓解大语言模型幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00328 2026-06-02 cs.LG 57%

KG-Guard: Graph-Based Hallucination Detection for Knowledge Base Question Answering

KG-Guard: 基于图的知识库问答幻觉检测

Albert Sawczyn, Piotr Bielak, Tomasz Kajdanowicz

机构 * Department of Artificial Intelligence(人工智能系) Wroclaw University of Science and Technology(波兹南科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 针对知识库问答中LLM的幻觉问题,提出一种轻量级图框架,将问答实例构建为增强图,通过图编码器和MLP分类器检测幻觉答案节点,在三个基准上取得最高F1并显著提升下游KBQA性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏