arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-24 至 2026-03-24 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 77 篇

2601.07148 2026-03-24 cs.CL cs.AI 73%

Measuring Iterative Temporal Reasoning with Time Puzzles

用时间谜题测量迭代时间推理

Zhengxiang Wang, Zeyu Dong

机构 * Department of Linguistics & IACS(语言学系及人工智能与计算科学中心) Stony Brook University(石溪大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出时间谜题,一种基于约束的日期推断任务,用于评估工具辅助的迭代时间推理。研究发现,即使使用工具,模型在处理时间推理任务时仍存在可靠性不足的问题。

Comments 11 pages, 4 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01037 2026-03-24 cs.LG cs.AI 73%

CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs

CurES:从梯度分析到高效课程学习以提升推理大语言模型

Yongcheng Zeng, Zexu Sun, Bokai Ji, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Haifeng Zhang, Xu Chen, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Baidu Inc.(百度公司) University College London(伦敦大学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CurES方法,通过梯度优化理论分析,改进大语言模型推理任务的训练效率,实验显示其在多个数学推理基准上优于现有方法。

Comments 25 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21162 2026-03-24 cs.AI cs.LG 73%

Revisiting Tree Search for LLMs: Gumbel and Sequential Halving for Budget-Scalable Reasoning

重新审视用于大语言模型的树搜索:Gumbel与顺序削减用于可扩展的推理

Leonid Ugadiarov, Yuri Kuratov, Aleksandr Panov, Alexey Skrynnik

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReSCALE,通过将Gumbel采样和顺序削减替代传统方法,实现大语言模型在推理中的可扩展推理能力提升,解决了搜索预算增加时准确率下降的问题。

Comments The paper has been accepted to the ICAPS-2026 conference. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20730 2026-03-24 cs.CL cs.AI 73%

Reasoning Topology Matters: Network-of-Thought for Complex Reasoning Tasks

推理拓扑至关重要:用于复杂推理任务的网络推理

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出网络推理框架NoT,通过有向图建模推理过程,探讨拓扑结构在复杂推理任务中的优势,评估不同拓扑的准确率、复杂度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10679 2026-03-24 cs.AI cs.LG 73%

Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models

您的推理模型是推理还是猜测?对分层推理模型的机理分析

Zirui Ren, Ziming Liu

机构 * Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院) Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示分层推理模型在简单谜题中易失效,存在猜测动态和多固定点问题,提出数据增强、输入扰动和模型自举策略提升Sudoku-Extreme准确率至96.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21705 2026-03-24 cs.LG 70%

Data-Free Layer-Adaptive Merging via Fisher Information for Long-to-Short Reasoning LLMs

无需数据的层自适应融合:通过信息论实现长到短推理LLM

Tian Xia

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FIM-Merging方法,通过计算Fisher信息矩阵来分配每层融合系数,提升长到短推理LLM的性能,减少响应长度,且无需校准数据。

Comments 14 pages, NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21574 2026-03-24 cs.AI 70%

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13170 2026-03-24 cs.CL 70%

Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism

戴上思考帽子:从人类推理机制视角对链式思考微调的综述

Xiaoshu Chen, Sihang Zhou, Ke Liang, Duanyang Yuan, Haoyuan Chen, Xiaoyu Sun, Lingyuan Meng, Xinwang Liu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从人类推理机制角度综述了链式思考微调,分析其通过六顶思考帽子框架分类方法,并探讨未来研究方向及现有数据集与模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21341 2026-03-24 cs.AI 70%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20650 2026-03-24 cs.AI cs.CY 70%

From 50% to Mastery in 3 Days: A Low-Resource SOP for Localizing Graduate-Level AI Tutors via Shadow-RAG

从50%到精通:一种低资源SOP,通过影子RAG本地化研究生级AI导师

Zonglin Yang, J. -H. Xie, Lining Zhang, Jiyou Jia, Zhi-X. Chen

机构 * School of Mechanics and Engineering Science, Peking University, Beijing, 100871, China(北京理工大学机械与工程科学学院) Readraft Intelligent Technology Co., Ltd., China(读raft智能科技有限公司) Graduate School of Education, Peking University, Beijing, 100871, China(北京大学教育学院) AI for Science Institute, Beijing, 100080, China(AI for Science研究院)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 本文提出一种低成本SOP,利用影子RAG架构和数据清洗策略,在3人天内本地化研究生级AI导师,使32B模型性能从74%提升至90%。

Comments 9 pages, 3 figures, practitioner report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20637 2026-03-24 cs.SE cs.AI cs.CR 70%

AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing

AEGIS:从线索到结论——通过辩证法和元审计的图引导深度漏洞推理

Sen Fang, Weiyuan Ding, Zhezhen Cao, Zhou Yang, Bowen Xu

机构 * NC State University(北卡罗来纳州立大学) University of Alberta(阿尔伯塔大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEGIS通过图引导的深度漏洞推理,结合辩证法和元审计,解决LLM推理不严谨的问题,实现从线索到结论的验证,提升漏洞检测的准确性与可靠性。

Comments 29 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07496 2026-03-24 cs.CR cs.AI 70%

From Thinker to Society: Security in Hierarchical Autonomy Evolution of AI Agents

从思考者到社会:AI智能体分层自主性演化的安全问题

Xiaolei Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Tianyu Du, Heqing Huang, Hao Peng, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Independent Researcher(独立研究者) Zhejiang Normal University(浙江师范大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了AI智能体分层自主性演化中的安全挑战,提出三级安全框架并分析现有防御措施的不足,旨在指导可信AI智能体系统的多层防御架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03773 2026-03-24 cs.LG 70%

Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL

推理缓存:通过短期限强化学习实现长周期的持续改进

Ian Wu, Yuxiao Qu, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RC算法,通过利用LLM的响应生成与总结能力差异,实现长周期的持续改进,实验显示其在HMMT 2025任务中性能显著提升。

Comments preprint v2; revised 2026-03-22 (updated IMO-AnswerBench results)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15340 2026-03-24 cs.LG 70%

SSR: Speculative Parallel Scaling Reasoning in Test-time

SSR:测试时的推测并行扩展推理

Yuanlin Chu, Bo Wang, Xiang Liu, Hong Chen, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SSR提出一种无需训练的框架,通过引入分步推测解码加速推理而不牺牲正确性,提升数学推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05162 2026-03-24 cs.GR cs.CV 67%

GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation

GenAI-DrawIO-Creator:自动化图表生成的框架

Jinze Yu, Dayuan Jiang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出GenAI-DrawIO-Creator框架,利用大语言模型实现基于XML的图表自动生成与修改,通过高级系统设计和提示工程提升XML输出质量,展示原型能从自然语言或代码生成准确图表,并通过模拟评估证明其在图表创建效率和结构精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21272 2026-03-24 cs.AI cs.CL cs.DS cs.LG 67%

The Library Theorem: How External Organization Governs Agentic Reasoning Capacity

图书馆定理:外部组织如何支配代理推理能力

Zachary F. Mainen

机构 * Champalimaud Foundation(Champalimaud基金会)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了外部组织对代理推理能力的影响,通过实验验证了索引外部记忆的代理在检索效率上的优势,并指出语言模型在索引构建与导航协议执行中的分离需求。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20894 2026-03-24 cs.MM 67%

AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former

AcoustEmo:通过语句感知的声学Q-Former实现开放词汇情绪推理

Liyun Zhang, Xuanmeng Sha, Shuqiong Wu, Fengkai Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 AcoustEmo通过引入语句感知的声学Q-Former,利用时间同步滑动窗口提取段级音频token,提升复杂情绪推理能力,在EMER任务中优于基线模型。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23306 2026-03-24 cs.CV 67%

ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding

ThinkOmni: 通过指导解码将文本推理提升到多模态场景

Yiran Guan, Sifan Tu, Dingkang Liang, Linghao Zhu, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ThinkOmni提出一种无需训练和数据的框架,通过指导解码将文本推理扩展到多模态场景,实验显示在多个多模态推理基准上取得显著提升。

Comments Accept by ICLR 2026, Code: https://github.com/1ranGuan/thinkomni

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV 67%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20309 2026-03-24 cs.IR cs.DB 67%

BubbleRAG: Evidence-Driven Retrieval-Augmented Generation for Black-Box Knowledge Graphs

BubbleRAG:基于证据的检索增强生成用于黑盒知识图谱

Duyi Pan, Tianao Lou, Xin Li, Haoze Song, Yiwen Wu, Mengyi Deng, Mingyu Yang, Wei Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对黑盒知识图谱的检索与精度问题,提出BubbleRAG方法,通过语义锚点分组、启发式气泡扩展等技术提升召回率与精度,实验显示其在多跳问答任务中表现优异。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23455 2026-03-24 cs.LG cs.AI cs.CY 62%

The Price of Progress: Price Performance and the Future of AI

进步的价格:价格性能与AI的未来

Hans Gundlach, Jayson Lynch, Matthias Mertens, Neil Thompson

机构 * MIT FutureTech, CSAIL, Cambridge, MA, USA(麻省理工学院未来科技、计算机科学与人工智能实验室,马萨诸塞州剑桥市) MIT FutureTech, Sloan, Cambridge, MA, USA(麻省理工学院未来科技、斯隆管理学院,马萨诸塞州剑桥市)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了AI模型在基准测试中的性能与成本关系,发现价格性能显著下降,但前沿模型运行成本因模型规模和推理需求增加而上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27419 2026-03-24 cs.AI cs.CL 62%

DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains

DeepCompress:一种双奖励策略用于动态探索和压缩推理链

Tian Liang, Wenxiang Jiao, Zhiwei He, Jiahao Xu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 DeepCompress通过双奖励策略动态调整推理链长度,提升大推理模型的准确性和效率,实验显示在数学基准上表现优于基线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20219 2026-03-24 cs.CL cs.LG 62%

Thinking into the Future: Latent Lookahead Training for Transformers

展望未来:用于Transformer的潜在前瞻训练

Lorenzo Noci, Gregor Bachmann, Seyed-Mohsen Moosavi-Dezfooli, Moin Nabi

机构 * Apple(苹果公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出潜在前瞻训练方法,使模型在生成前进行多步前瞻,提升规划任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22083 2026-03-24 cs.AI 57%

A Context Engineering Framework for Improving Enterprise AI Agents based on Digital-Twin MDP

基于数字孪生MDP的上下文工程框架:提升企业AI代理的框架

Xi Yang, Aurelie Lozano, Naoki Abe, Bhavya, Saurabh Jha, Noah Zheutlin, Rohan R. Arora, Yu Deng, Daby M. Sow

机构 * IBM Software Innovation Lab(IBM软件创新实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出基于数字孪生MDP的上下文工程框架,通过离线强化学习提升企业AI代理性能,解决数据质量、现实推理需求和反馈信号不足等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21696 2026-03-24 cs.AI 57%

MIND: Multi-agent inference for negotiation dialogue in travel planning

MIND:用于旅行规划谈判对话的多智能体推理

Hunmin Do, Taejun Yoon, Kiyong Jung

机构 * School of Mechanical Engineering, Sungkyunkwan University(成均馆大学机械工程学院) Department of Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系) Department of Software, Sungkyunkwan University(成均馆大学软件系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 MIND通过理论思维框架模拟旅行者异质偏好下的共识建立,通过战略评估阶段以90.2%准确率推断对手意愿,实验显示其在高意愿命中率和辩论命中率上分别提升20.5%和30.7%。

Comments Accepted at ICLR 2026 Workshop (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI 57%

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21340 2026-03-24 cs.AI cs.DC 57%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV 57%

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14635 2026-03-24 cs.IR cs.AI 57%

Compute Allocation for Reasoning-Intensive Retrieval Agents

为推理密集型检索代理进行计算分配

Sreeja Apparaju, Nilesh Gupta

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究通过BRIGHT基准和Gemini 2.5模型家族,探讨推理密集型检索管道中的计算分配,发现重排阶段受益于更强模型和更深候选池,而查询扩展在轻量模型后效果递减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06476 2026-03-24 cs.CL 57%

Knowing What's Missing: Assessing Information Sufficiency in Question Answering

知晓缺失:在问答中评估信息充分性

Akriti Jain, Aparna Garimella

机构 * Adobe Research(Adobe研究院)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 本文提出了一种结构化框架,通过识别和验证缺失信息来提高问答系统中信息充分性的评估准确性。

Comments Accepted to EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏