arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-26 至 2026-03-26 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2603.23507 2026-03-26 cs.CL cs.AI cs.LG 67%

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23512 2026-03-26 cs.CL cs.AI cs.IR 62%

S-Path-RAG: Semantic-Aware Shortest-Path Retrieval Augmented Generation for Multi-Hop Knowledge Graph Question Answering

S-Path-RAG:基于语义的最短路径检索增强生成用于多跳知识图谱问答

Rong Fu, Yemin Wang, Tianxiang Xu, Yongtai Liu, Weizhi Tang, Wangyu Wu, Xiaowen Ma, Simon Fong

机构 * University of Macau(澳门大学) Xiamen University(厦门大学) Peking University(北京大学) Hanyang University(翰阳大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 S-Path-RAG通过混合加权k最短路径、束搜索和约束随机游走策略,实现语义感知的多跳知识图谱问答,提升检索效率与生成准确性。

Journal ref WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24579 2026-03-26 cs.CL 57%

MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination

MARCH: 多智能体强化自检用于大语言模型幻觉

Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(通义大模型应用团队,阿里巴巴)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 MARCH通过多智能体强化学习框架,利用信息不对称机制减少大语言模型幻觉,实验表明其能显著降低幻觉率,8B参数模型表现接近闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22492 2026-03-26 cs.CV cs.AI cs.MM 57%

Tiny Inference-Time Scaling with Latent Verifiers

微小推理时间缩放与潜在验证器

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。

Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 7 篇

2603.24030 2026-03-26 cs.CV cs.MM 85%

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23575 2026-03-26 cs.LG cs.AI 62%

APreQEL: Adaptive Mixed Precision Quantization For Edge LLMs

APreQEL: 适应性混合精度量化用于边缘大语言模型

Meriem Bouzouad, Yuan-Hao Chang, Jalil Boukhobza

机构 * Lab-STICC, CNRS UMR 6285 , ENSTA, Institut Polytechnique de Paris(法国巴黎理工学院STICC实验室、CNRS UMR 6285、ENSTA) National Taiwan University(台湾国立台湾大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种适应性混合精度量化方法,通过分析层间贡献和硬件平台行为,优化边缘部署中的内存、延迟和精度平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23515 2026-03-26 cs.CL cs.AI 62%

Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data

利用隐私保护的合成临床数据训练大型语言模型进行医学编码

John Cook, Michael Wyatt, Peng Wei, Iris Chin, Santosh Gupta, Van Zyl Van Vuuren, Richie Siburian, Amanda Spicer, Kristen Viviano, Alda Cami, Raunaq Malhotra, Zhewei Yao, Jeff Rasley, Gaurav Kaushik

机构 * Veradigm Snowflake

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了利用隐私保护的合成临床数据训练大型语言模型进行医学编码的可行性,通过微调Llama 3-70B模型,实现了ICD-10-CM和CPT代码的高精度预测,显著提升了编码准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24328 2026-03-26 eess.SP 50%

Towards Semantic-based Agent Communication Networks: Vision, Technologies, and Challenges

迈向基于语义的智能体通信网络:愿景、技术与挑战

Ping Zhang, Rui Meng, Xiaodong Xu, Yaheng Wang, Zixuan Huang, Yiming Liu, Ruichen Zhang, Yinqiu Liu, Haonan Tong, Huishi Song, Gang Wu, Zhaoming Lu, Jiawen Kang, Geng Sun, Qinghe Du, Zhaohui Yang, Jingxuan Zhang, Han Meng, Lexi Xu, Haitao Zhao, Zesong Fei, Yiqing Zhou, Pei Xiao, Meixia Tao, Qinyu Zhang, Shuguang Cui, Rahim Tafazolli

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文探讨语义在智能体通信网络中的作用,提出新的架构并综述现有技术,识别关键挑战并提出解决方案。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24224 2026-03-26 cs.CV 50%

RVLM: Recursive Vision-Language Models with Adaptive Depth

具有自适应深度的递归视觉-语言模型

Nicanor Mayumu, Zeenath Khan, Melodena Stephens, Patrick Mukala, Farhad Oroumchian

机构 * Department of Computer Science(计算机科学系) University of Wollongong in Dubai(迪拜沃林戈大学) Dubai Knowledge Park(迪拜知识园区) Mohammed Bin Rashid School of Government(穆罕默德·本·拉希德政府学院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出RVLM,通过迭代生成-执行循环和自适应迭代深度控制器,解决医学AI系统在可解释性和推理深度上的限制,实验证明其在脑部MRI和胸部X光中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24157 2026-03-26 cs.CV 50%

CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare

CarePilot: 一种用于医疗领域长周期计算机任务自动化的多智能体框架

Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha, Xiuying Chen, Salman Khan

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Mohamed bin Zayed University of AI (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出CarePilot多智能体框架,通过双记忆机制和actor-critic范式,解决医疗领域长周期任务自动化中的复杂推理问题,实验表明其在基准和分布外数据集上均优于现有基线。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23855 2026-03-26 cs.HC 50%

General Intellectual Humility Is Malleable Through AI-Mediated Reflective Dialogue

一般智力谦虚性可通过AI介导的反思对话进行改变

Mohammad Ratul Mahjabin, Raiyan Abdul Baten

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究通过AI介导的反思对话提升一般智力谦虚性,发现其可产生持久变化,且不受政治立场和初始人格特征影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 25 篇

2603.24065 2026-03-26 cs.AI 86%

Enhanced Mycelium of Thought (EMoT): A Bio-Inspired Hierarchical Reasoning Architecture with Strategic Dormancy and Mnemonic Encoding

增强思维菌丝(EMoT):一种受生物启发的分层推理架构,具有战略休眠和记忆编码

Florian Odi Stummer

机构 * Institute of General Medicine(医学系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 EMoT是一种受生物启发的分层推理架构,通过四层结构(微、中、宏、元)实现战略休眠与激活,结合记忆宫殿和五种记忆编码方式,提升多领域复杂问题解决能力,但存在样本量小、计算成本高等限制。

Comments 32 pages, 6 figures, 15 tables; includes ablation studies and reasoning trace visualisation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23518 2026-03-26 cs.CL cs.AI 81%

Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents

Cluster-R1: 大型推理模型是遵循指令的聚类代理

Peijun Qing, Puneet Mathur, Nedim Lipka, Varun Manjunatha, Ryan Rossi, Franck Dernoncourt, Saeed Hassanpour, Soroush Vosoughi

机构 * Dartmouth College(达特茅斯学院) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Cluster-R1,通过将遵循指令的聚类任务重新定义为生成任务,训练大型推理模型作为自主聚类代理,以提升对用户指令的响应能力及聚类结构的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21430 2026-03-26 cs.AI cs.SE 79%

DomAgent: Leveraging Knowledge Graphs and Case-Based Reasoning for Domain-Specific Code Generation

DomAgent:利用知识图谱和基于案例的推理进行领域特定代码生成

Shuai Wang, Dhasarathy Parthasarathy, Robert Feldt, Yinan Yu

机构 * Chalmers University of Technology(楚德斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DomAgent通过结合知识图谱和基于案例的推理,提升领域特定代码生成能力,通过结构化推理和定向检索实现领域适应,实验表明其能显著提升复杂真实应用场景的代码生成性能。

Comments Accepted to AAMAS 2026 EA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23864 2026-03-26 cs.CV 78%

See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning

看见、记忆、探索:面向流式空间推理的基准与基线

Yuxi Wei, Wei Huang, Qirui Chen, Lu Hou, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出S3-Bench基准,通过流式空间问答与主动探索解决传统方法在长时序推理和主动感知方面的不足,并提出AMF-VLM模型在压缩内存与主动探索方面实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 73%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 70%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23539 2026-03-26 cs.AI cs.CL cs.LG nlin.AO 67%

PLDR-LLMs Reason At Self-Organized Criticality

PLDR-LLMs 在自组织临界性中进行推理

Burc Gokden

机构 * Fromthesky Research Labs LLC(Fromthesky研究实验室 LLC)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PLDR-LLMs 在自组织临界状态下展现出推理能力,其推理输出与二级相变特征相似,通过全局统计参数量化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 62%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23937 2026-03-26 cs.CL cs.LG 62%

Dialogue to Question Generation for Evidence-based Medical Guideline Agent Development

对话到问题生成用于基于证据的医疗指南代理开发

Zongliang Ji, Ziyang Zhang, Xincheng Tan, Matthew Thompson, Anna Goldenberg, Carl Yang, Rahul G. Krishnan, Fan Zhang

机构 * Google Research(谷歌研究) University of Toronto(多伦多大学) Vector Institute Canada(加拿大向量研究所) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。

Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025

Journal ref Proceedings of Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23646 2026-03-26 cs.CL cs.AI 62%

Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasks

Swiss-Bench SBP-002:瑞士法律与监管任务上的前沿模型比较

Fatih Uenal

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Swiss-Bench SBP-002,一个包含395个专家定制任务的三语基准,评估十种前沿模型在瑞士监管任务中的表现,揭示了不同任务类型的难度差异及模型性能分布。

Comments 21 pages, 5 figures, 7 tables. Code and data: https://github.com/FUenal/swiss-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23521 2026-03-26 cs.CL cs.AI cs.CV 62%

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

Chitrakshara:一种用于印度语言的大型多语言多模态数据集

Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。

Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV 62%

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21910 2026-03-26 cs.CL cs.AI 62%

AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition

AutoSCORE: 通过结构化组件识别提升多智能体大语言模型的自动评分

Yun Wang, Zhaojun Ding, Xuansheng Wu, Siyue Sun, Ninghao Liu, Xiaoming Zhai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AutoSCORE通过多智能体大语言模型和结构化组件识别提升自动评分的准确性与可解释性,在多个基准数据集上表现出色,尤其在复杂评分标准下效果显著。

Comments 9 pages, 2 figures

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(48), 40898-40906, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23481 2026-03-26 cs.CL 57%

IDP Accelerator: Agentic Document Intelligence from Extraction to Compliance Validation

IDP加速器:从提取到合规验证的智能文档智能

Md Mofijul Islam, Md Sirajus Salekin, Joe King, Priyashree Roy, Vamsi Thilak Gudi, Spencer Romo, Akhil Nooney, David Kaleko, Boyi Xie, Bob Strahan, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出IDP加速器框架,通过DocSplit、可配置提取模块、代理分析模块和规则验证模块实现端到端文档智能,展示在医疗行业达到98%准确率和77%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12764 2026-03-26 cs.LG cs.DM 57%

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

GraphOmni: 一种全面且可扩展的大型语言模型在图论任务上的基准框架

Hao Xu, Xiangru Jian, Xinjian Zhao, Wei Pang, Chao Zhang, Suyuchen Wang, Qixin Zhang, Zhengyuan Dong, Joao Monteiro, Bang Liu, Qiuzhuang Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Université de Montréal / Mila - Quebec AI Institute(蒙特利尔大学 / 加拿大魁北克人工智能研究所) City University of Hong Kong(香港城市大学) Autodesk(Autodesk公司) Singapore Management University(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出GraphOmni基准框架,用于评估大型语言模型在图论任务上的推理能力,通过系统评估发现不同维度对模型性能有显著影响,且先进模型仍有提升空间。

Comments Published at ICLR 2026. Project Page: https://gai-community.github.io/Graph-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24073 2026-03-26 cs.CL 57%

ConceptKT: A Benchmark for Concept-Level Deficiency Prediction in Knowledge Tracing

ConceptKT:一种用于知识追踪中概念层面缺陷预测的基准

Yu-Chen Kang, Yu-Chien Tang, An-Zi Yen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ConceptKT基准,通过标注问题所需概念和错误响应下的缺失概念,评估大语言模型和推理模型在概念层面缺陷预测中的性能。

Comments Accepted by LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23749 2026-03-26 cs.AI 57%

Efficient Benchmarking of AI Agents

高效评估AI代理

Franck Ndzomga

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究通过小任务子集降低评估成本,保持代理排名稳定,提出基于项目反应理论的中间难度筛选方法,提升排名可靠性。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23508 2026-03-26 cs.CL cs.IR 57%

Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems

快速而忠实:长文档检索增强生成系统中的实时验证

Xunzhuo Liu, Bowei He, Xue Liu, Haichen Zhang, Huamin Chen

机构 * MBZUAI, McGill University(MBZUAI,麦吉尔大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 本文提出一种实时验证组件,用于长文档检索增强生成系统,通过平衡响应时间和验证覆盖度,提升对长文档的忠实性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23479 2026-03-26 cs.CL 57%

FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records

FHIRPath-QA:基于FHIR电子健康记录的可执行问答

Michael Frew, Nishit Bheda, Bryan Tripp

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出FHIRPath-QA,首个支持患者特定问题的开放数据集和基准,通过将推理转向FHIRPath查询合成,提升问答效率与准确性,验证了其在临床应用中的潜力。

Comments Accepted to LREC 2026 CL4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏