arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 63 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 63 篇

2502.10497 2026-07-31 cs.CL cs.AI 版本更新 92%

Hallucinations and Truth: A Comprehensive Accuracy Evaluation of RAG, LoRA and DoRA

幻觉与真相:RAG、LoRA和DoRA的综合准确率评估

Mohammad Baqar, Rajat Khanda

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文评估RAG、LoRA、DoRA在2万条FAQ查询、40万条知识库上的性能,发现DoRA准确率90.1%、相关性0.88、延迟110毫秒最优,为高准确率领域部署生成式AI提供指导。

Comments 10 Pages

Journal ref 2026 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS), 10.1109/FLICS70075.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00238 2026-06-09 cs.CL cs.AI cs.LG 版本更新 91%

DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking

DIVERGE: 面向开放式信息检索的多样性增强RAG

Tianyi Hu, Niket Tandon, Akhil Arora

机构 * Aarhus University(奥胡斯大学) Microsoft Research(微软研究院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 针对现有RAG系统忽略开放式信息检索中多样性需求的问题,提出Diverge框架,通过迭代反思引导的多样化视角探索和多样性感知检索支持,在保持质量的同时将多样性提升约2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21607 2026-08-10 cs.AI 版本更新 91%

INTRYGUE: Induction-Aware Entropy Gating for Reliable RAG Uncertainty Estimation

INTRYGUE:面向可靠RAG不确定性估计的诱导感知熵门控

Alexandra Bazarova, Andrei Volodichev, Daria Kotova, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出INTRYGUE方法,通过诱导头激活模式门控预测熵,解决RAG中熵基不确定性估计的机械悖论问题,提升hallucination检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27752 2026-07-21 cs.CL cs.SE 版本更新 91%

Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG

基于分层验证的反向测试用于RAG中的幻觉检测

Boxi Yu, Yuzhong Zhang, Liting Lin, Lionel Briand, Emir Muñoz

机构 * Lero, the Research Ireland Centre for Software, University of Limerick(Lero,爱尔兰科学基金会软件研究中心,利默里克大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Ottawa(渥太华大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出RT4CHART框架,通过分层验证提升RAG中上下文忠实度评估的准确性,实现细粒度审计,并在新标注基准上取得最佳检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13744 2026-07-13 math.ST stat.TH 版本更新 90%

A Note on k-NN Gating in RAG

关于检索增强生成(RAG)中k近邻门控的一个注释

Gérard Biau, Claire Boyer

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 为检索增强生成(RAG)提出统计代理框架,推导出最优查询级门控,通过检索不一致性分析幻觉并建模查询-内存不匹配,还进行了数值验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19127 2026-07-03 cs.CL 版本更新 90%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17356 2026-06-17 cs.CL 版本更新 90%

PACE-RAG: Patient-Aware Contextual and Evidence-Constrained RAG for Clinical Drug Recommendation

PACE-RAG:面向临床药物推荐的患者感知上下文与证据约束RAG

Chaeyoung Huh, Hyunmin Hwang, Jung Hwan Shin, Sungyang Jo, Jinse Park, Jong Chul Ye

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Department of Neurology, Seoul National University Hospital(首尔国立大学医院神经科) Asan Medical Center, University of Ulsan, College of Medicine(釜山大学医学院阿桑医院) Haeundae Paik Hospital, Inje University(庆尚大学医院海undae医院)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL

AI总结 提出PACE-RAG框架,通过提取患者特定临床特征、检索相关病例并结合当前症状与用药史,实现个性化药物推荐,在帕金森病和MIMIC-IV数据集上取得最优性能。

Comments 32 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23823 2026-06-12 cs.CL 版本更新 89%

RAGPPI: RAG Benchmark for Protein-Protein Interactions in Drug Discovery

RAGPPI:药物发现中蛋白质-蛋白质相互作用的RAG基准

Youngseung Jeon, Ziwen Li, Thomas Li, JiaSyuan Chang, Morteza Ziyadi, Xiang 'Anthony' Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) Palo Alto High School(帕洛阿尔托高中) Amazon AGI(亚马逊人工智能研究院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 提出RAGPPI基准,包含4420个问答对,用于评估检索增强生成在药物发现中识别蛋白质-蛋白质相互作用生物学影响的能力。

Comments 17 pages, 4 figures, 8 tables

Journal ref Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13930 2026-06-09 cs.CL 版本更新 89%

Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG

语言裙带关系:多语言RAG中为语言偏好牺牲质量

Dayeon Ki, Marine Carpuat, Paul McNamee, Daniel Khashabi, Eugene Yang, Dawn Lawrie, Kevin Duh

机构 * University of Washington(华盛顿大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究多语言RAG系统中模型对英语源文档的偏好,发现模型会牺牲文档相关性以迎合语言偏好,尤其在低资源语言中更明显。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01120 2026-06-08 cs.AI 版本更新 87%

Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

诊断基于RAG的事实核查中LLM对证据前认知状态的仲裁行为

Yuxi Sun, Wenbo Shang, Wei Gao, Xin Huang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.AI

AI总结 提出PAVE测试平台,通过将LLM验证器分为四种认知状态,评估其在检索增强生成事实核查中仲裁参数知识与检索证据的能力,发现不可靠且高度依赖模型的仲裁行为,并提出轻量级JSD测试时仲裁方法。

Comments Accepted to ACL-2026 Findings (voluntarily withdraw)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 86%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25572 2026-07-24 cs.CL cs.AI 版本更新 86%

PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation

PennySynth:基于RAG的数据合成用于自动量子代码生成

Minghao Shao, Nouhaila Innan, Hariharan Janardhanan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究所) Department of Computer Science and Engineering, NYU Tandon School of Engineering(计算机科学与工程系,纽约大学坦顿工程学院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 提出PennySynth框架,通过检索增强生成和代码感知嵌入,利用13,389个PennyLane指令-代码对数据集,在QHack竞赛中实现52%-68%的pass@5,显著提升量子代码生成的结构有效性和功能正确性。

Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24902 2026-07-16 cs.CL cs.AI cs.LG 版本更新 85%

When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation

当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估

Faizan Faisal

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01791 2026-08-07 cs.ET cs.AI 版本更新 84%

PICopilot: An LLM-based Agentic Framework for Assisting Photonic Integrated Circuit Design via Script Generation

PICopilot:一种基于大语言模型的智能体框架,通过脚本生成辅助光子集成芯片设计

Xiaohan Jiang, Zeyu Li, Wei Zhang, Jiang Xu

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 PICopilot是首个基于LLM的智能体框架,通过带反馈机制的多智能体架构与专用RAG流程,成功完成全部48项PIC脚本任务,性能优于其他LLM方法及通用RAG的GPT-5。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14385 2026-07-21 cs.CL cs.LG 版本更新 84%

MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation

MamaBench:通过反事实临床扰动对母婴健康诊断中的大语言模型稳健性进行基准测试

Thanni Adewuyi, Anuoluwa Sotome, Samuel Okoko, Angel Ezendu, Oluwafunke Akinbuwa, Oluwaseun Odunsi, Oluwasegun Oguntuase, Ifeoma Nwabueze, Abiodun Adereni

机构 * Helpmum Africa(非洲帮助妈妈组织) University of Ibadan(伊巴丹大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究针对大语言模型在母婴健康诊断中缺乏对临床相似表现区分能力的问题,提出MamaBench基准及EA - RAG方法,通过实验揭示基础准确率高估稳健准确率现象,EA - RAG有效降低BTR,提升稳健准确率,为临床人工智能反事实稳健性研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07978 2026-07-14 cs.IR 版本更新 84%

Cost and Accuracy of Long-Term Memory in Distributed Multi-Agent Systems Based on Large Language Models

基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性

Benedict Wolff, Jacopo Bennati

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。

Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22827 2026-06-16 cs.SE cs.AI 版本更新 84%

FasterPy: An LLM-based Code Execution Efficiency Optimization Framework

FasterPy:基于大语言模型的代码执行效率优化框架

Yue Wu, Minghao Han, Ruiyin Li, Peng Liang, Amjed Tahir, Zengyang Li, Qiong Feng, Mojtaba Shahin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computer Science, Central China Normal University(中央中国师范大学计算机学院) School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出FasterPy框架,结合检索增强生成(RAG)和低秩适应(LoRA)技术,利用大语言模型自动优化Python代码执行效率,在PIE基准上超越现有方法。

Comments 38 pages, 5 images, 14 tables, Manuscript revision submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19047 2026-07-01 cs.CL cs.AI cs.IR 版本更新 83%

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora

RARE:面向高相似性语料的冗余感知检索评估框架

Hanjun Cho, Jay-Yoon Lee

机构 * Allganize Seoul National University(首尔国立大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 RARE通过分解文档为原子事实和增强LLM生成数据,构建更真实的基准,揭示当前评估体系无法捕捉的鲁棒性差距。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17179 2026-06-16 cs.MA 版本更新 83%

Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection

公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究

Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang, Emily F. Wong, Paul Wang, Jason H. Moore, Tiffani J. Bright

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 83%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09507 2026-08-13 cs.CL cs.AI 版本更新 82%

Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning

通过语言强化学习实现大语言模型个性化的偏好适配学习

Yuting Liu, Wei Wu, Jianzhe Zhao, Guibing Guo

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM个性化中通用偏好摘要冗余问题,提出无训练元学习框架AlignXada,经语言强化学习优化后在多任务多模型上提升性能且适配效果优于RAG。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 81%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 RAG评测 :RAG(summary_cn,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09322 2026-07-14 cs.AI 版本更新 81%

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04109 2026-06-09 cs.CL 版本更新 81%

Discourse-Role Labels as Presentation-Time Variables for Context Use in Language Models

话语角色标签作为语言模型上下文使用的呈现时间变量

Jianguo Zhu, Xiangmei Li, Wenjie Liu

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 通过固定内容探针实验,研究不同话语角色标签(如Instruction、Reference、Example)如何影响语言模型对误导信息的采纳率,发现标签可导致采纳率变化56-84个百分点,并建议上下文利用和RAG基准应报告和控制包装标签。

Comments Revised version with updated author information, added clean baselines, clarified evaluation metrics, and tightened discussion of context-augmented settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 80%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13378 2026-07-07 cs.AI cs.CL cs.IR cs.LG q-bio.QM 版本更新 80%

DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

DrugAgent:用于药物-靶点相互作用评估的冲突生物医学证据的可靠多智能体整合

Yoshitaka Inoue, Tianci Song, Xinling Wang, Rui Kuang, Tianfan Fu, Augustin Luna

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) State Key Laboratory for Novel Software Technology at Nanjing University, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室,南京大学计算机科学学院) Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究药物-靶点相互作用评估中整合异构数据问题,核心方法是基于大语言模型的多智能体系统DrugAgent,贡献是能进行异构证据支持的DTI评估,补充独立DTI预测,还提供相关策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06234 2026-06-10 cs.RO cs.HC 版本更新 80%

RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI

RobotEQ:从被动智能到主动智能的具身AI过渡

Kuofei Fang, Xinyi Che, Haomin Ouyang, Shufan Zhang, Xuehao Wang, Qi Liu, Liyi Liu, Chenqi Zhang, Wenxi Cai, Wenyu Dai, Jinyang Wu, Fan Zhang, Haoyu Chen, Bin He, Zheng Lian

机构 * State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University(自主智能无人系统国家重点实验室,同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 RAG评测 :RAG(summary_cn,abstract)

AI总结 提出RobotEQ基准,评估模型在具身场景中理解并遵守社会规范的能力,实验表明现有模型在主动智能上仍有不足,利用RAG技术可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14501 2026-08-14 cs.SE cs.AI cs.CL 版本更新 79%

CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language

仓颉基准:在低资源通用编程语言上评估大语言模型

Junhang Cheng, Fang Liu, Jia Li, Chengru Wu, Nanxiang Jiang, Li Zhang

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。

Comments Accepted by ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06142 2026-07-07 cs.CL cs.AI 版本更新 79%

IRC-Bench: Recognizing Entities from Contextual Cues in First-Person Reminiscences

IRC-Bench: 从第一人称回忆中的上下文线索识别实体

Yehudit Aperstein, Eden Moran, Alexander Apartsin

机构 * Intelligent Systems, Afeka Academic College of Engineering(阿法卡学术工程学院智能系统) School of Computer Science, Faculty of Sciences, Holon Institute of Technology(霍隆理工学院计算机科学学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);dense retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IRC-Bench基准,用于评估回忆文本中隐式实体识别任务,通过对比本地提及与分散叙述证据,探讨非局部性挑战,测试多种模型配置。

Comments 36 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04458 2026-06-23 cs.CL cs.IR 版本更新 79%

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

DoGMaTiQ:面向报告评估的问答片段自动生成

Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz

机构 * Google Inc.(谷歌公司) Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学) Yale University(耶鲁大学) University of Pennsylvania(宾夕法尼亚大学) University of New Hampshire(新罕布什尔大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 提出DoGMaTiQ流水线,通过文档锚定生成、释义聚类和基于质量准则的子选择三步自动生成高质量QA片段,实现报告的全自动评估,在跨语言任务中与人工判断高度相关。

Comments ICTIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏