CAR: Query-Guided Confidence-Aware Reranking for Retrieval-Augmented Generation
CAR:面向检索增强生成的查询引导置信感知重排序
专题命中 评测与基准 :LLM(summary_cn);分类 cs.CL、cs.AI
AI总结 针对RAG现有重排序仅关注相关性的问题,提出无需训练的CAR框架,通过查询引导的答案稳定性校正排名,在多数据集实验中实现稳健性能提升,可用于黑盒LLM。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
CAR:面向检索增强生成的查询引导置信感知重排序
专题命中 评测与基准 :LLM(summary_cn);分类 cs.CL、cs.AI
AI总结 针对RAG现有重排序仅关注相关性的问题,提出无需训练的CAR框架,通过查询引导的答案稳定性校正排名,在多数据集实验中实现稳健性能提升,可用于黑盒LLM。
评估指标能否检测古文汉英翻译中的错误?
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究以古文汉英翻译为测试案例,引入诊断框架探查现有翻译评估指标的可靠性,发现MetricX24整体表现最佳,凸显需开发更适配历史文化独特场景的翻译评估指标。
InfiniteScienceGym:一个无界的、程序生成的科学分析基准
机构 * Kahlert School of Computing(卡勒特计算学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出InfiniteScienceGym,通过程序生成科学仓库和可验证问答任务,评估证据推理、回避和工具分析能力,发现现有模型在回答不可答问题上存在显著缺陷。
Comments 31 pages, 5 figures, 8 tables. Accepted to COLM 2026. See https://infinitesciencegym.github.io/
上下文归因如何处理模型已有的知识
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型上下文归因方法在上下文与训练数据重叠时的问题,引入新评估协议和基准数据集,通过实验证明现有方法在知识重叠时归因不准确,且用于源分离时无法基于贡献分数区分。
ZenBrain:一种受神经科学启发的7层记忆架构用于自主AI系统
机构 * Zensation AI
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 ZenBrain提出一种7层神经科学启发的记忆架构,通过整合15种验证的神经科学机制,在LongMemEval-500任务中实现了与长上下文Oracle的二元判断准确率接近,并在多个指标上优于现有系统。
Comments 48 pages, 27 tables, 4 figures. v3 is a correction release: a full source-verification pass over all 83 references corrects 30 defective entries and withdraws two ancillary evaluations run on synthetic stand-in data; no measured numbers changed. Changelog: 10.5281/zenodo.21858218. Earlier versions: Zenodo concept DOI 10.5281/zenodo.19353663, TDCommons dpubs_series/9683
MCIF: 多模态跨语言指令遵循基准从科学讲座
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 MCIF是首个多模态跨语言指令遵循基准,通过科学讲座数据评估模型在跨语言、多模态环境下处理不同输入长度的任务能力。
Comments Data available at https://huggingface.co/datasets/FBK-MT/MCIF | Evaluation, outputs, and baselines available at https://github.com/hlt-mt/mcif
OSReward:为跨平台计算机使用奖励模型建立标准化评估
机构 * The University of Hong Kong(香港大学) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学)
专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考
Comments Work in progress
CompanionBench:一个基于理论、扎根于真实世界的AI情感陪伴基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究推出基于理论与真实数据的交互式双语AI情感陪伴基准CompanionBench,评估28个智能体发现其能力差异,指出角色扮演智能体表现差、核心能力存弱点,将发布500对中英平行数据及评估代码。
Comments 33 pages, 6 figures, 19 tables, 13 appendices. Bilingual (Chinese/English) interactive benchmark; 28 evaluated agents
GENEB:为什么基因组模型难以比较
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 针对基因组基础模型评估碎片化的问题,提出GENEB基准,通过统一探测协议在100项任务上比较40个模型,揭示模型排名不稳定、规模收益有限等关键发现。
Comments Accepted to ICML 2026
VibeSearchBench:野外长期主动搜索的基准测试
机构 * Xiaohongshu Dots Studio & Unipat AI(小红书 dots 飞 studios 与 Unipat AI)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对现有搜索基准中查询过于明确、单轮交互和固定模式评估导致用户体验与评估结果差距的问题,提出VibeSearch范式并构建VibeSearchBench基准,通过渐进式用户模拟和图匹配评估框架测试前沿模型,发现所有模型在长期上下文推理、主动意图激发和结构化知识构建方面仍存在显著不足。
CAPT:一种多任务连续自回归Transformer,实现钙群体动力学的跨数据集和跨物种转移
机构 * Tsinghua University(清华大学)
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究针对钙群体动力学模型跨数据集和物种推广难的问题,提出CAPT这一连续自回归群体Transformer,通过连续补丁令牌化策略建模,经多数据集实验验证,其在预测任务中性能优且能形成共享功能空间,为通用神经基础模型开辟新途径。
用于检测和去毒化韩语毒性内容的混淆规则
机构 * Yonsei University(延世大学)
专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出KOTOX数据集,通过定义基于语言学的韩语混淆规则和变换框架,支持对混淆毒性文本的去混淆与去毒化,首次同时实现韩语混淆毒性检测与净化。
Comments 28 pages, 12 figures, 26 tables
通过多级标注者建模提高评估的可重复性
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Google Research(谷歌研究)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出多级抽样方法,通过分析标注者数量与响应数量的平衡,提升评估结果的可重复性与统计显著性。
不要走线:边界引导用于过滤生成
机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。
Comments Accepted at ICML 2026
courtroom 风格多智能体辩论与渐进式 RAG 和角色切换用于争议性主张验证
机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出 PROClaim 框架,通过结构化对抗辩论和角色切换提升争议性主张验证的可靠性,实验显示其在 Check-COVID 数据集上准确率达 81.7%。
Comments Under review, 29 pages, 7 figures, 17 tables
评估用于基于自然语言的SQL和API调用生成的检索增强生成变体
机构 * IU International University of Applied Sciences(国际应用科学大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了三种RAG变体在生成SQL和API调用任务中的性能,发现CoRAG在混合文档环境下表现最佳,检索策略设计对自然语言接口至关重要。
Comments preprint of conference submission
AI4BayesCode: 从自然语言描述到经过验证的模块化状态性贝叶斯采样器
机构 * Department of Biostatistics, Columbia University(哥伦比亚大学生物统计学系)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究提出AI4BayesCode系统,通过自然语言描述生成可运行且验证过的MCMC采样器,采用模块化设计和递归状态性编码范式,提升了贝叶斯模型的可靠性和扩展性。
代理软件开发中第三方 API 路由器的成本在哪里?
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究第三方 API 路由器在代理软件开发中的影响,通过实证研究编码代理中路由器端注入的四个干预级别,开发 SIDEL 框架评估代理,发现路由器端干预难测,客户端缓解措施未完全恢复控制,强调需提供商端输出完整性保证。
VistaHop: 视觉深度搜索的多跳视觉推理基准
机构 * East China Normal University(东华大学) ; Meituan(美团) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。
AdaMARP: 一种自适应多智能体交互框架用于通用沉浸式角色扮演
机构 * Zhejiang University(浙江大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 AdaMARP提出了一种自适应多智能体交互框架,通过沉浸式信息格式和显式场景管理器提升角色扮演的沉浸感和适应性,实验表明其在角色一致性、环境基础性和场景转换等方面优于现有系统。
Comments ACL2026 Findings
$τ$-Rec:面向智能推荐系统的可验证基准
机构 * Independent Researcher(独立研究员) ; Princeton University(普林斯顿大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。
Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)
PeopleSearchBench: 一个多维度基准,用于评估人工智能驱动的人力搜索平台
机构 * LessieAI research team(LessieAI 研究团队)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出PeopleSearchBench,一个开源基准,评估四个人力搜索平台在119个真实查询中的表现,采用事实验证方法,提出Criterions-Grounded Verification,评估三个维度:相关性精度、有效覆盖和信息效用,Lessie在所有指标中表现最佳。
Comments 25 pages
CodeEvo:通过混合和迭代反馈以交互驱动方式合成以代码为中心的数据
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 为解决高质量指令-代码对获取难题,提出双智能体架构CodeEvo,审查器制定模式并结合混合验证协议,构建CodeEvo-100K数据集,实验表明基于此数据微调的模型在代码生成基准测试中表现出色。
Comments ACL 2026 (Oral)
我们现在知道了吗?TerraMind和THOR的系统比较
机构 * University of Münster(明斯特大学) ; IBM Research(IBM研究院) ; Norwegian Computing Center(挪威计算中心)
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 通过对TerraMind和THOR两个地理空间基础模型对比,研究其在补丁大小、解码器复杂性等方面的差异轴,发现架构设计选择对性能差异影响更大,体现互补投资策略,还得出假设和诊断消融方法,有望推广到未来模型。
WHBench:通过专家在环验证评估前沿大语言模型在女性健康主题上的表现
机构 * Columbia University(哥伦比亚大学) ; Rubric AI
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出WHBench,通过专家设计的47个场景评估22个模型,揭示临床重要失败模式,强调安全性和公平性的重要性。
MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(东华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。
显微镜下的注意力:自注意力变体资源利用的比较研究
机构 * Boston University Metropolitan College(波士顿大学 metropolitan college) ; Duy Tan University(杜益大学) ; Chulalongkorn University(朱拉隆功大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型和视觉语言模型中注意力机制瓶颈,通过在训练GPT-2架构时对八种注意力机制进行基准测试,发现优化内核实现的机制能源效率最佳,强调能源感知基准测试对注意力设计的重要性及对选择高效机制的指导意义。
Comments 6 pages, 8 figures
MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。
DDL2PropBank Agent:通过一种新的关系模式映射任务评估多智能体框架的开发者体验
机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 DDL2PropBank Agent通过新的关系模式映射任务评估多智能体框架的开发者体验,揭示了不同框架在代码复杂性和AI辅助性上的差异,Agno表现出最佳性能。
Comments ACM Submission
通过改写改进社交媒体短文本的主题建模:以新冠疫情相关推文为例
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对社交媒体短文本主题建模难题,开发TM-Rephrase框架,利用大语言模型改写推文。通过新冠疫情推文数据集,研究两种改写策略对多种建模方法的影响,结果显示该框架提升了主题建模性能,减少冗余,为公共卫生等领域社交媒体分析提供了新方法。