arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-21 至 2026-05-21 共收录 337 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 95 篇

2605.20693 2026-05-21 cs.CL cs.AI stat.ML 73%

Interpretable Discriminative Text Representations via Agreement and Label Disentanglement

通过共识和标签解缠获得可解释的判别文本表示

Tong Wang, Yiqing Xu, Leo Yang Yang

机构 * Yale University(耶鲁大学) Stanford University(斯坦福大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出了一种可解释的判别文本表示方法,通过共识和标签解缠来确保特征的可解释性和可重复性,实验表明该方法在多个文本分类任务中表现优异,产生了更清晰且更少标签纠缠的特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17946 2026-05-21 cs.AI cs.CV cs.LG 73%

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain

SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准

Lingtao Mao, Huangyu Dai, Xinyu Sun, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17140 2026-05-21 cs.CV cs.AI cs.CL 73%

UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

UCSF-PDGM-VQA: 用于脑肿瘤MRI解读的视觉问答数据集

Shiv Ghosh, Junayd Lateef, Chih-Hua Liu, Yannan Yu, Andreas M. Rauschecker, Madhumita Sushil

机构 * Fung Institute for Engineering Leadership(工程领导力基金会) University of California, Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of California, San Francisco(加州大学旧金山分校) Division of Clinical Informatics and Digital Transformation(临床信息学与数字转型部) Department of Neurological Surgery(神经外科部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个临床相关的视觉问答基准数据集UCSF-PDGM-VQA,包含2387个问题-答案对,用于评估视觉语言模型在处理多序列3D MRI扫描中的能力,发现现有模型在多模态处理上存在缺陷。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21479 2026-05-21 cs.CV cs.AI 70%

WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata

WikiVQABench: 一个基于维基百科和维基数据的知识引导视觉问答基准

Basel Shbita, Pengyuan Li, Anna Lisa Gentile

机构 * IBM Research San Jose(IBM桑 Jose研究实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WikiVQABench,一个结合维基百科图片、文章描述和维基数据结构化知识的知识引导视觉问答基准,通过大规模语言模型生成候选多选题,并由人工审核确保事实正确性和视觉-文本一致性,评估多种视觉-语言模型在知识密集型推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04905 2026-05-21 cs.SE cs.CL 70%

Retrieval-Augmented Code Generation: A Survey with Focus on Repository-Level Approaches

检索增强的代码生成:聚焦于仓库级方法的综述

Yicheng Tao, Yuante Li, Yao Qin, Yepang Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了检索增强的代码生成方法,重点探讨仓库级方法,分析了其在大规模代码生成中的挑战与解决方案,总结了现有方法的分类框架及关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21063 2026-05-21 cs.CL 70%

APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

APM:通过任意偏好映射评估大语言模型中的风格个性化

Philipp Spohn, Leander Girrbach, Zeynep Akata

机构 * Technical University of Munich, Helmholtz Munich(慕尼黑技术大学,亥姆霍兹慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出APM基准,通过隐式偏好映射评估大语言模型的风格个性化能力,发现路由方法是最可靠的方法,而RAG和软提示优化在强基础模型上才有提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21041 2026-05-21 stat.ML cs.LG stat.ME 70%

Conditioning Gaussian Processes on Almost Anything

对几乎任何事物进行高斯过程的条件化

Henry Moss, Lachlan Astfalck, Thomas Cowperthwaite, Colin Doumont, Sam Willis, Philipp Hennig, Christopher Nemeth, Andrew Zammit-Mangion

机构 * Lancaster University(兰卡斯特大学) University of New South Wales(新南威尔士大学) University of Cambridge(剑桥大学) University of Tübingen(图宾根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种通用的方法,通过将高斯过程与线性扩散模型建立等价关系,实现了对任意条件语句的高效条件化,包括非线性物理模型和自然语言,从而扩展了高斯过程在现实世界建模中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20793 2026-05-21 cs.CL 70%

Assessing socio-economic climate impacts from text data

从文本数据评估社会经济气候影响

Mariana Madruga de Brito, Brielen Madureira, Taís Maria Nunes Carvalho, Damien Delforge, Aglaé Jézéquel, Murathan Kurfalı, Ni Li, Gabriele Messori, Joakim Nivre, Barbara Pernici, Niko Speybroeck, Stefano Terzi, Wim Thiery, Bram Valkenborg, Jingxian Wang, Shorouq Zahra, Jakob Zscheischler, Jan Sodoge

机构 * Helmholtz Centre for Environmental Research, Germany(德国海德堡环境研究中心) Leipzig University, Germany(德国莱比锡大学) UCLouvain Brussels, Belgium(比利时布鲁塞尔UCLouvain) Ecole des Ponts, France(法国École des Ponts) Université PSL, École Polytechnique, Institut Polytechnique de Paris, Sorbonne Université, CNRS, France(法国巴黎理工学院、巴黎理工研究院、巴黎政治学院、法国国家科学研究中心) RISE Research Institutes of Sweden, Sweden(瑞典RISE研究机构) Swedish Centre for Impacts of Climate Extremes (Climes), Sweden(瑞典气候极端影响研究中心) Vrije Universiteit Brussel, Belgium(比利时布鲁塞尔自由大学) TUD Dresden University of Technology, Germany(德国德累斯顿理工大学) Uppsala University, Sweden(瑞典乌普萨拉大学) Politecnico di Milano, Italy(意大利米兰理工大学) Istituto Universitario di Studi Superiori IUSS Pavia, Italy(意大利皮亚维亚大学研究院) Center for Climate Change and Transformation, Eurac Research, Italy(意大利Eurac研究机构气候变化与转型中心) Royal Museum for Central Africa, Belgium(比利时皇家中非博物馆) Technopolis Group, Germany(德国Technopolis集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种利用文本数据系统分析气候灾害社会经济影响的方法,旨在解决现有研究碎片化、缺乏明确指导的问题,通过总结常见实践和挑战,提出改进建议以构建更可靠的文本衍生社会经济影响数据集。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20742 2026-05-21 cs.AI 70%

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent 用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出了一种基于描述性文本建模的电池信号报告方法,用于解决开放源代码电池故障报告数据集稀缺和缺乏统一维护知识表示的问题,通过构建语言语料库来改进电池健康诊断和维护,提出了VBFDD-Agent,整合了描述性电池状态文本、历史案例检索、本地维护手册和大语言模型推理,生成结构化的诊断结果和维护建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20704 2026-05-21 cs.CR cs.AI cs.MA 70%

Heartbeat-Bound Hierarchical Credentials: Cryptographic Revocation for AI Agent Swarms

基于心跳的分层凭证:面向AI代理群的加密撤销机制

Saurabh Deochake

机构 * SentinelOne Inc.(SentinelOne公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种基于心跳的分层凭证协议,通过将凭证有效性与周期性父级存活证明绑定,实现无需网络连接的高效凭证撤销,显著减少了僵尸代理的存活时间并提升了验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20630 2026-05-21 cs.AI 70%

Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines

评估代理计划-执行管道中的时间语义缓存和工作流优化

Alimurtaza Mustafa Merchant, Krish Veera, Sajal Kumar Goyla, Shambhawi Bhure, Dhaval Patel, Kaoutar El Maghraoui

机构 * Columbia University(哥伦比亚大学) IBM IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了在代理计划-执行管道中时间语义缓存和工作流优化的问题,提出两种互补的优化层以提高效率,并展示了其在工业资产操作工作流中的应用效果。

Comments 13 pages, 8 figures, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24138 2026-05-21 cs.CV cs.AI 70%

Multimodal Optimal Transport for Training-free Temporal Segmentation in Surgical Robotics

多模态最优传输用于手术机器人中的无训练时序分割

Omar Mohamed, Edoardo Fazzari, Ayah Al-Naji, Hamdan Alhadhrami, Khalfan Hableel, Saif Alkindi, Ivan Laptev, Cesare Stefanini

机构 * Dept. of Robotics, Mohamed bin Zayed University of AI(机器人系,Mohamed bin Zayed人工智能大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种无需标注的手术时序分割框架TASOT,通过结合时间对齐的文本描述和视觉信息,在统一的不平衡Gromov-Wasserstein最优传输目标下融合视觉和语义线索,实现了在多个公开手术数据集上的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-05-21 cs.CV cs.AI cs.RO 70%

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: https://dravenalg.github.io/VLANeXt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02660 2026-05-21 cs.AI 70%

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS:模块化代理与反思搜索用于自动化AI研究

Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MARS框架,通过预算感知规划、模块化构建和比较反思记忆解决复杂机器学习工程任务中的执行成本与性能归因问题,实现开放源代码框架在MLE-Bench上的最佳性能。

Comments Paper published at International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09215 2026-05-21 cs.AI cs.CR 70%

Enabling Regulatory Multi-Agent Collaboration: Architecture, Challenges, and Solutions

使监管多智能体协作成为可能:架构、挑战与解决方案

Qinnan Hu, Yuntao Wang, Yuan Gao, Zhou Su, Linkang Du, Qichao Xu

机构 * School of Cyber Science and Engineering(网络科学与工程学院) Xi'an Jiaotong University(西安交通大学) School of Mechatronic Engineering and Automation(机械电子工程与自动化学院) Shanghai University(上海大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于区块链的分层架构,用于监管智能体协作,设计了三个关键模块以实现自动问责、动态声誉评估和恶意行为预测,从而建立可信、健壮和可扩展的监管机制。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20364 2026-05-21 cs.CL 70%

When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review Generation

推理监督有害:基于TTCW的长文本文学评论生成

Jinlong Liu, Mohammed Bahja, Mark Lee

机构 * School of Computer Science, University of Birmingham, United Kingdom(英国伯明翰大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种基于TTCW的长文本文学评论生成方法,通过构建包含263911个长文本故事的数据集,每个故事都标注了14个TTCW维度的评分和元合成评论。实验发现,非推理微调在性能和稳定性上更优,而推理监督模型更易出现解析失败,导致生成无关或重复的推理文本,表明在固定格式评分标准下,推理监督并不总是有益的。

Comments Submit to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20190 2026-05-21 cs.AI cs.GR 70%

Tool-Augmented Agent for Closed-loop Optimization,Simulation,and Modeling Orchestration

具有工具增强的代理用于闭环优化、仿真和建模协调

Liyuan Deng, Shujian Deng, Yongkang Chen, Yongkang Dai, Zhihang Zhong, Linyang Li, Xiao Sun, Yilei Shi, Huaxi Huang

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出COSMO-Agent框架,通过强化学习使大语言模型完成闭环CAD-CAE流程,解决CAD-CAE语义鸿沟问题,提升工业设计仿真优化的可行性、效率和稳定性。

Comments 8pages,3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21090 2026-05-21 cs.CV 67%

TextSculptor: Training and Benchmarking Scene Text Editing

TextSculptor: 训练和评估场景文本编辑

Yiheng Lin, Siyu Jiao, Xiaohan Lan, Wei Zhou, Qi She, Fei Yu, Heyun Chen, Zhengwei Wang, Jinghuan Chen, Moran Li, Yingchen Yu, Zijian Feng, Yao Zhao, Yunchao Wei, Yujie Zhong

机构 * Beijing Jiaotong University(北京交通大学) Bytedance(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20926 2026-05-21 cs.IR 67%

MemConflict: Evaluating Long-Term Memory Systems Under Memory Conflicts

MemConflict: 评估在内存冲突下的长期记忆系统

Zhen Tao, Jinxiang Zhao, Peng Liu, Dinghao Xi, Yanfang Chen, Wei Xu, Zhiyu Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MemConflict框架,用于评估在内存冲突下的长期记忆系统,通过模拟长周期历史和引入跨会话冲突,分析记忆检索和排序的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20777 2026-05-21 cs.CV 67%

AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models

AttriStory: 基于扩散模型的视觉叙事中细粒度属性实现

Manogna Sreenivas, Rohit Kumar, Soma Biswas

机构 * Indian Institute of Science(印度科学研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出AttriStory基准,通过细粒度属性实现提升视觉叙事的质量,引入了在早期去噪步骤中操作的潜在优化模块,并通过AttriLoss目标增强属性-对象对的对齐度,从而实现更精确的属性定位。

Comments Accepted at CVPR AIStory Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20676 2026-05-21 cs.CV 67%

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

VISTAQA: 评估联合视觉问答与像素级证据

Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20544 2026-05-21 cs.RO cs.CV 67%

The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents

顺从综合征:具身机器人代理中的退避基准测试

Doguhan Yeke, Elif Su Temirel, Ananth Shreekumar, Brandon Lee, Dongyan Xu, Z Berkay Celik

机构 * Purdue University(普渡大学) Bilkent University(比尔肯特大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 本文提出了一种用于具身机器人代理的退避基准测试框架RoboAbstention,通过五种机器人数据集中的图像生成退避指令,评估了多个前沿VLMs在退避任务中的表现,并探讨了改进退避性能的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20525 2026-05-21 cs.CV cs.AI cs.CL cs.LG eess.IV 67%

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA: 一种大规模的3D脑部MRI理解图像 grounded 评估基准

Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh, Ridvan Yesiloglu, Yuncong Mao, Bailey Trang, Mohammad Asadi, Merryn Daniel, Gustavo Chau Loo Kung, Ken Chang, Pavan Pinkesh Shah, Adam Turnbull, Kyan Younes, Seena Dehkharghani, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出NeuroQA,一个大规模的3D脑部MRI视觉问答基准,包含来自12977名受试者的56953个问答对,涵盖5-104岁及五个临床领域,通过3D体积评估11种临床推理技能,并提供可复现的生成脚本和在线排行榜。

Comments 30 pages, dataset and benchmark release

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05253 2026-05-21 cs.IR 67%

EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge

EnterpriseRAG-Bench: 一个用于企业内部知识的RAG基准测试

Yuhong Sun, Joachim Rahmfeld, Chris Weaver, Weijia Chen, Roshan Desai, Wenxi Huang, Mark H. Butler

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出EnterpriseRAG-Bench,一个包含50万文档和500个问题的基准测试,用于评估和比较基于检索增强生成(RAG)方法在企业内部知识处理中的性能。

Comments Code and dataset available at https://github.com/onyx-dot-app/EnterpriseRAG-Bench or https://huggingface.co/datasets/onyx-dot-app/EnterpriseRAG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20798 2026-05-21 cs.LG cs.CL 62%

Most Transformer Modifications Still Do Not Transfer at 1-3B: A 2020-2026 Update to Narang et al. (2021) with Downstream Evaluation and a Noise Floor

大多数变换器修改仍无法在1-3B规模上迁移:对Narang等人(2021)的2020-2026年更新,包含下游评估和噪声底限

Yang Zhao, Jiahao Lu, Bin Huang, Guhua Zhang, Jie Zhou

机构 * Tencent(腾讯)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文在1-3B参数规模下,大多数变换器修改仍无法迁移,通过严格的等数据、等计算、等配方控制测试,并结合下游评估和噪声底限进行验证。

Comments 19 pages, 3 figures, under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20744 2026-05-21 cs.LG cs.AI 62%

Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

可验证的环境:面向大规模评估奖励黑客的尝试

Amit Roth, Ankur Samanta, Matan Halevy, Yoav Levine, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) Columbia University(哥伦比亚大学) Taso Labs(Taso实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的评估方法来衡量奖励黑客,通过在环境中嵌入可检测的奖励黑客机会,使评估更加可靠和自动化,通过TextArena测试床分析了不同语言模型在多样化环境中的奖励黑客行为。

Comments Project Page - https://majoroth.github.io/hack-verifiable-environments/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20296 2026-05-21 cs.LG cs.AI 62%

Spectral Unforgetting: Post-Hoc Recovery of Damaged Capabilities Without Retraining

谱遗忘:无需重新训练的后验能力恢复

Aarash Abro, Muhammad Tahir

机构 * Zeta Labs(泽塔实验室) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在目标任务微调过程中因训练数据未显式威胁而退化的能力现象,提出了一种仅使用预训练检查点和微调后检查点的后验修复方法,通过谱修复技术恢复受损能力并保留目标任务收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16860 2026-05-21 cs.SE cs.AI cs.LG 62%

TriagerX: Dual Transformers for Bug Triaging Tasks with Content and Interaction Based Rankings

TriagerX: 用于基于内容和交互的缺陷分类任务的双变换器

Md Afif Al Mamun, Gias Uddin, Lan Xia, Longyu Zhang

机构 * University of Calgary(卡尔加里大学) York University(约克大学) IBM Canada(IBM加拿大)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TriagerX,一种双变换器架构,通过结合内容和交互信息来改进缺陷分类任务的推荐准确性,优于现有最先进方法。

Comments Accepted to IEEE Transactions on Software Engineering (TSE). 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21482 2026-05-21 cs.AI 57%

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

DeepWeb-Bench: 一个要求大规模跨源证据和长周期推导的深度研究基准

Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma

机构 * Peking University(北京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出DeepWeb-Bench基准,通过要求大规模证据收集、跨源验证和长周期推导,评估前沿语言模型在深度研究任务中的能力,揭示检索并非瓶颈,强弱模型失败方式不同,且模型在不同领域表现出专业性。

Comments Work in Progress. 27 pages, 10 figures, 4 tables. Project page: https://sixiongxie1001-dot.github.io/deep-research-benchmark2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21272 2026-05-21 cs.CV cs.AI 57%

MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset

MONET:一个大规模、开放、非冗余且增强的文本到图像数据集

Benjamin Aubin, Gonzalo Iñaki Quintana, Onur Tasar, Sanjeev Sreetharan, Urszula Czerwinska, Damien Henry, Clément Chadebec

机构 * Jasper Research(Jasper研究)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出MONET数据集,通过多阶段过滤和增强,提供高质量的文本到图像数据,以降低大规模可重复研究的门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏