CoralBay: A Self-Supervised CT Foundation Model
CoralBay: 一种自监督CT基础模型
机构 * kaiko.ai(Kaiko AI)
专题命中 评测与基准 :foundation model(title);分类 cs.LG
AI总结 提出CoralBay框架,通过分层3D Swin骨干网络和自蒸馏学习多尺度特征,实现CT体积数据的自监督预训练,有效提升下游放射学任务性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
CoralBay: 一种自监督CT基础模型
机构 * kaiko.ai(Kaiko AI)
专题命中 评测与基准 :foundation model(title);分类 cs.LG
AI总结 提出CoralBay框架,通过分层3D Swin骨干网络和自蒸馏学习多尺度特征,实现CT体积数据的自监督预训练,有效提升下游放射学任务性能。
微调大语言模型的安全性测量应基于能力
机构 * National Research Council, Canada(加拿大国家研究理事会)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 通过将微调锚定于特定能力目标,多维度评估微调对模型能力和安全性的影响,发现微调模型对安全提示可能产生不连贯输出、自动安全判断不可靠,且结论因安全基准和评估者而异。
Comments 8 pages plus appendices
评估大语言模型在真实世界消费设备维修问题上的有效性
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Toronto(多伦多大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过引入包含991个真实维修问题的基准测试,评估六种大语言模型在英语和孟加拉语上的正确性、完整性、实用性和安全性,发现模型虽能提供有用帮助,但在高风险维修任务中仍不可靠。
IdiomX:习语理解、检索和解释的多语言基准
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出IdiomX,一个大规模多语言习语基准,通过可复现的多阶段流水线构建,涵盖190K+上下文示例和12K+习语,定义四项任务(检测、上下文-习语检索、阿拉伯语-英语习语检索、习语解释),实验表明上下文Transformer模型提升检测,混合检索重排序增强单语和跨语言检索,习语解释可建模为语义检索任务。
Comments 12 pages, 21 figures. Includes dataset and code. Resources available on HuggingFace, Kaggle, and GitHub
Social Caption: 评估多模态模型的社会理解能力
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。
Comments 25 pages, 10 figures
AlphaEval:一个全面高效的公式化Alpha挖掘评估框架
机构 * CUNY Baruch College(CUNY 巴纳特学院) ; Peking University(北京大学) ; Harvard University(哈佛大学) ; Zhengren Research(正人研究所) ; Zhengren Quant(正人量化)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出AlphaEval框架,通过五个维度(预测能力、稳定性、鲁棒性、金融逻辑、多样性)对自动Alpha挖掘模型进行统一、可并行化且无需回测的评估,实现与回测相当的评估一致性并提高效率。
Comments Accepted by KDD2026
超越编码器累加:衡量多编码器视觉语言模型中编码器的作用
机构 * Tsinghua University(清华大学) ; Tencent(腾讯) ; University of Macau(澳门大学) ; University of Science and Technology Beijing(北京科技大学)
专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 通过重新训练所有31个非空子集,提出容量-必要性分解和预投影器秩分析,揭示多编码器视觉语言模型中编码器角色并非简单累加,并给出最优配对原则。
VidMsg:短视频中隐含信息推断的基准测试
机构 * OriginAI, Israel(OriginAI以色列)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出VidMsg基准,通过消息优先构建流程和双向检索任务,评估视频理解模型对短视频中隐含信息的推断能力。
Comments Project page: https://iyttor.github.io/VidMsg
FORGE:多智能体渐进式利用与检测工程
机构 * Dynatrace
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出多智能体系统FORGE,通过渐进式利用深度桥接漏洞利用生成、优先级排序和检测规则工程三个孤立领域,在603个CVE上实现67.8%的端到端L1+利用,并生成低误报的Sigma和Snort检测规则。
Comments 18 pages, 4 figures, 3 tables. Accepted at the AgentCy Workshop at the 21st International Conference on Availability, Reliability and Security (ARES 2026). Keywords: Vulnerability assessment, Multi-agent systems, Exploit generation, Detection engineering, Risk prioritization
RobotValues: 当人类价值观冲突时评估家用机器人
机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出RobotValues基准,通过10K个价值冲突场景评估家用机器人规划器,发现视觉语言模型存在默认价值偏好且难以覆盖,表明评估需考虑价值冲突下的行动选择。
大型语言模型中的多语言遗忘:迁移、动态与可逆性
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文通过扩展TOFU基准到五种语言,研究大型语言模型中的多语言遗忘,发现遗忘迁移在不同语言间高度可变,且遗忘主要作用于后期解码层而非共享的跨语言潜在空间,因此可以通过推理时的单一引导方向逆转大部分遗忘效果。
Comments Accepted at ICML 2026
深度研究代理在何处出错?代理轨迹中的跨度级错误定位
机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) ; JIUTIAN Research(JIUTIAN研究院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对深度研究代理在长轨迹中难以定位错误的问题,本文通过构建TELBench基准和提出DRIFT审计框架,实现了跨度级错误定位,将首次错误定位准确率提升高达30个百分点。
Comments 28 pages, 11 figures, 4 tables
品味问题:提高智能体基准测试的覆盖率和难度
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出TASTE方法,通过反转任务构建流程,利用自适应对比n-gram模型和聚类自动生成覆盖广泛工具组合的高难度基准任务,以解决现有基准饱和问题。
SAIL: 基于LLM的可靠抽象解释器
专题命中 评测与基准 :LLM(title_cn);分类 cs.LG
AI总结 提出SAIL框架,利用大语言模型自动合成全局可靠的抽象变换器,通过约束优化和代价函数确保可靠性,在神经网络验证中匹配甚至超越人工设计的变换器。
Comments 43 pages, 21 figures
Journal ref Proc. ACM Program. Lang. 10, PLDI, Article 230, 26 pages (2026)
面向GPU数据中心的功耗与碎片感知在线调度
机构 * Istituto di Scienza e Tecnologie dell’Informazione "Alessandro Faedo", Consiglio Nazionale delle Ricerche(阿莱索·法多信息科学与技术研究所,意大利国家研究委员会)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对GPU数据中心在线调度问题,提出PWR调度策略,结合碎片梯度下降(FGD)方法,在降低功耗和最小化GPU碎片之间取得平衡。
Comments This work has been submitted to the IEEE for possible publication
多模态视频理解中的视觉状态追踪基准测试
机构 * New York University(纽约大学) ; KAIST(韩国科学技术院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。
Comments Website: https://vision-x-nyu.github.io/vstat-site/
Bastet:用于DeFi智能合约漏洞检测的细粒度专家标注数据集
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 针对现有数据集存在的过时Solidity版本、自动标注噪声和粗粒度标签问题,提出基于真实审计报告和专家共识标注的细粒度两层分类法(46个标签和77个子标签)的DeFi智能合约漏洞数据集Bastet。
区分信念与从众:在线辩论中投票行为的贝叶斯理想点模型
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出贝叶斯逻辑回归模型,区分在线辩论中基于信念的conviction和基于同伴影响的conformity,并在this http URL数据集上发现不同话题下两种机制的主导性差异。
分解与度量评估意识
机构 * ETH Zürich(苏黎世联邦理工学院) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究院) ; Tübingen AI Center(图宾根人工智能中心) ; University of Toronto & Vector Institute(多伦多大学及向量研究所) ; EuroSafeAI(欧洲安全人工智能)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究借鉴社会心理学,将评估意识分解为环境与模型两部分,通过EvalAwareBench基准测试发现识别率取决于模型与基准的配对,且识别很少导致行为改变,安全评估比能力评估更易受影响。
CoMPAS3D: 一个用于交互动作的数据集和基准
机构 * School of Computing Science Simon Fraser University(计算科学学院西蒙弗雷泽大学)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CoMPAS3D数据集和评估框架,通过动作可读性和熟练度适当性等客观指标,解决交互式动作生成中缺乏社交上下文评估的问题。
Comments https://rosielab.github.io/compas3d
揭示检索增强生成中的竞争性投毒攻击
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对检索增强生成系统,研究多个攻击者同时投毒以争夺同一查询目标的问题,提出竞争有效性指标和PoisonArena框架。
Comments Accepted by KDD 2026. Project page: https://poison-arena.github.io/
Journal ref KDD 2026
SAGE: 智能体生态中社会化演化的定量评估
机构 * Tsinghua University, China(清华大学, 中国) ; Meituan, China(美团, 中国)
专题命中 评测与基准 :language agent(abstract);分类 cs.CL、cs.AI
AI总结 提出SAGE框架,通过对比社会演化(SocialEvo)与自我演化(SelfEvo)两种计算条件,在三个领域评估共享经验对智能体性能的影响,发现群体历史并非普遍放大器,但能帮助陷入停滞的智能体取得突破,且社会收益依赖于抽象能力而非暴露量。
Comments 13 pages, 5 figures
回到柏拉图的洞穴:大规模检验跨模态表示收敛性
机构 * UC Berkeley(伯克利大学) ; Technical University Munich, MCML(慕尼黑技术大学) ; University of Tübingen, Tübingen AI Center(图宾根大学) ; Toyota Technical Institute at Chicago(芝加哥丰田技术研究所)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过大规模数据集实验,质疑了柏拉图表示假说中跨模态表示收敛的证据,发现对齐度随数据规模增大而显著下降,且仅反映粗粒度语义重叠。
Comments Project page: http://akoepke.github.io/cave_umwelten/
关系线性是幻觉的预测因子
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI
AI总结 通过合成未知实体基准测试,发现语言模型在回答线性关系问题时更容易产生幻觉,且关系线性度与幻觉率强相关。
Comments 15 pages, 6 figures, 14 tables
结合统计特征与深度编码的基于排练的类增量时间序列分类
机构 * atlanTTic – ICLAB, Universidade de Vigo(atlanTTic–ICLAB,维戈大学) ; Centro Tecnolóxico de Telecomunicacións de Galicia (GRADIANT)(加利西亚电信技术中心(GRADIANT)) ; Universidade de Vigo(维戈大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 提出一种双流特征提取管道(结合预训练冻结基础模型的深度时间嵌入特征与统计特征),用于多变量时间序列的类增量持续学习,在五个基准数据集上实现了有竞争力的平均准确率和低遗忘率。
DeepSpeak-Agentic 数据集
机构 * University of California, Berkeley, USA(加州大学伯克利分校) ; Stanford University, USA(斯坦福大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本文提出了一个包含37小时人机半结构化对话视频的数据集DeepSpeak-Agentic,用于评估AI代理的自动取证识别、研究人机交互特性,并作为大型语言模型和AI生成语音/面部技术的基准。
BraveGuard: 从开放世界威胁到更安全的计算机使用代理
机构 * Fudan University(复旦大学) ; Ant Group(蚂蚁集团) ; Hunan Institute of Advanced Technology(湖南高级技术研究所) ; Alibaba Group(阿里巴巴集团) ; Singapore Management University(新加坡管理大学) ; Deakin University(德肯大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 提出BraveGuard框架,通过从开放世界威胁信号和真实代理轨迹中训练防护模型,实现轨迹级别的安全检测,显著提升计算机使用代理的安全性。
越狱攻击初始化作为合规方向的提取器
机构 * Department of Computer Science, Technion - Israel Institute of Technology(技术学院计算机科学系) ; Department of Data and Decision Science, Technion - Israel Institute of Technology(技术学院数据与决策科学系) ; School of Electrical and Computer Engineering Engineering, Ben-Gurion University of the Negev(内盖夫本· Gurion大学电气与计算机工程学院)
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.LG
AI总结 本文发现基于梯度的越狱攻击初始化会收敛到抑制拒绝的单一合规方向,并据此提出CRI框架,通过沿合规方向投影未见提示来提高攻击成功率并降低计算开销。
Comments Accepted to Findings of the Association for Computational Linguistics 2025 (EMNLP 2025)
GN0:迈向视觉语言导航中生成、评估与策略学习的统一范式
机构 * Institute of Artificial Intelligence, China Telecom(人工智能研究院,中国电信) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Fudan University(复旦大学) ; Jiangsu University(江苏大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出GN0统一框架,通过自动生成大规模导航数据集GN-Matrix、基于3DGS的高保真仿真平台和BEV基准GN-Bench,结合RL驱动的导航基础模型BAE,在VLN任务上超越现有方法。
面向科学图像效用与可升级性的表征
机构 * TongJi University(同济大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 评测与基准 :language model(abstract)
AI总结 针对AI生成内容对科学图像完整性的威胁,提出SIU²A框架,通过效用(错误检测与修正可行性)和可升级性(修正质量)两个维度评估科学图像,并构建基准数据集揭示当前多模态系统在科学错误评估与忠实修正方面的显著局限。