arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 877 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 190 篇

2605.10038 2026-05-12 cs.AI 70%

TimeClaw: A Time-Series AI Agent with Exploratory Execution Learning

TimeClaw: 一种具备探索性执行学习的时间序列AI代理

Hangchen Liu, Dongyuan Li, Renhe Jiang, Jiewen Deng, Weiwei Ye, Yoshihide Sekimoto

机构 * The University of Tokyo(东京大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 TimeClaw通过探索-比较-蒸馏-再注入四阶段循环,提升时间序列任务的探索性执行学习能力,在金融和天气预测中取得一致优势。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09698 2026-05-12 cs.AI 70%

Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents

Ambig-DS:数据科学代理任务框架模糊度的基准测试

Josefa Lia Stoisser, Marc Boubnovski Martell, Sidsel Boldsen, Kaspar Märtens, Robert Kitchen

机构 * Novo Nordisk London, UK(诺和制药伦敦分公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Ambig-DS引入两个诊断套件,用于预测目标模糊度和评估目标模糊度,通过控制编辑生成模糊变体,发现任务框架模糊度是数据科学代理评估的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09549 2026-05-12 cs.LG 70%

When Adaptation Fails: A Gradient-Based Diagnosis of Collapsed Gating in Vision-Language Prompt Learning

当适应失效:基于梯度的Collapsed Gating在视觉-语言提示学习中的诊断

Yunxuan Fang, Ziwei Zhang, Xinhe Wang

机构 * Beihang University(北航大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本文研究了在冻结少样本提示学习中,适应性门控和提示选择模块失效的问题,通过实验发现梯度不平衡和门控退化是主要失效模式,揭示了参数高效学习中适配门控的有效条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09438 2026-05-12 cs.LG 70%

fmxcoders: Factorized Masked Crosscoders for Cross-Layer Feature Discovery

fmxcoders: 分层掩码交叉编解码器用于跨层特征发现

Andreas D. Demou, Panagiotis Koromilas, James Oldfield, Yannis Panagakis, Mihalis A. Nicolaou

机构 * The Cyprus Institute(塞浦路斯研究所) University of Athens(雅典大学) University of Oxford(牛津大学) Archimedes AI/Athena Research Center(Archimedes AI/ Athena 研究中心) University of Cyprus(塞浦路斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出fmxcoders,通过低秩张量分解和随机层掩码技术,解决传统交叉编解码器在跨层特征恢复中的不足,提升模型的语义相干性与重构性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04012 2026-05-12 cs.AI 70%

SymptomAI: Toward a Conversational AI Agent for Everyday Symptom Assessment

SymptomAI:迈向日常症状评估的对话式AI代理

Joseph Breda, Fadi Yousif, Beszel Hawkins, Marinela Cotoi, Miao Liu, Ray Luo, Po-Hsuan Cameron Chen, Mike Schaekermann, Samuel Schmidgall, Xin Liu, Girish Narayanswamy, Samuel Solomon, Maxwell A. Xu, Xiaoran Fan, Longfei Shangguan, Anran Wang, Bhavna Daryani, Buddy Herkenham, Cara Tan, Mark Malhotra, Shwetak Patel, John B. Hernandez, Quang Duong, Yun Liu, Zach Wasson, Dimitrios Antos, Bob Lou, Matthew Thompson, Jonathan Richina, Anupam Pathak, Nichole Young-Lin, Jake Sunshine, Daniel McDuff

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文研究了SymptomAI在日常生活中对患者症状评估的准确性,通过真实世界数据验证其优于传统临床诊断,展示了专用症状访谈策略的优越性。

Comments 13 page main text, 54 pages total. 16 figures total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08847 2026-05-12 cs.CL 70%

EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding

EmoS:一种高保真多模态基准,用于细粒度流式情感理解

Pengze Guo, Jingxi Liang, Zhiwen Xie, Qifeng Wang, Derek F. Wong

机构 * NLP(自然语言处理) CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学学院,澳门大学CT实验室) School of Computer Science, Central China Normal University(Central China Normal University计算机科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EmoS基准,通过严格过滤静态片段与动态流式独白子集结合,解决现有数据集在生态效度和噪声方面的不足,提升多模态大语言模型在情感识别和共情模型训练中的性能。

Comments acl - 2026 main accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12606 2026-05-12 cs.LG 70%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01977 2026-05-12 cs.CL 70%

Beyond Local Edits: Embedding-Virtualized Knowledge for Broader Evaluation and Preservation of Model Editing

超越局部编辑:基于嵌入的虚拟化知识用于更广泛的评估和保护模型编辑

Shuainan Liu, Xuanang Chen, Ben He, Le Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出嵌入虚拟化知识(EVK)方法,通过嵌入空间中的可控扰动扩展知识区域,构建EVK-Bench评估基准,并提出EVK-Align模块以提升知识保留与编辑准确性。

Comments We voluntarily withdraw this manuscript. Extensive post-submission testing shows the method lacks the originally reported generality and effectiveness. The benchmark metrics originally designed are inadequate for assessing existing model editing algorithms. To avoid misleading the community, we have decided to withdraw this paper and will not release an updated version.

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18061 2026-05-12 cs.AI cs.HC 70%

Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing

专家评估与心理健康AI安全测试中人类反馈的局限性

Kiana Jafari, Paul Ulrich Nikolaus Rust, Duncan Eddy, Robbie Fraser, Nina Vasan, Darja Djordjevic, Akanksha Dadlani, Max Lamparth, Eugenia Kim, Mykel Kochenderfer

机构 * Stanford University(斯坦福大学) University College London(伦敦大学学院) Microsoft(微软)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究探讨了在心理健康AI安全测试中,专家评估与人类反馈的有效性,发现专家间一致性差,揭示了专家分歧是社会技术现象,建议转向保留专家分歧的对齐方法。

Comments 17 pages, 7 pages of appendix, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13415 2026-05-12 cs.IR cs.CL cs.CV 70%

Attention Grounded Enhancement for Visual Document Retrieval

基于注意力的视觉文档检索增强

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。

Comments Published as a conference paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20909 2026-05-12 cs.CL 70%

LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories

LogitTrace:通过层间logit轨迹检测基准污染

Zirui He, Haiyan Zhao, Yingcong Li, Ali Payani, Mengnan du

机构 * New Jersey Institute of Technology(新泽西理工学院) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LogitTrace框架,通过分析中间logit轨迹检测记忆化决策动态,发现污染样本更早承诺,而干净样本证据积累更渐进,帮助区分污染与干净样本。

Comments 23pages, 10 figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10887 2026-05-12 cs.CV 67%

Count Anything at Any Granularity

按任意粒度计数

Chang Liu, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(人工智能学院,上海交通大学,中国) CMIC, Shanghai Jiao Tong University, China(计算机医学研究所,上海交通大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出多粒度计数框架,通过显式定义计数粒度解决开放世界计数问题,构建了最大的标注数据集KubriCount,并训练了HieraCount模型提升计数精度与泛化能力。

Comments Project page: https://verg-avesta.github.io/KubriCount/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10530 2026-05-12 cs.IR 67%

Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery

个性化深度研究:以用户为中心的框架、数据集和混合评估方法用于知识发现

Xiaopeng Li, Wenlin Zhang, Yingyi Zhang, Pengyue Jia, Yejing Wang, Yichao Wang, Yong Liu, Huifeng Guo, Xiangyu Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出PDR框架,结合用户上下文动态调整检索深度和广度,通过混合评估方法提升检索效用和报告相关性,验证了个性化知识获取的可行性。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10228 2026-05-12 cs.MM 67%

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

FLARE:全模态长视频音频视觉检索基准测试与用户模拟查询

Qijie You, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhenhao Wong, Wentao Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FLARE基准测试通过全模态长视频和用户模拟查询,评估视频检索在多模态大语言模型中的表现,揭示用户查询对模型行为的影响及音频语言对齐的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10204 2026-05-12 cs.CV 67%

3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects

3DReflecNet:一个大规模数据集,用于反射、透明和低纹理物体的3D重建

Zhicheng Liang, Haoyi Yu, Boyan Li, Dayou Zhang, Zijian Cao, Tianyi Gong, Junhua Liu, Shuguang Cui, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出3DReflecNet数据集,包含超过700万张多视角图像,用于评估和推动针对反射、透明和低纹理物体的3D视觉方法,揭示现有方法在复杂材料下的局限性。

Comments This paper has been accepted by CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16345 2026-05-12 cs.HC 67%

Can GPT-4o Evaluate Usability Like Human Experts? A Comparative Study on Issue Identification in Heuristic Evaluation

GPT-4o能否像人类专家一样评估可用性?关于启发式评估中问题识别的比较研究

Guilherme Guerino, Luiz Rodrigues, Bruna Capeleti, Rafael Ferreira Mello, André Freire, Luciana Zaina

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文比较GPT-4o与人类专家在启发式评估中识别问题的能力,发现GPT-4o在审美和极简设计相关启发式方面表现较好,但在灵活性、控制和用户效率相关启发式方面存在困难。

Comments Paper accepted at the 20th IFIP TC13 International Conference on Human-Computer Interaction (INTERACT) 2025

Journal ref In: Ardito, C., et al. Human-Computer Interaction - INTERACT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10012 2026-05-12 cs.HC cs.CR 67%

Sketch-based Access Control: A Multimodal Interface for Translating User Preferences into Intent-Aligned Policies

基于草图的访问控制:一种多模态接口,用于将用户偏好转化为意图对齐的策略

Kyzyl Monteiro, Sauvik Das

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出SBAC系统,结合草图和多模态大语言模型,帮助用户逐步完善访问策略,发现潜在问题并验证策略行为。

Comments 27 pages including appendix; 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09844 2026-05-12 cs.AI cs.CL cs.LG 67%

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

元认知探测:用于大语言模型的五种行为校准诊断

Rafael C. T. Oliveira

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出元认知探测工具,通过五个维度评估大语言模型的自信行为,揭示模型在特定领域的过度自信问题,展示了Gemini 2.5 Flash在不同任务中的显著差异。

Comments 27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09703 2026-05-12 cs.CV 67%

MOTOR-Bench: A Real-world Dataset and Multi-agent Framework for Zero-shot Human Mental State Understanding

MOTOR-Bench:一个现实世界数据集和多智能体框架,用于零样本人类心理状态理解

Xiaoyu Yuan, Niklas Heikkala, Tiina Törmänen, Hanna Järvenoja, Guoying Zhao, Haoyu Chen

机构 * University of Oulu(奥卢大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MOTOR-Bench,通过现实世界数据集和多智能体框架,解决零样本人类心理状态理解问题,展示了多智能体框架在行为、认知和情绪预测上的优越性能。

Comments Accepted by CVPR 2026 workshop AI4RWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14183 2026-05-12 cs.HC 67%

Exploring a Multimodal Chatbot as a Facilitator in Therapeutic Art Activity

探索多模态聊天机器人作为治疗艺术活动的促进者

Le Lin, Zihao Zhu, Rainbow Tin Hung Ho, Jing Liao, Yuhan Luo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出一种基于多模态大语言模型的聊天机器人,通过实时分析视觉创作并促进反思对话,探讨其在艺术治疗中的应用潜力及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08763 2026-05-12 cs.CR 67%

When LLMs Team Up: A Coordinated Attack Framework for Automated Cyber Intrusions

当大语言模型协同作战:一种用于自动化网络入侵的协同攻击框架

Minfeng Qi, Tianqing Zhu, Zijie Xu, Congcong Zhu, Qin Wang, Wanlei Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出CAESAR框架,通过分解任务为五个角色并协调执行,提高自动化入侵任务的成功率并减少性能波动,尤其在需要多步骤利用组合的任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08647 2026-05-12 cs.CL cs.AI cs.LG 67%

AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

AgentCollabBench: 评估好代理为何会成为差合作者

Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu Debsarkar, Humayra Tasnim, Gour Gupal Talukder Shawon, Debjoty Mitra, Sumaiya Ahmed Rani, Al Jami Islam Anik, Al Nafeu Khan

机构 * University of Utah(犹他大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of Dhaka(达卡大学) Vellore Institute of Technology(韦洛雷理工学院) University of Virginia(弗吉尼亚大学) Rajshahi University of Engineering and Technology(拉贾加赫尔工程与技术大学) Shahjalal University of Science and Technology(沙赫jalal科学与技术大学) BRAC University(BRAC大学) Islamic University of Technology(伊斯兰技术大学) Comilla University(科摩拉大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentCollabBench,通过900个经人类验证的任务评估多代理系统中四个行为风险:指令衰减、虚假信念传播、上下文泄露和追踪耐久性,揭示模型在多跳信息生存中的结构问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06464 2026-05-12 cs.SE 67%

To What Extent Does Agent-generated Code Require Maintenance? An Empirical Study

代理生成的代码需要多少维护?一项实证研究

Shota Sawada, Tatsuya Shirai, Yutaro Kashiwa, Ken'ichi Yamaguchi, Hiroshi Iwata, Hajimu Iida

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究通过分析AI生成与人工编写代码的维护情况,发现AI代码维护频率较低,主要修改类型为功能扩展,而人工代码则以修复bug为主,人类开发者主导了大部分维护工作。

Comments 6 pages, 2 figures, 2 tables. Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03099 2026-05-12 astro-ph.GA 67%

A Multi-Survey Machine-Readable Corpus of Milky Way Globular Cluster Parameters for Retrieval-Augmented Generation Applications

一个包含银河系球状星团参数的多调查机器可读语料库用于检索增强生成应用

David C. Flynn

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文介绍了银河系球状星团语料库v1.3.1,整合了174个银河系球状星团的基本参数,用于检索增强生成应用。

Comments 3 Tables and 4 Figures. Companion data descriptor to the Unified Galaxy HI Rotation Curve Corpus v7 (Zenodo 10.5281/zenodo.19563417). v7: corrected Harris [Fe/H] description to spectroscopic metallicity (Carretta et al. scale) following communication from E. Carretta (INAF Bologna); added Kruijssen et al. (2019) as recommended ages source for v1.4

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08333 2026-05-12 cs.LG cs.AI cs.CL cs.PF cs.SE 67%

CDS4RAG: Cyclic Dual-Sequential Hyperparameter Optimization for RAG

CDS4RAG:基于循环双序列的RAG超参数优化

Pengzhou Chen, Tao Chen

机构 * School of Computer Science and Engineering, UESTC, Chengdu, China(电子科技大学计算机科学与工程学院,成都,中国) IDEAS Lab, University of Birmingham, Birmingham, UK(伯明翰大学IDEAS实验室,英国布里斯托尔)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CDS4RAG框架,通过循环双序列方法优化RAG的全部超参数,提升检索生成性能,实验显示在24种情况下均优于现有算法。

Comments Accepted by main track at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10876 2026-05-12 cs.LG cs.AI q-bio.QM 62%

AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

AssayBench: 一个基于实验层面的虚拟细胞基准,用于LLMs和代理

Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia

机构 * Genentech(基因泰克)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 AssayBench通过1920个公开CRISPR实验构建,用于评估LLMs和代理在预测表型筛选中的性能,引入调整后的nDCG指标,显示通用LLMs在任务中表现优于生物专用模型。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10563 2026-05-12 cs.CL cs.AI 62%

ThreatCore: A Benchmark for Explicit and Implicit Threat Detection

ThreatCore:一种用于显式和隐式威胁检测的基准测试

Davide Bruni, Carlo Bardazzi, Maurizio Tesconi

机构 * Computer Science Department, University of Pisa, Italy(比萨大学计算机科学系) Institute of Informatics and Telematics, National Research Council, Italy(意大利国家研究委员会信息与电信学研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ThreatCore基准数据集,用于细粒度威胁检测,区分显式威胁、隐式威胁和非威胁。通过整合公开资源并重新标注,揭示现有标签的不一致。通过合成示例增强数据集,发现隐式威胁更难检测,语义角色标注可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10202 2026-05-12 cs.LG cs.CL 62%

Task-Aware Calibration: Provably Optimal Decoding in LLMs

任务感知校准:在大语言模型中的可证明最优解码

Tim Tomov, Dominik Fuchsgruber, Rajeev Verma, Stephan Günnemann

机构 * School of Computation, Information & Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) Munich Data Science Institute(慕尼黑数据科学研究所) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出任务感知校准方法,通过在任务诱导的潜在空间中校准模型预测分布,实现更可靠的解码策略,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04475 2026-05-12 cs.LG cs.AI cs.NE stat.ML 62%

GraphBench: Next-generation graph learning benchmarking

GraphBench: 图学习下一代基准测试

Timo Stoll, Chendi Qian, Ben Finkelshtein, Ali Parviz, Darius Weber, Fabrizio Frasca, Hadar Shavit, Antoine Siraudin, Arman Mielke, Marie Anastacio, Erik Müller, Maya Bechler-Speicher, Michael Bronstein, Mikhail Galkin, Holger Hoos, Mathias Niepert, Bryan Perozzi, Jan Tönshoff, Christopher Morris

机构 * RWTH Aachen University(亚琛RWTH大学) University of Oxford(牛津大学) Mila – Quebec AI Institute(魁北克AI研究所) Technion - Israel Institute of Technology(技术学院-以色列理工学院) ETAS Research University of Stuttgart(斯图加特大学ETAS研究所) Google Research(谷歌研究) Microsoft Research(微软研究院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 GraphBench 提供标准化评估协议和统一超参数调优框架,用于评估图学习任务中的泛化能力,推动图学习领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08192 2026-05-12 cs.CY cs.AI cs.LG cs.SE 62%

NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims

NeurIPS应要求对前沿AI安全声明实施可重复性标准

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出要求NeurIPS对涉及前沿AI安全声明的论文实施可重复性标准,通过三级披露框架和强制性声明清单等措施,确保高影响声明的可重复性,以提升AI安全测试的可靠性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏