arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 202 篇

2509.02558 2026-06-02 cs.IR 80%

Lighting the Way for BRIGHT: Reproducible Baselines with Anserini, Pyserini, and RankLLM

为BRIGHT照亮道路:基于Anserini、Pyserini和RankLLM的可复现基线

Sahel Sharifymoghaddam, Yijun Ge, Jimmy Lin

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究系统评估了面向推理的检索基准BRIGHT,通过集成到Anserini、Pyserini和RankLLM中的强基线方法,发现查询端BM25(BM25Q)在长查询下优于标准BM25,并揭示了数据质量问题及融合策略的泛化性。

Comments SIGIR 2026 Reproducibility Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02106 2026-06-02 cs.LG stat.ML 79%

When Tabular Foundation Models Transfer Across Modalities: A Systematic Evaluation Across 95 Datasets, 7 Modalities, and Two Regimes

当表格基础模型跨模态迁移:对95个数据集、7种模态和两种范式的系统评估

Julien Lafrance

机构 * Telecom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种结合等角紧框架预处理与表格基础模型的分类流水线,在跨模态数据上评估其性能,并证明其在速度与质量间取得良好平衡。

Comments 24 pages, 5 figures. Code and data available at https://doi.org/10.5281/zenodo.19982636

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00997 2026-06-02 cs.CL 79%

Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading

顺序无关语言模型中的解码:链式法则偏差与均匀扩散

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文研究顺序无关语言模型(OALM)中揭示顺序对似然的影响,提出基于置信度方差的诊断方法,并证明均匀扩散定理以优化解码路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00871 2026-06-02 cs.CV cs.AI 79%

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

城市感知中的视觉语言模型基准应具备可靠性意识且可协商

Rashid Mushkani

机构 * Rashid Mushkani

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出,用于城市感知的视觉语言模型基准应将分歧和弃权视为测量结果,报告标注者间信度,并将标签空间和评分策略视为可协商的产物。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09692 2026-06-02 cs.AI 79%

Causal state binding predicts action control in language agents

因果状态绑定预测语言智能体中的动作控制

Xiao Jia

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳))

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 提出因果状态绑定框架,通过干预实验测量智能体动作是否随事件特定决定性状态变化,验证了结构化智能体在动作控制上优于随机基线。

Comments 85 pages, 5 main figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16660 2026-06-02 cs.CV cs.LG physics.med-ph 79%

Universal and Transferable Attacks on Pathology Foundation Models

病理基础模型的通用与可迁移攻击

Yuntian Wang, Xilin Yang, Che-Yung Shen, Nir Pillar, Aydogan Ozcan

机构 * Electrical and Computer Engineering Department, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校电子与计算机工程系) Bioengineering Department, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校生物工程系) California NanoSystems Institute (CNSI), University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校加州纳米系统研究所) Department of Pathology, Hadassah Hebrew University Medical Center, Jerusalem, 91120, Israel(海法希伯来大学医疗中心病理学系) Department of Surgery, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校外科系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出通用可迁移对抗扰动(UTAP),通过固定弱噪声模式破坏多个病理基础模型的特征表示能力,导致下游任务性能下降,并展示其跨数据集通用性和跨模型可迁移性。

Comments 38 Pages, 8 Figures

Journal ref Light: Science & Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24808 2026-06-02 cs.AI 79%

Query Circuits: Explaining How Language Models Answer User Prompts

查询电路:解释语言模型如何回答用户提示

Tung-Yu Wu, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出查询电路方法,通过直接追踪模型内部信息流来忠实解释特定输入如何产生输出,并引入归一化偏差忠实度(NDF)度量及采样方法实现稀疏电路发现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02444 2026-06-02 cs.AI cs.CL 79%

Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback

食物噪音与虚假安全:系统评估LLMs如何在临床医生反馈下未能适应饮食障碍查询

Giulia Pucci, Emily Hemendinger, Ruizhe Li, Gavin Abercrombie, Tanvi Dinkar, Arabella Sinclair

机构 * University of Aberdeen(阿伯丁大学) University of Colorado Anschutz(科罗拉多大学安舒茨分校) Heriot-Watt University(赫里奥特-瓦特大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过与临床饮食障碍专家合作,系统评估了大型语言模型在处理饮食障碍用户查询时,因不加批判地适应不安全或自伤请求而可能产生的危害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07967 2026-06-02 cs.CL cs.AI 79%

AtomEval: Validity-Aware Atomic Evaluation of Adversarial Claim Rewriting in Fact Verification

AtomEval: 事实核查中对抗性声明重写的有效性感知原子评估

Hongyi Cen, Mingxin Wang, Yule Liu, Jingyi Zheng, Hanze Jia, Tan Tang

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出AtomEval协议,通过原子分解和保留门控,区分有效规避验证与改变命题的重写,并引入VASR指标,解决传统ASR膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24511 2026-06-02 cs.LG cs.AI cs.CR 79%

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

Claudini: 自动研究发现针对LLM的最先进对抗攻击算法

Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

机构 * MATS ELLIS Institute(MATS ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种自动研究循环,利用前沿AI代理(如Claude Code和Codex)自动发现针对大语言模型的新型对抗攻击算法,在白盒越狱和提示注入评估中达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15411 2026-06-02 cs.CL cs.AI 79%

HiFi-KPI: A Dataset for Hierarchical KPI Extraction from Earnings Filings

HiFi-KPI:用于从财报中提取层次化KPI的数据集

Rasmus Aavang, Giovanni Rizzi, Rasmus Bøggild, Alexandre Iolov, Mike Zhang, Johannes Bjerva

机构 * Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) ALIPES ApS(ALIPES公司) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(先锋人工智能中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对财报中关键绩效指标(KPI)跨公司可迁移性差的问题,提出包含165万段落和19.8万层次化标签的HiFi-KPI数据集,并评估分类、提取和结构化提取三个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10541 2026-06-02 cs.LG cs.AI 79%

Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?

重新思考强化学习评估:基准测试能否真正揭示强化学习方法的失败?

Zihan Chen, Yiming Zhang, Hengguang Zhou, Zenghui Ding, Yining Sun, Cho-Jui Hsieh

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(美国加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过引入诊断套件和Oracle性能差距(OPG)指标,发现当前基准测试无法可靠区分强化学习方法在训练集和测试集上的性能差异,并揭示现有方法在分布偏移、难度变化和反事实场景中泛化能力不足,提出更可靠基准设计的三项核心原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL 79%

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 评测与基准 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00112 2026-06-02 cs.NE cs.CV 78%

Evolving to the Aesthetics of a Vision-Language Model

进化到视觉语言模型的美学

Stephen James Krol, Jon McCormack

机构 * SensiLab, Monash University Melbourne, Australia(传感实验室,墨尔本莫纳什大学,澳大利亚)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究探索使用视觉语言模型(VLM)通过CLIP-IQA评分或成对比较结合Glicko评级系统来评估进化设计的美学,并与艺术家排名对比分析两种方法的优劣。

Comments Paper presented at ICCC26, June 29 - July 3, 2026, Coimbra, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20251 2026-06-02 cs.CV eess.IV 78%

Degradation-Aware Metric Prompting for Hyperspectral Image Restoration

退化感知度量提示用于高光谱图像恢复

Binfeng Wang, Di Wang, Haonan Guo, Ying Fu, Jing Zhang

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院) School of Computer Science, Wuhan University, Wuhan, Hubei, China(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 提出退化感知度量提示(DAMP)框架,通过可解释的空间-光谱度量作为退化提示,结合退化自适应混合专家(DAMoE)模块,实现多维度退化统一恢复,在自然和遥感高光谱数据集上达到最先进性能并展现零样本泛化能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01936 2026-06-02 cs.CL 77%

What to Format and How: A Benchmark and Workflow Approach for Document Formatting

格式化什么以及如何格式化:文档格式化的基准与工作流方法

Shihao Rao, Liang Li, Jiapeng Liu, Tong Lin, Bing Li, Xiyan Gao, Peng Fu, Jing Huang, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对内容感知的文档格式化任务,提出基准DocFormBench和工作流方法DocFormFlow,通过解耦目标定位与修改执行,在提升准确率的同时降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01276 2026-06-02 cs.CL 77%

Worlds Within Words: Translating Culture in Ancient Chinese Texts with Multi-Agent Coordination

词中世界:基于多智能体协调的古代汉语文本文化翻译

Xiaoqi He, Kaixin Lan, Mu You, Tao Fang, Lidia S. Chao, Derek F. Wong

机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学自然语言处理与计算机实验室,计算机与信息科学系) Institute of International Language Services Studies, Macau Millennium College(澳门 millennium 学院国际语言服务研究学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对古代汉语文本中文化负载词的翻译难题,提出多智能体文化感知翻译框架MACAT,通过选择性显化策略动态识别文化短语并注入简洁解释,在中医经典和《论语》上优于基线模型。

Comments The preprint manuscript is 20 pages long and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00369 2026-06-02 cs.CY cs.LG 77%

Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

量化地理文化价值对多元安全对齐的显著性

Arkadiy Saakyan, Charvi Rastogi, Lora Aroyo

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 通过多层次模型分析,发现文化区域归属对安全评分有显著影响(p<0.05),约10%的项目存在文化敏感性,当前LLM无法可靠替代人类评分员但可辅助筛选。

Comments 119 pages, 13 figures. ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16571 2026-06-02 cs.CL 77%

Utility-Preserving De-Identification for Math Tutoring: Investigating Numeric Ambiguity in the MathEd-PII Benchmark Dataset

数学辅导中的效用保持去标识化:MathEd-PII基准数据集中的数值歧义研究

Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, Jinsook Lee, Doug Pietrzak, Daryl Hedley, Jorge Dias, Chris Shaw, Ruth Schäfer, René F. Kizilcec

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 针对数学辅导对话中数值表达式与标识符相似导致过度去标识化的问题,提出MathEd-PII基准数据集,并采用领域感知提示策略(F1达0.821)在保持数据效用的同时有效检测PII。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00986 2026-06-02 cs.CL 77%

ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents

ADRA-Bank:面向学术深度研究智能体的模块化基准

Zhihan Guo, Feiyang Xu, Yifan Li, Muzhi Li, Shuai Zou, Jiele Wu, Han Shi, Haoli Bai, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) National University of Singapore, Singapore, Singapore(新加坡国立大学) Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) Independent(独立)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01930 2026-06-02 cs.CL 77%

OARelatedWork: A Large-Scale Dataset of Related Work Sections with Full-texts from Open Access Sources

OARelatedWork:来自开放获取源的大规模相关工作章节数据集及其全文

Martin Docekal, Martin Fajcik, Pavel Smrz

机构 * Brno University of Technology(布拉格技术大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出OARelatedWork数据集,包含全文和完整相关工作章节,用于从开放获取源生成相关工作,并评估了多种模型,发现大型语言模型在处理全文时事实准确性下降,而人类作者常引入无根据的抽象声明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02547 2026-06-02 cs.GT 75%

Pluralistic Leaderboards

多元排行榜

Nika Haghtalab, Ariel D. Procaccia, Han Shao, Serena Lutong Wang, Kunhe Yang

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对用户偏好异质性导致传统Bradley-Terry模型排名失真的问题,提出基于社会选择理论的局部稳定机制,仅需少量用户比较即可实现稳定的多元排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01993 2026-06-02 cs.CL cs.AI cs.LG 75%

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

MMG2Skill: 智能体能否从野外指南中提炼出自我进化的技能?

Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MMG2Skill框架,将多模态异构的野外指南编译为可编辑技能,通过轨迹级根因反馈持续改进,在GUI控制、开放游戏和策略卡牌任务中显著提升VLM智能体性能。

Comments 35 pages, 12 figures, 13 tables. Code: https://github.com/NJU-LINK/MMG2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01286 2026-06-02 cs.SE cs.AI cs.CL cs.LG 75%

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

BenchEvolver: 通过以解决方案为中心的进化进行前沿任务合成

Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BenchEvolver框架,通过进化参考解决方案自动生成更难的编程问题,以解决基准饱和问题,并在LiveCodeBench和SciCode上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00118 2026-06-02 cs.SE cs.PL 75%

An Empirical Study on Logging Evolution On Stack Overflow: Trends, Topics, and Challenges

关于 Stack Overflow 上日志演变的实证研究:趋势、主题和挑战

Patrick Loic Foalem, Andre Nguimbous, Foutse Khomh, Heng Li, Ettore Merlo

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 基于 Stack Overflow 上的 216,094 篇帖子,使用大语言模型分类方法,识别出 11 个日志相关主题,并发现容器化环境中的日志记录是最具挑战性的主题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00030 2026-06-02 cs.CY 75%

From Parliamentary Rhetoric to Enacted Law: An NLP Pipeline for Semantic Auditing of the Greek Legislative Process

从议会修辞到制定法:用于希腊立法过程语义审计的NLP流水线

Despoina Antonakaki, Sotiris Ioannidis

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个多模态计算流水线,通过NLP分析议会辩论和立法文本,揭示法律复杂性、模糊性以及政治承诺与法律实施之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26102 2026-06-02 cs.CV 75%

InstructSAM: Segment Any Instance with Any Instructions

InstructSAM: 根据任意指令分割任意实例

Yuqian Yuan, Wentong Li, Zhaocheng Li, Yutong Lin, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出InstructSAM框架,通过将指令驱动实例分割建模为集合结构查询预测问题,并设计显式推理到实例查询接口,结合视觉语言模型和SAM3实现单次前向传播中的多实例分割。

Comments 19 pages, 8 figures, code: https://github.com/DCDmllm/InstructSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02443 2026-06-02 cs.CL cs.AI cs.CV 73%

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02255 2026-06-02 cs.CL cs.AI 73%

Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025

谁在NLP中进行标注?2018年至2025年人工标注报告的大规模评估

Maria Kunilovskaya, Gagan Bhatia, Lisa Sophie Albertelli, Yanran Chen, Christian Greisinger, Lotta Kiefer, Christoph Leiter, Subhadeep Roy, Tewodros Achamaleh, Muhammad Arslan Manzoor, Sebastian Pohl, Yufang Hou, Steffen Eger

机构 * NLLG Lab University of Technology Nuremberg(NLLG实验室 梅尔堡技术大学) Interdisciplinary Transformation University(跨学科转型大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过大规模审计NLP论文中的人工标注报告,发现标注细节报告不完整,并提出了改进报告质量的框架和建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00708 2026-06-02 cs.AI cs.LG 73%

MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition

MOSAIC:结构化智能体智能与组合的模块化编排

Yifan Bao, Xinyu Xi, Xinyu Liu, Wen Ge, Lei Jiang, Kevin Zhang, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) University College London(伦敦大学学院) University of Edinburgh(爱丁堡大学) Data & Analytics, Digital X(Digital X 数据与分析部) Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出MOSAIC框架,通过结构化智能体编排、记忆驱动的模型选择和蓝图构建,将自动化数据科学转化为可验证、可复用的模型选择问题,在金融时间序列任务中优于AutoML和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏