arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2607.02897 2026-07-07 cs.CR cs.AI cs.CV 新提交 70%

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments 17 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01425 2026-07-07 cs.AI 新提交 70%

Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases

Agent4cs:面向大型分层代码库的代码摘要多智能体系统

Yongjian Tang, Ezgi Sarikayak, Doruk Tuncel, Jie M. Zhang, Thomas Runkler

机构 * Siemens AG(西门子股份公司) Technical University of Munich(慕尼黑工业大学) Kings College London(伦敦国王学院)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出多智能体框架Agent4cs,通过自底向上方式对大型代码库进行摘要,包含摘要、关键词提取和质量保证三个智能体,在语义一致性和关键词覆盖率上分别提升8%和38%。

Comments Accepted to the main track of the 23rd European Conference on Multi-Agent Systems (EUMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31644 2026-07-07 cs.CL cs.CY 新提交 70%

Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues

大语言模型中的道德安全:揭示对困惑线索的表演性遵从

Mohammadamin Shafiei, Shuyue Stella Li, Yulia Tsvetkov

机构 * University of Milan(米兰大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出“表演性遵从”概念,揭示大语言模型在道德困境中当身份标签被隐藏时公平性显著下降,并引入线索变化方法和“线索可见性差距”指标来区分真实与表演性道德安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09118 2026-07-07 cs.AI 新提交 70%

ComplexConstraints and Beyond: Expert Rubrics for RLVR

复杂约束与超越:RLVR的专家评分标准

Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen

机构 * Surge AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出专家设计的评分标准作为评估和训练信号,通过复杂指令遵循和企业智能体任务验证,在RL训练中显著提升模型性能。

Comments Accepted to the GEM workshop at ACL 2026: https://gem-workshop.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02141 2026-07-03 cs.AI 新提交 70%

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准

Shuo Ren, Yaohui Han, Yifan Shi, Libo Shen, Haodong Lu, Dongfang Wu, Rongliang Fu, Bei Yu, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。

Comments 25 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01883 2026-07-03 cs.CL 新提交 70%

PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation

PairCoder++:结对编程作为验证代码驱动的多模态与结构化工件生成的通用范式

Junhao Chen, Xiang Li, Mingjin Chen, Boran Zhang, Henghaofan Zhang, Yibin Xu, Yuehan Cui, Fangsheng Weng, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * THU(清华大学) PKU(北京大学) PolyU, Hong Kong(香港理工大学) USTC(中国科学技术大学) UESTC(电子科技大学) Tongji University(同济大学) Tianjin University(天津大学) Independent Researcher(独立研究者) Guangming Lab(光明实验室) BAAI(北京智源人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PairCoder框架,通过驱动者和导航者两个智能体结对编程,利用工具链反馈验证代码生成,在17个基准测试中显著提升可验证工件的生成质量。

Comments Accepted by ACL 2026. Project Page: https://yisuanwang.github.io/PairCoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01280 2026-07-03 cs.LG cs.PL 新提交 70%

Fixed-Set Robustness in Programming by Example: Example Corruption and Semantic Partition Recovery

编程示例中的固定集鲁棒性:示例损坏与语义分区恢复

Yuan Si, Jialu Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究编程示例系统中对抗性示例损坏的鲁棒性,提出版本空间分区聚合(VPA)防御方法,实验表明低裕度任务易受攻击,VPA仅在语义分区投票裕度存在时有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01252 2026-07-03 cs.CY cs.AI 新提交 70%

How Indian Dermatologists are Utilizing Artificial Intelligence for Clinical Practice and Workflow Management: A Nationwide Survey with a Special Focus on atopic dermatitis

印度皮肤科医生如何将人工智能用于临床实践和工作流程管理:一项以特应性皮炎为重点的全国性调查

Dipayan Sengupta, Saumya Panda, Sandipan Dhar, Dipankar De, Deepika Pandhi, Narayanan B

机构 * Charnock Hospital, Kolkata, India(科钦医院,加尔各答,印度) Department of Dermatology, Jagannath Gupta Institute of Medical Sciences and Hospital, Kolkata, India(皮肤科部,贾亚纳塔·古普塔医学科学与医院,加尔各答,印度) Department of Pediatric Dermatology, Institute of Child Health, Kolkata-700017, India(儿科皮肤科部,儿童健康研究所,加尔各答-700017,印度) Department of Dermatology, Venereology, and Leprology, Postgraduate Institute of Medical Education and Research, Chandigarh-160012, India(皮肤科、性病学和麻风病学部,医学教育与研究研究生院,昌迪加尔-160012,印度) Department of Dermatology and STD, University College of Medical Sciences & GTBH, University of Delhi, Delhi-110095, India(皮肤科和性传播疾病部,医学科学大学及GTBH,德里大学,德里-110095,印度) Department of DVL, Sree Balaji Medical College and Hospital, Chennai, India(DVL部,Sree Balaji医学院和医院,钦奈,印度)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过全国性调查,发现印度皮肤科医生主要使用通用大语言模型处理认知和行政任务,而临床需求集中于慢性病管理和特应性皮炎工作流支持,提示临床监督下的工作流工具可能比独立诊断应用更有用。

Comments 28 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00436 2026-07-02 cs.AI 新提交 70%

PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

PHREEQC-MCQ-200:用于工具增强型科学模拟智能体的诊断基准

Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PHREEQC-MCQ-200基准,评估工具增强型智能体在地球化学模拟中的表现,发现模拟器访问显著提升准确率但存在非单调性,输出访问协议影响性能。

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00334 2026-07-02 cs.AI 新提交 70%

Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems

运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理

Srini Ramaswamy, Wang Miaosheng

机构 * DNRS.ai, USA

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。

Comments to be submitted to a Journal, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18293 2026-07-02 cs.SE cs.AI 新提交 70%

Vibe Coding Ate My Homework: An evaluation of AI approaches to greenfield software engineering and programming

Vibe Coding 吃掉我的作业:AI 方法在全新软件工程与编程中的评估

Callum Barbour

机构 * OpenAI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文评估了“氛围编码”(用自然语言提示编程)在全新软件工程任务中的可行性,并分析了现有基准,通过开发 Python 简单独立编程任务评估套件提供见解。

Comments 10 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31518 2026-07-01 cs.AI 新提交 70%

Design and Implementation of Agentic Orchestrations and Orchestration of Agents

代理编排与代理编排的设计与实现

Stefanie Rinderle-Ma, Juergen Mangler, Johannes Loebbecke, Dominik Voigt, Nataliia Klievtsova, Matthias Ehrendorfer

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出代理业务流程管理的分类框架,包括任务特异性、可追溯性、自主性等属性,并给出定性决策标准和定量评估指标,通过预测光感场景实例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交 70%

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27936 2026-06-29 cs.CR cs.AI stat.AP 新提交 70%

Agentic AI-Powered Re-Identification: An Emerging, Scalable Threat to Mobility Microdata Privacy

基于智能体AI的重识别:对移动微数据隐私的新兴可扩展威胁

Oscar Thees, Roman Müller, Matthias Templ

机构 * University of Applied Sciences and Arts Northwestern Switzerland (FHNW)(西北瑞士应用科学和艺术大学(FHNW))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用智能体AI自动从公开网络搜索并交叉引用数据,实现从时空轨迹中重识别个体,实验成功率达72%,揭示了大规模重识别威胁。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27334 2026-06-26 cs.AI 新提交 70%

Language-Based Digital Twins for Elderly Cognitive Assistance

基于语言的数字孪生用于老年人认知辅助

Mohammad Mehdi Hosseini, Mohammad H. Mahoor, Hiroko H. Dodge

机构 * Ritchie School of Engineering and Computer Science, University of Denver(丹佛大学里奇工程与计算机科学学院) Department of Neurology, Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院神经内科)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于大语言模型的数字孪生框架,通过风格测量和上下文元数据模拟老年人对话行为,并引入多条件变分自编码器评估保真度和认知一致性,实现非侵入式认知健康监测。

Comments Accepted and published in the Proceedings of the ACM International Conference on PErvasive Technologies Related to Assistive Environments (PETRA 2026). The final published version is available through the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27247 2026-06-26 cs.LG 新提交 70%

RSPC: A Benchmark for Modeling Stress and Psychiatric Conditions in Digitally Mediated Relationships using Psychiatrist Annotations

RSPC:使用精神科医生标注对数字媒介关系中的压力和精神病状况进行建模的基准

Parmitha Vangapandu, Sai Ganesh Mokkapati, Sathwik Narkedimilli, MSVPJ Sathvik, Timothy Liu, Simon See, Johannes C. Eichstaedt

机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德分校) Keshav Memorial College of Engineering(克沙夫纪念工程学院) National University of Singapore(新加坡国立大学) University of Birmingham(伯明翰大学) NVIDIA, Singapore(英伟达(新加坡)) Stanford University(斯坦福大学) INSEAD(欧洲工商管理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出RSPC基准,包含精神科医生标注的Reddit帖子,用于多标签障碍分类、关系触发检测和阶段预测,发现模型能力差异及焦虑与关系不确定性的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27027 2026-06-26 cs.CR cs.AI 新提交 70%

ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP

ShareLock: 针对MCP的隐蔽多工具阈值投毒攻击

Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ShareLock框架,利用Shamir阈值方案将恶意指令分散到多个工具描述中,实现隐蔽性和容错性,平均攻击成功率超90%。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26857 2026-06-26 cs.AI 新提交 70%

LCAi: Life Cycle Assessment with big data fusion and retrieval-augmented generation-assisted interpretation

LCAi: 基于大数据融合与检索增强生成辅助解释的生命周期评估

Georgios Tsironis, Juan D. Medrano-Garcia, Gonzalo Guillen-Gosalbez

机构 * Institute for Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zürich(苏黎世联邦理工学院化学与应用生物科学系化学与生物工程研究所) NCCR Catalysis(瑞士国家研究能力中心催化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种视角条件检索增强生成框架,通过多视角检索与受控合成,在AI辅助生命周期评估中实现结构化解释,减少幻觉风险并保持跨领域多样性。

Comments 23 pages, 14 figures, 6 tables. Includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26836 2026-06-26 cs.AI 新提交 70%

The Capability Frontier: Benchmarks Miss 82% of Model Performance

能力前沿:基准测试遗漏了82%的模型性能

Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

机构 * Martian University of Oxford(牛津大学) ThoughtWorks

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26552 2026-06-26 cs.CV cs.AI 新提交 70%

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26518 2026-06-26 cs.AI 新提交 70%

NeuraDock Visual Cognitive Load Agent Tutorial: A Quality-Gated Open-Source EEG Workflow for Alpha Dynamics and Real-Time Applications

NeuraDock 视觉认知负荷代理教程:面向 Alpha 动态与实时应用的质量门控开源 EEG 工作流

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo

机构 * Shanghai Pulse Element Intelligent Technology Co., Ltd. (NeuraDock)(上海脉元智能科技有限公司(NeuraDock))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出 NeuraDock Agent 开源 EEG 代理,通过质量门控工作流实现 Alpha 动态分析和视觉认知负荷实时应用,弥合离线与在线分析差距。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12716 2026-06-26 cs.CL 新提交 70%

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

AI审稿人是否看到全貌?攻击与防御多模态同行评审

Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。

Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26036 2026-06-25 cs.CL cs.CR 新提交 70%

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning

检测、遗忘、恢复:防御文本摘要模型免受数据投毒

Poojitha Thota, Shirin Nilizadeh

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出统一的后验防御框架,通过影响函数分析或行为审计检测微调阶段的数据投毒,并利用梯度上升遗忘恢复模型性能,在多种攻击下实现85-92%检测精度和96%行为恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 70%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25645 2026-06-25 cs.CR cs.AI 新提交 70%

Taxonomy of Risks on Automated Fact-Checking Systems Considering its Propagation

自动事实核查系统风险及其传播的分类

Jun Yajima, Tatsuya Oka, Takao Okubo

机构 * Fujitsu Limited(富士通有限公司) Institute of Information Security(信息安全研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对自动事实核查系统在传播中可能产生的风险,提出三阶段风险传播分类法,识别出32种具体风险,并用于评估DEFAME系统,发现能识别传统方法遗漏的风险。

Comments 15 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25396 2026-06-25 cs.AI 新提交 70%

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

长期模拟揭示AI伴侣的认知发展风险

Kaicheng Shen, Lingyu Li, Wen Wu, Yan Teng, Liang He, Yingchun Wang

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海人工智能教育研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TSJ框架,通过角色驱动用户模拟、动态心理状态更新和回顾性评估,在12,960模拟人天交互中揭示短期测试低估长期认知发展风险,并识别出幼儿期和成年初期为最脆弱阶段。

Comments 19 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 70%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 70%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24714 2026-06-24 cs.CL cs.SD eess.AS 新提交 70%

CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation

CN-NewsTTS Bench:面向原始输入中文新闻TTS发音的目标级自动基准

Shijun Luo

机构 * NetEase Cloud Music(网易云音乐)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对中文新闻TTS对密集书面形式(如分数、连字符型号等)发音不准的问题,提出CN-NewsTTS Bench v0.1基准,包含自动评估集和评分器,测试七个商业系统,最佳准确率0.879。

Comments 5 pages, 1 figure, 8 tables. ICASSP-style preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24387 2026-06-24 cs.CL 新提交 70%

AutoSpecNER: A Fine-Grained Named Entity Recognition Dataset for Vehicle Specification Extraction

AutoSpecNER: 用于车辆规格提取的细粒度命名实体识别数据集

Jordan Lee, Filippos Ventirozos, Abdirahman Abdullahm, Ioanna Nteka, Peter Appleby, Matthew Shardlow

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特城市大学计算与数学系) Autotrader Research Group, Autotrader UK(英国Autotrader研究组)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AutoSpecNER数据集,包含659条汽车广告和15类超过1万个实体,基于DeBERTa的模型达到90%微平均F1分数,优于规则方法和大型语言模型。

Comments 13 pages, 2 figures, 7 tables, Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏