arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2608.17468 2026-08-19 cs.AI 新提交 70%

SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution

SAGE:基于归因引导规则演化的自演进分镜脚本技能

Maolin Ran, Xiaoyang Lu, Jiaqi Liu, Jian Wang, Weiwen Liu, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) CreativeFitting(创意拟合)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对分镜脚本制作的工业瓶颈,提出SAGE框架,通过归因引导规则演化实现导演知识的自演进,在测试中表现接近专业导演,部署后大幅提升制作效率,还发布了首个相关公开数据集PROSE

Comments 11 pages, 9 figures, 4 tables. Dataset available at https://github.com/creDreams/PROSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17319 2026-08-19 cs.AI 新提交 70%

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

Wuying-Browser-Agent:以真实场景为中心的基础长时程浏览器智能体

AIMAE Team, Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen Wu, Daiping Xin, Kunyu Zhou, Pengyang Zhou, Peiyuan Chen, Ziyuan Chen, Yutao Deng, Chunyu Dong, Xiangyu Fu, Yicheng Feng, Ruian He, Haochen Li, Miancan Liu, Zhengqin Liu, Wei Peng, Jinkui Ren, Haoyu Tan, Dong Xiao, Rongkun Xue, Shujian Yang, Xianhang Ye, Ziqi Yuan, Ziyang Yu, Linghan Zhang, Xiantao Zhang, Xuanpu Zhao, Yinan Zhao, Zhenghui Zhao, Bin Zhu, Likai Zou

机构 * Alibaba Cloud(阿里云) End-User Intelligent Computing BU(终端用户智能计算业务部) AI Model Application & Engineering Team(AI模型应用与工程团队)

专题命中 评测与基准 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Wuying-Browser-Agent统一框架,通过多层面技术对齐解决浏览器智能体实际部署问题,在多项基准取得最优成绩,且具备通用智能体迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17218 2026-08-19 cs.CL 新提交 70%

The Plot Thins: Uniformity and Linearity in Literary Summaries

情节淡化:文学摘要中的一致性与线性性

Rebecca M. M. Hicke, Sil Hamilton, David Mimno, Ross Deans Kristensen-McLachlan

机构 * Cornell University(康奈尔大学) Aarhus University(奥胡斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究构建小说摘要与原作章节映射数据集,测量摘要线性性与一致性,明确文学作品与摘要的情节表达差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16039 2026-08-18 eess.IV cs.AI cs.CV 新提交 70%

Decoupling Parcellation from Classification: Systematic Benchmark of Fast Brain Segmentation Methods for Alzheimer's Disease Detection

将脑部分区与分类解耦:阿尔茨海默病检测的快速脑分割方法的系统基准测试

Jiadao Zou, Hongyu Guo, Wei Xi

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 该研究将脑部分区与分类解耦,在OASIS-1数据集上对SynthSeg+等快速深度学习分区方法开展系统基准测试,评估多种体积策略与分类范式,以量化其对AD检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16577 2026-08-18 cs.CL 新提交 70%

BabelSteering: Multilingual Safety Alignment via English Steering Vectors

BabelSteering:通过英文引导向量实现多语言安全对齐

Emma V. Stein, Dominik Meier, Terry Ruas, Jan Philip Wahle, Bela Gipp

机构 * University of Göttingen(哥廷根大学) German State Police NRW(北莱茵-威斯特伐利亚州德国警察)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出BabelSteering激活引导方法,利用英语安全监督的拒绝方向实现多语言安全对齐,可提升多语言有害请求拒绝率且任务效用损失极小,还引入多语言翻译评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 70%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16402 2026-08-18 cs.AI 新提交 70%

A Policy Algebra for Trust-Preserving Agentic AI Execution

用于信任保留的智能体AI执行的策略代数

Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种策略代数,用于定义智能体AI执行的可靠范围,可干预94.8%的策略违规事件,保留86.9%的任务完成率,为构建可靠智能体提供支持。

Comments 7 figures, 10 tables, and 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16394 2026-08-18 cs.AI cs.IR 新提交 70%

Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152

在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例

Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 70%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16249 2026-08-18 cs.LG 新提交 70%

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

SAUL:感知锐度的增广拉格朗日模型遗忘算法

Jaewan Choi, Junyoung Yang, Sangdon Park

机构 * POSTECH(浦项科技大学) Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程学院) Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SAUL算法,将模型遗忘建模为显式约束的受约束最小化问题,通过增广拉格朗日控制器等实现更优遗忘-效用权衡,即插即用修改器可提升基线模型遗忘后效用。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16187 2026-08-18 cs.CR cs.AI cs.SE 新提交 70%

Securing AI-Generated Code: A Just-in-Time Vulnerability Detection and Remediation Pipeline

保护AI生成代码:一种即时漏洞检测与修复流水线

Mikhail Surikov

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种自动化安全评估流水线,可检测、修复AI生成代码的漏洞,在Claude的4种模型上评估发现,P2配置表现优于P1,Sonnet 4.6的修复效果最佳,且流水线有效性与初稿安全性不同。

Comments 7 pages, 8 tables, 2 figures. Georgia Institute of Technology Master's final practicum project. Code: https://github.com/Droidsurikov/securing-ai-generated-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16050 2026-08-18 cs.IR cs.DB cs.LG 新提交 70%

Structured Prediction for Scalable Spreadsheet Table Understanding: From Cell Types to Table Ranges (Extended Version)

面向可扩展电子表格表格理解的结构化预测:从单元格类型到表格范围(扩展版)

Antoine Gauquier, Ioana Manolescu, Pierre Senellart

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对电子表格理解的单元格类型分类与表格检测任务,提出结合CRF-LightGBM的两阶段流水线,在公开基准StatSheets上实现了与先进模型相当的性能,且计算资源需求更低。

Comments Extended version of a paper published at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16011 2026-08-18 cs.CL cs.CV 新提交 70%

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

ReRef-3D:空间指代表达引导的3D场景重排基准

Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出ReRef-3D基准,针对3D场景语言引导放置任务,经微调的LLaVA-3D等模型在该基准上验证了关系满足度优于物理有效性等结论。

Comments 18 pages, 4 figures. Submitted to ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15888 2026-08-18 cs.AI cs.CR 新提交 70%

Bounded Agents: Delegation Security for Multi-Agent AI Systems

有界智能体:多智能体AI系统的委托安全

Xabier Muruaga

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体AI系统的委托安全问题,提出智能体委托链(APC)架构,经实验可有效阻止提示注入攻击,降低数据窃取、破坏及操纵风险,授权延迟低且效用损失可控。

Comments 14 pages, 4 figures, 18 tables. Code and data: https://github.com/xmuruaga/bounded-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15851 2026-08-18 cs.IR cs.CL 新提交 70%

Dense Expands, Sparse Anchors: Channel-Asymmetric Query Expansion for Hybrid Retrieval

密集扩展,稀疏锚点:用于混合检索的通道非对称查询扩展

Chunran Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出DESA通道非对称查询扩展方法,在7个BEIR数据集上提升检索指标,同时降低访问深度,为生成段落的通道特定整合及检索效果与访问深度的联合评估提供支撑。

Comments 13 pages, 4 figures. Code and artifacts: https://github.com/ln-one/dense-expands-sparse-anchors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15579 2026-08-18 cs.SE cs.AI cs.ET cs.PL 新提交 70%

Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair

Kozuchi智能体:一款与语言无关的开源权重软件修复智能体

Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata, Satoshi Nakashima, Yu Ishikawa, Kosuke Maeda, Nao Soma, Kenichi Kobayashi, Keisuke Miyazaki, Keizo Kato, Shigeki Fukuta, Tatsuo Kumano, Nobutaka Imamura, Kevin Musgrave, Shahbaz Abdul Khader, Kwun Ho Ngan, Joe Townsend, Fayas Asharindavida, Matthieu Parizy, Akira Sakai, Yuma Ichikawa, Yang Zhao, Michiaki Takizawa, Taku Fukui, Hiroki Ohtsuji, Wei-Peng Chen, Hiromichi Kobashi

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Kozuchi智能体,一款与语言无关的开源权重软件修复智能体,结合CI评估流水线,在SWE-bench等基准上取得优异性能,降低操作接触点,为软件修复提供新方案。

Comments 13 pages, 4 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), Industry Showcase track, Munich, Germany, October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15255 2026-08-18 cs.AI 新提交 70%

Towards Standardized Evaluation in Automated Domain Modeling: Introducing a Benchmark

面向自动化领域建模的标准化评估:引入一个基准

Vasiliy Seibert

机构 * Institute for Software and Systems Engineering, TU Clausthal(克劳斯塔尔工业大学软件与系统工程研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对自动化领域建模缺乏标准化基准的问题,引入整合两类数据集的基准,评估多种建模方法,为该领域研究提供可复用的研究成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14841 2026-08-18 cs.AI 新提交 70%

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

重排序器所见:面向长文档多模态问答的多方面页面标注

Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang

机构 * Emory University(埃默里大学) Hippocratic AI(希波克拉底人工智能公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交 70%

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14655 2026-08-18 cs.LG cs.CV 新提交 70%

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

通过模态子空间激活诊断并缓解全模态大语言模型(Omni-LLMs)中的感知-决策失配问题

Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对Omni-LLMs存在的感知-决策失配问题,本文提出因果模态敏感性及对应诊断方法,构建CausalMSBench数据集,提出无需训练的MSA框架以恢复模型的因果模态敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14457 2026-08-17 cs.CL 新提交 70%

Information Satisfaction: A Reader-Centered Axis for Summarization Evaluation

信息满意度:面向读者的摘要评估轴

Isabel Cachola, William Walden, Reno Kriz, Mark Dredze

机构 * St. Edward’s University(圣爱德华大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出以读者的信息满意度作为摘要评估的面向读者的轴,发现主流摘要指标无法衡量该满意度,且与人工判断一致性差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14377 2026-08-17 cs.CL cs.CV 新提交 70%

A Survey of Large Models in Sports

体育领域的大模型综述

Yichen Xu, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。

Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14132 2026-08-17 cs.HC cs.AI 新提交 70%

Act2Intention: A Benchmark For Developing Active Mobile Agents Through Inferring User Intention from GUI Actions

Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准

Xiaokai Yan, Jingtao Ding, Yong Li, Zhiwen Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13565 2026-08-17 cs.AI 新提交 70%

Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking

基于幅值型专家掩码的混合专家模型的深度感知敏感性分析

Pradeep Kumar Sharma, Shantanu Godbole, Hritvik Shrivastava

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过在XLCoST基准上对Qwen3.6-35B-A3B模型的逐层敏感性分析,发现MoE层敏感性具深度依赖性,提出聚焦晚期层的掩码策略,可在保留输出质量的同时减少专家数量,为MoE模型压缩提供了实证基础与实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 70%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 70%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12984 2026-08-14 cs.MA cs.CL 新提交 70%

Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research

一次对账,随时撰写:用于无漂移、时点研究的信任分层图书馆与多智能体撰写器

Xing Zhang, Yanwei Cui, Guanghui Wang, Peiyang He

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出双层智能体系统,通过信任分层图书馆与多智能体撰写器分离知识库与报告撰写,消除报告矛盾与漂移,实验验证其在多指标、多场景下的有效性与效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12895 2026-08-14 cs.AI cs.MA 新提交 70%

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

智能体行为契约II:不假设独立性的组合可靠性验证

Varun Pratap Bhardwaj, Garima Singh, Arun Pratap Bhardwaj

机构 * Qualixar

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体系统组合可靠性的独立性假设开展验证,发现组件共享模型时正相关性会高估冗余度,提出无依赖假设的有限样本验证方法并通过扩充矩函数提升验证效果,配套任意时间有效验证方法。

Comments 49 pages, 12 tables, 25 numbered definitions, 18 theorems with full proofs, six experiments, 65 references. Code, analysis scripts, and preregistration: https://github.com/qualixar/agentassert-abc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12352 2026-08-14 cs.CY cs.AI cs.HC 新提交 70%

Why AI Governance Frameworks Are Hard to Adopt: A Role-Based Stress Test of the NIST AI RMF

为何AI治理框架难以被采用:对NIST AI RMF的基于角色的压力测试

Joseph R. Simons, David A. Broniatowski

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过对NIST AI RMF的基于角色的压力测试,发现AI治理框架的核心问题在于活动能否产生治理价值,角色、部署类型对治理价值有显著影响,仅当治理价值与结构适配性同时满足时才易实现风险降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 70%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏