arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 68 篇

2605.23332 2026-05-25 cs.CL 88%

Cultural Adaptation in Large Language Models for Political Discourse

大型语言模型在政治话语中的文化适应

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨大型语言模型在政治话语分析中的文化适应问题,提出通过翻译、话语和本体层面的形式化框架及评估矩阵,确保跨文化部署的可靠性和民主安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 88%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20087 2026-05-25 cs.CL cs.AI 88%

ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions

ThoughtTrace: 理解真实世界LLM交互中的用户想法

Chuanyang Jin, Binze Li, Haopeng Xie, Cathy Mengying Fang, Tianjian Li, Shayne Longpre, Hongxiang Gu, Maximillian Chen, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学) Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ThoughtTrace,首个大规模数据集,通过配对真实多轮人机对话与用户自述想法(提示原因和对助手回复的反应),揭示用户认知动态,并展示其在行为预测和个性化对齐中的价值。

Comments 53 pages, 23 figures, 4 tables. Project website: https://thoughttrace-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11053 2026-05-25 cs.CR cs.AI cs.LG 88%

Content-Aware Attack Detection in LLM Agent Tool-Call Traffic: An Empirical Study of Features, Architectures, and Evaluation Protocols

LLM Agent工具调用流量中的内容感知攻击检测:特征、架构与评估协议的实证研究

Sultan Zavrak

机构 * Department of Computer Engineering, Duzce University(杜兹大学计算机工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对MCP工具调用流量,提出基于图神经网络的攻击检测框架,通过内容嵌入和任务分离评估协议,实现AUROC超过0.89的检测性能,并揭示随机分割评估导致的高估问题。

Comments v2: renamed manuscript (brand removed; descriptive title). No changes to methodology, results, tables, or figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03070 2026-05-25 eess.SY cs.SE cs.SY 86%

ProOPF: Benchmarking and Improving LLMs for Professional-Grade Power Systems Optimization Modeling

ProOPF: 面向专业级电力系统优化建模的大语言模型基准测试与改进

Chao Shen, Zihan Guo, Xu Wan, Zhenghao Yang, Yifan Zhang, Wengi Huang, Jie Song, Zongyan Zhang, Mingyang Sun

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对电力系统优化建模中自动化翻译自然语言需求为可执行优化模型的问题,本文提出专业级最优潮流数据集ProOPF-D和基准ProOPF-B,用于评估和改进大语言模型在专业级OPF建模中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23712 2026-05-25 cs.CE cs.LG 83%

Operator Learning for Reconstructing Flow Fields from Sparse Measurements: a Language Model Approach

基于稀疏测量重建流场的算子学习:一种语言模型方法

Qian Zhang, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 提出一种利用语言模型架构的无网格算子学习框架,将流场重建转化为序列到序列学习任务,在四个基准数据集上以低于10%的观测数据实现了高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23219 2026-05-25 cs.LG cs.AI 82%

PaP-NF: Probabilistic Long-Term Time Series Forecasting via Prefix-as-Prompt Reprogramming and Normalizing Flows

PaP-NF: 通过前缀作为提示重编程和归一化流进行概率长期时间序列预测

Minju Kim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国Inha大学工业工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PaP-NF框架,利用前缀作为提示机制对齐连续时间序列表示与冻结的大语言模型,并基于归一化流解码器生成概率预测,在长期基准上捕获多模态不确定性并保持点预测精度。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00003 2026-05-25 cs.CL cs.AI cs.IR 82%

Tabular PDF Information Extraction with Local LLMs and Layout-Aware Parsing: A Reliability Evaluation

使用本地大语言模型和布局感知解析的表格PDF信息提取:可靠性评估

Muhammad Anis Al Hilmi, Neelansh Khare, Noel Framil Iglesias, Kurnia Adi Cahyanto, Azhar Al Afghani, Musfi Yuliadi

机构 * Faculty of Engineering, Universitas Swadaya Gunung Jati(工程学院,Swadaya Gunung Jati大学) University of California, Irvine(加州大学伊维奇分校) UNIR, La Rioja(UNIR,拉里奥ja) Universitas Diponegoro(迪波内戈罗大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了三种策略(纯LLM、混合确定性-LLM、基于Camelot的管道)在从学术表格PDF中提取结构化信息时的可靠性,发现混合方法在准确性和效率上表现最佳。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23715 2026-05-25 cs.CL 81%

NLG Evaluation: Past, Present, Future

NLG评估:过去、现在与未来

Ehud Reiter

机构 * Dept of Computing Science University of Aberdeen(计算科学系大学阿伯丁)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文回顾了自然语言生成(NLG)评估从1990年至今的演变,包括LLM-as-Judge等最新方法,并展望了未来影响、质量和安全评估的重要性。

Comments Will appear in Proceeedings of RetroEval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16027 2026-05-25 cs.AI 81%

Deja Vu in Plots: Leveraging Cross-Session Evidence with Retrieval-Augmented LLMs for Live Streaming Risk Assessment

绘图中的既视感:利用检索增强的大语言模型跨会话证据进行直播风险评估

Yiran Qiao, Xiang Ao, Jing Chen, Yang Liu, Qiwei Zhong, Qing He

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CS-VAR框架,通过检索增强的大语言模型指导轻量级模型利用跨会话行为证据,实现高效、可解释的直播风险实时评估。

Comments SIGIR'26 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20088 2026-05-25 cs.CY 80%

Towards an Evaluation Methodology for AI in Second Language Education: Lessons Learned from Developing L2-Bench

面向第二语言教育中人工智能的评估方法论:从开发L2-Bench中汲取的经验教训

James Edgell, Wm. Matthew Kennedy, Isaac Pattis, Ben Knight, Danielle Carvalho, Elizabeth Wonnacott

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种结合教学理论和社会技术评估方法的迭代方法论,用于构建L2-Bench基准,以全面评估AI在第二语言教育中的能力,并通过试点验证展示了其有效性和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03530 2026-05-25 cs.MM cs.CL cs.CV 79%

How Far Are We from Generating Missing Modalities with Foundation Models?

我们距离用基础模型生成缺失模态还有多远?

Guanzhou Ke, Bo Wang, Guoqing Chao, Weiming Hu, Shengfeng He

机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。

Comments T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23052 2026-05-25 cs.CL cs.AI 79%

DreamerNLplus: Interpretable Modeling of Mental Health Dynamics from Social Media Timelines using Hybrid Rule-Based and RAG Methods

DreamerNLplus: 使用混合规则和RAG方法从社交媒体时间线进行可解释的心理健康动态建模

Maryia Zhyrko, Daisy Monika Lal, Erik van Mulligen, Lifeng Han

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿高级计算机科学研究所(LIACS),莱顿大学) School of Computing and Communications (SCC), Lancaster University(计算与通信学院(SCC),兰卡斯特大学) Department of Medical Informatics, Erasmus University Medical Center Rotterdam(医学信息学系,埃因霍温医学中心鲁特万分校) Biomedical Data Sciences, Leiden University Medical Center(生物医学数据科学,莱顿大学医学中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出DreamerNLplus混合框架,结合规则与RAG方法,解决CLPsych 2026共享任务中的心理状态建模、时间变化检测和序列级总结问题。

Comments Accepted by CLPsych2026. CLPsych 2026 will be held at ACL in San Diego July 4th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13249 2026-05-25 q-bio.BM cs.AI cs.LG 79%

A Systematic Evaluation of Co-folding Model Representations for Small-Molecule Learning

小分子学习的共折叠模型表示的系统评估

Hyosoon Jang, Hyunjin Seo, Honghui Kim, Seonghyun Park, Taewon Kim, Yunhui Jang, Sungsoo Ahn

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用现代共折叠模型Boltz2,通过系统探测和蒸馏,评估其原子级配体表示在小分子任务中的表现,发现共折叠表示在ADMET基准上匹配或超越现有模型,加速分子生成建模,并提高结构引导配体优化的样本效率,表明蛋白质-配体共折叠是小分子表示学习的有前景的预训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01018 2026-05-25 cs.CV 78%

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Junzhe Huang, Xiaoxiao Sun, Yan Yang, Yuxuan Hou, Ruotian Zhang, Sirui Li, Hehe Fan, Serena Yeung-Levy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Stanford University(斯坦福大学) The Australian National University(澳大利亚国立大学) Zhejiang University(浙江大学) Murdoch University(莫纳什大学) The University of Adelaide(阿德莱德大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22643 2026-05-25 cs.CL 77%

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

温水煮青蛙:面向智能体安全的多轮基准测试

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon Smith, Luca Nannini, Marcello Galisai, Susanna Cifani, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Daniele Nardi

机构 * Icaro Foundation(Icaro基金会) Sapienza University of Rome(罗马萨皮恩扎大学) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) Tongji University School of Law(同济大学法学院) AIQI Consortium(AIQI联盟) Università Cattolica del Sacro Cuore(圣心大学) Piccadilly Labs(皮卡迪利实验室) VU Amsterdam(阿姆斯特丹伏伊大学) Independent(独立)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出一个多轮基准测试,评估工具使用AI模型在办公场景中对渐进式攻击的脆弱性,发现平均攻击成功率为44.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02443 2026-05-25 cs.CL 77%

HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs

HalluScan:一个用于检测和缓解指令遵循型大语言模型幻觉的系统性基准

Ahmed Cherif

机构 * Sofrecom Tunisia(Sofrecom突尼斯) Orange Innovation(Orange创新)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出HalluScan基准框架,通过HalluScore复合指标、自适应检测路由(ADR)和系统错误级联分解,在6种检测方法、4个模型家族和3个领域上评估幻觉检测与缓解,发现NLI验证AUROC最高(0.88),RAV次之(0.66)。

Comments 38 pages, 13 figures, 10 tables. Submitted to Neural Computing and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23157 2026-05-25 cs.CL 77%

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面

Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

机构 * Appen(Appliance)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14027 2026-05-25 cs.CL 77%

SemEval-2026 Task 6: CLARITY -- Unmasking Political Question Evasions

SemEval-2026 任务 6:CLARITY——揭露政治问题回避

Konstantinos Thomas, Giorgos Filandrianos, Maria Lymperaiou, Chrysoula Zerva, Giorgos Stamou

机构 * National Technical University of Athens(希腊国家技术大学) Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学电信理工学院) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出 SemEval-2026 共享任务 CLARITY,通过两级分类(清晰度与回避策略)构建政治访谈回答回避基准,实验表明大语言模型提示和层级分类策略最有效。

Comments SemEval 2026 (Task organizers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08945 2026-05-25 cs.AI 77%

FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation

FATHOMS-RAG:评估使用检索增强生成的多模态系统思考与观察的框架

Samuel Hildebrand, Curtis Taylor, Sean Oesch, James M Ghawaly, Amir Sadovnik, Ryan Shivers, Brandon Schreiber, Kevin Kurian

机构 * Louisiana State University(路易斯安那州立大学) Oak Ridge National Lab(橡树岭国家实验室) University of Florida(佛罗里达大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 提出一个评估RAG管道的基准,包含93个多模态问题、短语级召回率指标、最近邻嵌入分类器,并对比开源与闭源管道性能,发现闭源管道在正确性和幻觉指标上显著优于开源。

Comments Accepted at SAFE-ML 2026 Workshop at the International Conference on Software Testing (ICST) 2026 Code: https://github.com/Sam-Hildebrand/FATHOMS-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19069 2026-05-25 cs.CL cs.AI 73%

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语

Sajjad Abdoli, Ghassan Al-Sumaidaee, Clayton W. Taylor, Ahmad ElShiekh, Ahmed Rashad

机构 * Perle AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对四种语言对的代码切换语音,通过两阶段管道选择样本并评估五个商业ASR系统,发现WER夸大质量差距而BERTScore更准确,ElevenLabs Scribe v2表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22993 2026-05-25 cs.CL cs.AI 73%

A Proactive Multi-Agent Dialogue Framework for Assessing Social Language Disorder Traits in Autism

一种主动式多智能体对话框架用于评估自闭症中的社交语言障碍特征

Chuanbo Hu, Minglei Yin, Bin Liu, Wenqi Li, Lynn K. Paul, Shuo Wang, Xin Li

机构 * Department of Computer Science(计算机科学系) University at Albany(阿尔巴尼大学) Department of Management Information System(管理信息系统系) West Virginia University(西弗吉尼亚大学) Department of Radiology(放射学系) Washington University in St. Louis(圣路易斯华盛顿大学) Humanities and Social Sciences(人文学与社会科学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TPA(思考、计划、询问)主动式多智能体对话框架,通过临床策略驱动的提问选择,在ADOS-2评估中实现82.1%的社交语言障碍特征覆盖率,比临床医生自动回放高16.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20896 2026-05-25 cs.CR cs.AI cs.LG 73%

GenAI-Driven Threat Detection with Microsoft Security Copilot

GenAI驱动的威胁检测与Microsoft Security Copilot

Scott Freitas, Amir Gharib

机构 * Microsoft Security Research(微软安全研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出动态威胁检测代理(DTDA),结合统一活动时间线、版本化LLM提示合同、规划器-执行器调查循环和动态告警生成,在Microsoft Security Copilot中实现持续、可解释的威胁检测,在线评估精确率80.1%,离线F1分数0.78。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19000 2026-05-25 cs.LG cs.AI 73%

Decompose, Structure, and Repair: A Neuro-Symbolic Framework for Autoformalization via Operator Trees

分解、结构化与修复:基于操作树的神经符号自动形式化框架

Xiaoyang Liu, Zineng Dong, Yifan Bai, Yantao Li, Yuntian Liu, Tao Luo

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) Institute of Natural Sciences, MOE-LSC, CMA-Shanghai, Shanghai Jiao Tong University(上海交通大学自然科学研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DSR神经符号框架,通过将数学语句分解为逻辑组件并映射为结构化操作树,利用子树精炼定位和修复错误,在PRIME基准上达到新最优。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23535 2026-05-25 cs.HC 71%

MindCopilot: Towards Formalizing and Evaluating Granular Human-LLM Co-Writing

MindCopilot: 迈向细粒度人机协作写作的形式化与评估

Youqing Fang, Yinhao Tang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao, Bin Liu, Weiming Zhang, Kuikun Liu, Wenwei Zhang, Kai Chen

专题命中 评测与基准 :LLM(title)

AI总结 针对现有主动式写作助手评估仅关注输出质量而忽略用户交互行为的问题,提出基于人类参与马尔可夫决策过程的协作写作形式化模型,并设计交互感知评估套件(Co-Writing Fidelity Suite),通过大规模模拟和用户研究验证其有效性。

Comments 30 pages, 8 figures. Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23628 2026-05-25 cs.LG 70%

How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness

操纵基准测试有多难?排行榜鲁棒性的社会选择分析

Polina Gordienko, Georg Schollmeyer, Frauke Kreuter, Christoph Jansen

机构 * Department of Statistics, LMU Munich(慕尼黑大学统计系) Social Data Science Center, University of Maryland(马里兰大学社会数据科学中心) School of Computing & Communications, Lancaster University Leipzig(莱比锡兰卡斯特大学计算与通信学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过社会选择理论中的移位贿赂问题,将基准特定训练建模为选举操纵,证明在Borda计数和平均胜率下该问题是NP难的,并引入实例级鲁棒性度量,实验表明平均胜率最难操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23459 2026-05-25 cs.SE cs.AI 70%

AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems

AI 保证:企业 AI 系统的综合测试策略

Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

机构 * Thoughtworks Technologies(Thoughtworks技术公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对基于大语言模型、检索管道和自主代理的企业 AI 系统,提出了一种以持续风险降低为核心、将评估作为核心工程学科、并关注组织影响的综合保证策略,包括结构化的 AI 故障分类法、五层 AI 保证金字塔以及评估驱动开发、RAG 系统测试、模型生命周期管理和治理的操作指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23325 2026-05-25 cs.CL 70%

AraHopeCorpus: Annotation Guidelines and Dataset for Hope Speech in Arabic Social Media Crisis Discourse

AraHopeCorpus:阿拉伯语社交媒体危机话语中的希望言语标注指南与数据集

Esra'a Sharqawi, Wajdi Zaghouani

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍首个阿拉伯语希望言语数据集AraHopeCorpus,基于2023-2024年加沙战争相关YouTube评论,通过详细标注框架分类为希望言语、无希望言语和中性/模糊话语,发现希望言语占主导(64%以上),并分析了标注挑战与大型语言模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI 70%

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23262 2026-05-25 cs.AI 70%

Design and Report Benchmarks for Knowledge Work

知识工作的设计与报告基准

Yining Hua, Hongbin Na, Cyrus Ayubcha, Levi Lian

机构 * Harvard University(哈佛大学) University of Technology Sydney(悉尼科技大学) Stanford University(斯坦福大学) Raycaster AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对当前知识工作评估基准与真实部署脱节的问题,提出三步法(定义工作活动、指定测试设置、评分工作产品)来明确基准任务与工作主张的对应关系,并通过三个案例分析展示设计选择如何影响可支持的工作主张。

详情

展开后加载摘要…

URL PDF HTML 收藏