arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 121 篇

2604.21534 2026-05-28 cs.CL 84%

UKP_Psycontrol at SemEval-2026 Task 2: Modeling Valence and Arousal Dynamics from Text

UKP_Psycontrol 在 SemEval-2026 任务 2:从文本建模效价和唤醒动态

Darya Hryhoryeva, Amaia Zurinaga, Hamidreza Jamalabadi, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(无所不在的知识处理实验室) Technical University of Darmstadt(达姆斯塔特技术大学) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Psychiatric Control Systems Lab(精神病控制系统实验室) Marburg University(马尔堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 针对 SemEval-2026 任务 2,提出三种互补方法(LLM 提示、成对最大熵模型、轻量级神经回归模型)建模文本中的即时情感和短期情感变化,发现 LLM 擅长捕捉静态情感信号,而短期变化更依赖于数值轨迹,系统在子任务 1 和 2A 中排名第一。

Comments Accepted to SemEval 2026 (co-located with ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12154 2026-05-28 cs.CL 84%

Analyzing Cancer Patients' Experiences with Embedding-based Topic Modeling and LLMs

基于嵌入的主题建模和LLM分析癌症患者的体验

Teodor-Călin Ionescu, Lifeng Han, Jan Heijdra Suasnabar, Anne Stiggelbout, Suzan Verberne

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS),莱顿,荷兰) Leiden University Medical Center (LUMC), Leiden, The Netherlands(莱顿大学医学中心(LUMC),莱顿,荷兰)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本研究利用BERTopic和Top2Vec等神经主题建模方法,结合LLM(GPT4)进行主题标注,从癌症患者访谈数据中提取有意义主题,并评估不同嵌入模型的效果,发现领域特定的BioClinicalBERT嵌入能提高主题精度和可解释性。

Comments accepted by the CLIN journal. The CLIN Journal is the journal for research in computational linguistics in The Netherlands and Belgium

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06329 2026-05-28 cs.CL cs.AI 84%

On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation

论口语语言模型评估中全局令牌困惑度的谬误

Chan-Jan Hsu, Liang-Hsuan Tseng, Yi-Cheng Lin, Yen-Chun Kuo, Ju-Chieh Chou, Kai-Wei Chang, Hung-yi Lee, Carlos Busso

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 针对口语语言模型评估中直接使用文本困惑度公式计算语音令牌困惑度的问题,提出基于似然和生成的新型评估方法,更忠实反映生成质量,并缩小了最佳模型与人类基线之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27796 2026-05-28 eess.IV cs.CV cs.LG eess.SP stat.AP 83%

Benchmarking Ultrasound Foundation Models for Fetal Plane Classification

超声基础模型在胎儿平面分类中的基准测试

Leya Barrientos, Yuexi Du, Nicha C. Dvornek

机构 * 1 Radiology \& Biomedical Imaging, Yale School of Medicine, USA 2 Department of Biomedical Engineering, Yale University, USA

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究对四种超声基础模型(USFM、MOFO、UltraSAM、FetalCLIP)在胎儿平面分类任务上进行基准测试,发现FetalCLIP在线性探测设置中表现最佳,而USFM在全微调设置中表现最佳,且预训练目标显著影响迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28602 2026-05-28 cs.AI cs.CL cs.LO 82%

Satisfiability Solving with LLMs: A Matched-Pair Evaluation of Reasoning Capability

用大语言模型求解可满足性问题:推理能力的配对评估

Leizhen Zhang, Shuhan Chen, Sheng Chen

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出配对公式协议和准确区分率(ADR)来评估大语言模型在SAT问题上的推理能力,发现传统指标具有误导性,而ADR能更忠实、跨表示鲁棒地评估模型。

Comments Accepted at the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-05-28 cs.AI cs.DC cs.LG cs.SI q-fin.CP 82%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21075 2026-05-28 cs.AI cs.CL cs.LG 82%

Apple Intelligence Foundation Language Models

Apple Intelligence 基础语言模型

Tom Gunter, Zirui Wang, Chong Wang, Ruoming Pang, Andy Narayanan, Aonan Zhang, Bowen Zhang, Chen Chen, Chung-Cheng Chiu, David Qiu, Deepak Gopinath, Dian Ang Yap, Dong Yin, Feng Nan, Floris Weers, Guoli Yin, Haoshuo Huang, Jianyu Wang, Jiarui Lu, John Peebles, Ke Ye, Mark Lee, Nan Du, Qibin Chen, Quentin Keunebroek, Sam Wiseman, Syd Evans, Tao Lei, Vivek Rathod, Xiang Kong, Xianzhi Du, Yanghao Li, Yongqiang Wang, Yuan Gao, Zaid Ahmed, Zhaoyang Xu, Zhiyun Lu, Al Rashid, Albin Madappally Jose, Alec Doane, Alfredo Bencomo, Allison Vanderby, Andrew Hansen, Ankur Jain, Anupama Mann Anupama, Areeba Kamal, Bugu Wu, Carolina Brum, Charlie Maalouf, Chinguun Erdenebileg, Chris Dulhanty, Daniel Parilla, Dominik Moritz, Doug Kang, Eduardo Jimenez, Evan Ladd, Fangping Shi, Felix Bai, Frank Chu, Fred Hohman, Hadas Kotek, Hannah Gillis Coleman, Jane Li, Jeffrey Bigham, Jeffery Cao, Jeff Lai, Jessica Cheung, Jiulong Shan, Joe Zhou, John Li, Jun Qin, Karanjeet Singh, Karla Vega, Kelvin Zou, Laura Heckman, Lauren Gardiner, Margit Bowler, Maria Cordell, Meng Cao, Nicole Hay, Nilesh Shahdadpuri, Otto Godwin, Pranay Dighe, Pushyami Rachapudi, Ramsey Tantawi, Roman Frigg, Sam Davarnia, Sanskruti Shah, Saptarshi Guha, Sasha Sirovica, Shen Ma, Shuang Ma, Simon Wang, Sulgi Kim, Suma Jayaram, Vaishaal Shankar, Varsha Paidi, Vivek Kumar, Xin Wang, Xin Zheng, Walker Cheng, Yael Shrager, Yang Ye, Yasu Tanaka, Yihao Guo, Yunsong Meng, Zhao Tang Luo, Zhi Ouyang, Alp Aygar, Alvin Wan, Andrew Walkingshaw, Andy Narayanan, Antonie Lin, Arsalan Farooq, Brent Ramerth, Colorado Reed, Chris Bartels, Chris Chaney, David Riazati, Eric Liang Yang, Erin Feldman, Gabriel Hochstrasser, Guillaume Seguin, Irina Belousova, Joris Pelemans, Karen Yang, Keivan Alizadeh Vahid, Liangliang Cao, Mahyar Najibi, Marco Zuliani, Max Horton, Minsik Cho, Nikhil Bhendawade, Patrick Dong, Piotr Maj, Pulkit Agrawal, Qi Shan, Qichen Fu, Regan Poston, Sam Xu, Shuangning Liu, Sushma Rao, Tashweena Heeramun, Thomas Merth, Uday Rayala, Victor Cui, Vivek Rangarajan Sridhar, Wencong Zhang, Wenqi Zhang, Wentao Wu, Xingyu Zhou, Xinwen Liu, Yang Zhao, Yin Xia, Zhile Ren, Zhongzheng Ren

机构 * Apple(苹果公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文介绍了为 Apple Intelligence 功能开发的基础语言模型,包括一个约30亿参数的设备端高效运行模型和一个用于私有云计算的服务器端大模型,并描述了其架构、训练数据、优化过程和评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28315 2026-05-28 cs.CL 81%

HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains

HardMTBench:知识密集型领域的中英翻译压力测试

Zheng Li, Mao Zheng, Mingyang Song, Tianxiang Fei

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有中英翻译基准饱和问题,提出HardMTBench,一种难度感知的诊断基准,通过多阶段构建和难度融合规则,在12个知识密集型领域上显著扩大系统性能差异并暴露术语和知识弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28218 2026-05-28 cs.CL 81%

IFMTBench: A Comprehensive Benchmark for Multilingual Translation Instruction Following

IFMTBench:多语言翻译指令遵循的综合基准

Mingrui Sun, Mao Zheng, Zheng Li, Mingyang Song

机构 * Large Language Model Department, Tencent(腾讯大语言模型部)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出IFMTBench基准,涵盖7种语言、4506个单约束和2838个多约束项,通过确定性检查器和基于LLM的评分器评估翻译指令遵循能力,揭示指令遵循随模型规模增长快于翻译质量,且术语表和结构化格式约束难度最高。

Comments 11 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28190 2026-05-28 cs.CL 81%

The Harder Text Embedding Benchmark (HTEB): Beyond One-dimensional Static Robustness

更难文本嵌入基准(HTEB):超越一维静态鲁棒性

Manuel Frank, Haithem Afli

机构 * Department of Computer Science Munster Technological University(计算机科学系穆斯特技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出HTEB动态评估框架,通过LLM随机变换输入,从词汇/风格、长度和语言三个维度挑战文本嵌入模型的鲁棒性,发现模型具有特定且部分解耦的鲁棒性轮廓,规模提升绝对分数但未缩小原始与变换评估差距,且英语数据集对变换更敏感。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28158 2026-05-28 cs.AI 81%

OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents

OR-Space:面向工业优化智能体的全生命周期工作空间基准

Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai University of Finance and Economics(上海财经大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OR-Space基准,通过构建、修订和解释三种任务模式,评估大语言模型智能体在工业优化工作流中的可靠性。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28020 2026-05-28 cs.CL 81%

The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

预训练模型评估中缺失的一环:奖励引导解码无需参数更新即可解锁任务导向行为

Shaobo Wang, Guo Chen, Ziyue Wang, Zhengyang Tang, Qingyang Liu, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里云Qwen团队) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)

AI总结 提出一种无需训练的奖励引导解码框架EBD,通过外部轻量奖励模型调整输出分布,激活冻结预训练模型的任务导向行为,实现更公平的推理时评估。

Comments 26 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27911 2026-05-28 cs.AI 81%

SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats

SuiChat-CN:中文群聊情境自杀风险评估基准

Xiangyu Wang, Zhiwei Yu, Chengze Du, Dingchang Wang, Yuhan Ye, Fangyu Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对即时通讯群聊中消息碎片化、多轮对话和隐晦表达带来的挑战,构建了首个中文群聊情境自杀风险评估基准SuiChat-CN,通过信号词提取和双向上下文扩展构建连贯对话片段,并利用专家验证的LLM辅助范式标注用户风险等级,实验表明上下文信息对可靠评估至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27845 2026-05-28 cs.SI cs.AI physics.soc-ph 81%

Snippet-Driven Supply Chain Discovery with LLMs: Scaling Visibility in China

基于片段的供应链发现:利用LLMs在中国实现规模化可见性

Hiroto Fukada, Takayuki Mizuno

机构 * Graduate Institute for Advanced Studies (SOKENDAI)(研究生高级研究学院(SOKENDAI)) National Institute of Informatics(国家信息研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于网络搜索片段的方法,利用大语言模型构建供应链知识图谱,以低成本扩展对中国企业间关系的覆盖范围。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27671 2026-05-28 stat.ML cs.LG 81%

Evolving and Detecting Multi-Turn Deception using Geometric Signatures

使用几何特征演化与检测多轮欺骗

Surender Suresh Kumar, Mary L. Cummings

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出多目标遗传优化生成多轮欺骗问题集,并利用嵌入空间中的简单几何特征(角覆盖、距离比、线性度)结合轻量级分类器实现高召回率(0.89)的欺骗检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27485 2026-05-28 cs.LO cs.LG cs.SE 81%

Automating Formal Verification with Agent-Guided Tree Search

利用智能体引导的树搜索自动化形式验证

Leo Yao

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。

Comments 78 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27445 2026-05-28 cs.IR cs.AI 81%

RAGe: A Retrieval-Augmented Generation Evaluation Framework

RAGe:一种检索增强生成评估框架

Larissa Guder, João Pedro de Moura, Arthur Accorsi, Gustavo Losch do Amaral, Maurício Cecílio Magnaguagno, Felipe Meneguzzi, Marcio Sorraglia Pinho, Dalvan Griebler

机构 * School of Technology, Pontifical Catholic University of Rio Grande do Sul(里约格兰德杜斯-萨尔大学技术学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出模块化框架RAGe,通过资源遥测和组件推荐,评估检索增强生成应用在准确性、效率和可扩展性之间的权衡,支持领域特定数据集的最佳组件选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05291 2026-05-28 cs.CL 81%

Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages

Camellia: 亚洲语言中LLMs文化偏见的基准测试

Tarek Naous, Anagha Savit, Carlos Rafael Catalan, Geyang Guo, Jaehyeok Lee, Kyungdon Lee, Lheane Marie Dizon, Mengyu Ye, Neel Kothari, Sahajpreet Singh, Sarah Masud, Tanish Patwa, Trung Thanh Tran, Zohaib Khan, Alan Ritter, Tanmoy Chakraborty, Yuki Arase, Keisuke Sakaguchi, JinYeong Bak, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Samsung R&D Institute Philippines(三星菲律宾研发院) Sungkyunkwan University(成均馆大学) Tohoku University(东北大学) National University of Singapore(新加坡国立大学) University of Copenhagen(哥本哈根大学) University of Michigan(密歇根大学) Indian Institute of Technology Delhi(印度理工学院德里) Institute of Science Tokyo(东京科学研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Camellia基准,通过三个任务评估九种亚洲语言中多语言大模型对亚洲与西方文化实体的偏见,发现模型存在文化适应困难、情感关联差异及实体提取性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26910 2026-05-28 cs.LG cs.AI q-bio.NC 81%

EEG-FM-Audit: A Systematic Evaluation and Analysis Pipeline for EEG Foundation Models

EEG-FM-Audit:脑电图基础模型的系统评估与分析流程

Xianheng Wang, Yige Yang, Damien Coyle

机构 * Bath Institute for the Augmented Human(巴思增强人类研究所) University of Bath(巴斯大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出EEG-FM-Audit流程,通过ASHA驱动的基准测试、范式级消融研究和神经生理探测,系统评估脑电图基础模型,发现调优的监督基线可媲美或超越先进基础模型。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27750 2026-05-28 cs.CL cs.AI cs.CV cs.DL 81%

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

阅读还是猜测?古希腊版本OCR中视觉语言模型的视觉定位失败

Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

机构 * Inria(法国国家信息与自动化研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过对比开放权重视觉语言模型与传统OCR基线在低资源古希腊批判版本上的表现,发现VLM即使错误也能生成流畅文本,表明其依赖语言先验,并引入扰动和标记级定位度量分析视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15791 2026-05-28 cs.CY cs.AI cs.CL 81%

Evaluation of AI Ethics Tools in Language Models: A Developers' Perspective Case Study

语言模型中AI伦理工具评估:开发者视角案例研究

Jhessica Silva, Diego A. B. Moreira, Gabriel O. dos Santos, Alef Ferreira, Helena Maia, Sandra Avila, Helio Pedrini

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过文献筛选和开发者访谈,评估四种AI伦理工具在葡萄牙语语言模型中的应用效果,发现它们能指导一般伦理考虑但未覆盖模型特有方面。

Comments 7 figures, 11 tables. Accepted for publication in AI and Ethics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28146 2026-05-28 cs.CR 80%

Cybersecurity AI (CAI) Dataset

网络安全AI(CAI)数据集

Víctor Mayoral-Vilches

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出CAI数据集,一个包含十四个月网络安全LLM轨迹的大规模语料库,旨在解决专家操作轨迹是LLM性能瓶颈的问题,并揭示了集中化API提供商带来的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26368 2026-05-28 cs.CV cs.AI 79%

Unified Panoramic Geometry Estimation via Multi-View Foundation Models

统一全景几何估计:基于多视角基础模型

Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis Rozumny, Konrad Schindler, Nikolai Kalischek

机构 * ETH Zürich(苏黎世联邦理工学院) Google(谷歌)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 提出PaGeR框架,利用预训练3D基础模型,从单张全景图像中统一预测尺度不变深度、度量深度、表面法线和天空掩码,实现360度场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27851 2026-05-28 cs.AI 79%

When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models

当上下文翻转,安全失效:诊断对齐语言模型中的脆弱安全性

Dasol Choi, Alex Kwon

机构 * AIM Intelligence(AIM智能)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出上下文翻转评估方法,通过安全基准和常识控制测试12个模型,发现对齐语言模型存在安全特异性脆弱性,源于策略覆盖而非理解错误,并证明动作级护栏无法检测后果翻转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04823 2026-05-28 cs.CL 79%

Evaluating the Generation Capabilities of Large Chinese Language Models

评估大型中文语言模型的生成能力

Hui Zeng, Jingyuan Xue, Meng Hao, Chen Sun, Bin Ning, Na Zhang

机构 * AI Research Center, Besteasy Language Technology Co., Ltd(最佳语言技术有限公司人工智能研究中心) LanguageX AI Lab(LanguageX人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出CG-Eval自动评估框架和Gscore复合指标,用于多学科领域评估大型中文语言模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28025 2026-05-28 cs.AI cs.CL cs.CY 79%

MIRA: A Bilingual Benchmark for Medical Information Response Audit

MIRA: 医学信息响应审计的双语基准

Mengyu Xu, Qiaoxin Yang, Qianqian Wang, Xiwei Dai, Weiyi Wu, Chongyang Gao

机构 * The University of Chicago(芝加哥大学) SynAI Technologies Inc.(SynAI技术公司) Jinzhou Medical University(锦州医学院) Zhejiang University(浙江大学) Dartmouth College(达特茅斯学院) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MIRA双语基准,通过4,320个提示评估大语言模型在不同用户表达下提供医学信息的一致性,发现低健康素养提示导致信息稀释(DID),并提出知识引导缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27466 2026-05-28 cs.MA cs.AI cs.LG stat.ML 79%

AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems

AgensFlow:多智能体系统的协调策略基础

Nicole Koenigstein

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AgensFlow框架,将多智能体协调视为在线策略学习问题,通过可学习路由优化协调流程,在分布式系统事件和安全咨询任务上验证了其优于固定管道基线。

Comments 7 pages, 4 figures, 4 tables. Code and reproducible evaluations available at: https://github.com/Nicolepcx/AgensFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28609 2026-05-28 cs.CV 78%

JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models

JECA^2: 面向取证视觉语言模型的判断-解释一致对抗攻击

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对取证视觉语言模型,提出一种白盒对抗攻击方法JECA^2,通过Grad-CAM引导的视觉扰动和令牌邻近约束的文本嵌入优化,实现判断与解释的一致性,实验表明攻击成功率和一致性优于基线。

Comments 37 pages, 6 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11011 2026-05-28 cs.CV 78%

Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?

大型预训练视觉语言模型能否成为有效的施工安全检查员?

Xuezheng Chen, Zhengbo Zou

机构 * Mechanical Engineering(机械工程)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出ConstructionSite 10k数据集,包含1万张施工图像及三项任务标注,评估大型预训练视觉语言模型在零样本和小样本下的泛化能力,为施工安全检查提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27879 2026-05-28 cs.AI 77%

Towards Faithful Agentic XAI: A Verification Method and an Open-World Benchmark for Better Model Faithfulness

迈向忠实代理式XAI:一种验证方法和一个用于更好模型忠实度的开放世界基准

Jaechang Kim, Sunung Mun, Seungjoon Lee, Jaewoong Cho, Jungseul Ok

机构 * Graduate School of AI, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Krafton

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FAX框架,通过显式验证分解解释声明并交叉检查忠实工具,以及CRAFTER-XAI-Bench开放世界基准,在强化学习环境中将模拟忠实度从0.20提升至0.46。

详情

展开后加载摘要…

URL PDF HTML 收藏