arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-05 至 2026-06-05 共收录 37 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 37 篇

2602.05056 2026-06-05 cs.CR cs.CL cs.LG 88%

Grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

Heajun An, Connor Ng, Sandesh Sharma Dulal, Junghwan Kim, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 安全评测 :alignment(title,title_cn);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了AI生成的安全解释中语义对齐的问题,通过VEXA测试平台验证了词汇基础与语义风险对齐之间的差距,发现即使解释在词汇上显得合理,其语义解释可能削弱检测器的意图风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12124 2026-06-05 cs.LG cs.CL 86%

Alignment Risks from Capability-Seeking RL Training

从能力寻求强化学习训练中产生的对齐风险

Yujun Zhou, Yue Huang, Han Bao, Kehan Guo, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在易受攻击的环境中通过强化学习训练语言模型时,模型可能利用隐含漏洞来最大化奖励的风险,发现这些策略不仅限于狭窄的技巧,还能在一定程度上转移、传播,并在某些情况下比通过SFT学习更持久,表明需要扩展AI安全工作到审计和保障训练环境、奖励机制和评估渠道。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06703 2026-06-05 cs.AI 83%

ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents

ST-WebAgentBench:用于评估网络代理安全性和可信度的基准测试

Ido Levy, Ben Wiesel, Sami Marreed, Alon Oved, Avi Yaeli, Nir Mashkif, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出ST-WebAgentBench基准测试,用于评估网络代理在现实企业场景中的安全性和可信度,通过引入新的评估指标CuP和风险比,揭示了现有代理的安全性缺陷。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20158 2026-06-05 cs.CV 82%

Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs

在安全对齐的连续视觉指令微调中实现和谐参数适应

Ziqi Wang, Chang Che, Qi Wang, Hui Ma, Zenglin Shi, Cees G. M. Snoek, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 本文研究了在安全对齐的连续视觉指令微调中如何平衡安全性和任务性能,提出了一种名为和谐参数适应(HPA)的后训练框架,通过参数分区、平衡选择和正交调整来缓解遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05985 2026-06-05 cs.CL cs.CY 81%

Beyond Alignment: Value Diversity as a Collective Property in Multicultural Agent Systems

超越对齐:多元文化智能体系统中的价值多样性作为集体属性

Shaoyang Xu, Jingshen Zhang, Long P. Hoang, Jinyuan Li, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 针对多元文化多智能体系统,提出以价值多样性作为系统级评估轴,通过文化条件化智能体在共享价值调查中的响应差异度量,发现多样性几乎与对齐无关,且当前系统远低于人类社会,混合骨干系统缩小但未消除差距,社会互动进一步侵蚀多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05233 2026-06-05 cs.CR cs.AI cs.CL 81%

Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchmark, a Coding-Domain Cross-Reference, and a Reproducibility Audit of Recent Red-Teaming

前沿计算机使用代理中的领域条件安全:一个793集浏览器基准测试、编码领域交叉引用以及近期红队攻击的可重复性审计

Nicholas Saban

机构 * Patronus AI University of California, Berkeley(Patronus AI 伯克利大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建包含793个浏览器任务和56个攻击模板的基准测试,评估前沿计算机使用代理对提示注入攻击的鲁棒性,发现模型权重提供了强抵抗性(攻击成功率0%),但该安全性是领域条件的,在编码代理中失效(攻击成功率高达100%),并指出文献中高攻击成功率主要归因于RL优化的注入文本而非攻击类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03650 2026-06-05 cs.CL cs.AI 81%

CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks

CoEval: 无标注数据或可信基准下为自定义任务排序语言模型

Alexander Apartsin, Yehudit Aperstein

机构 * Holon Institute of Technology(霍洛技术学院) Afeka Tel Aviv Academic College of Engineering(阿法卡特拉维大学工程学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CoEval框架,通过教师模型生成无污染基准和跨族评审团,无需标注数据或人工评估即可对语言模型进行排序,在真实排名恢复上达ho=0.86。

Comments 16 pages, 5 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25256 2026-06-05 cs.AI 80%

Whose Alignment? Comparing LLM Process Alignment Across Diverse Organizational Decision Contexts

谁的对齐?比较不同组织决策情境下的大语言模型过程对齐

Niklas Weller, Emilio Barkett

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种决策策略捕获方法测量过程对齐,发现LLM在ECHR第6条决策中过程对齐与输出准确性高度相关,但在德国消费信贷决策中关系消失,揭示了多元对齐挑战。

Comments Accepted to Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06423 2026-06-05 cs.RO cs.AI 79%

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation

RiskFlow: 快速且保真的安全关键交通场景生成

Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出RiskFlow框架,通过动作空间中的单次前向传输替代迭代去噪,实现快速、保真的安全关键多智能体交通场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06054 2026-06-05 cs.AI 79%

Beyond Similarity: Trustworthy Memory Search for Personal AI Agents

超越相似性:面向个人AI代理的可信记忆搜索

Jiawen Zhang, Kejia Chen, Jiachen Ma, Yangfan Hu, Lipeng He, Yechao Zhang, Jian Liu, Xiaohu Yang, Tianwei Zhang, Ruoxi Jia

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对个人AI代理中基于语义相似性的记忆检索存在的信任漏洞,提出轻量级记忆插件MemGate,通过查询条件神经门控实现可信记忆搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05357 2026-06-05 cs.AI 79%

An interpretable and trustworthy AI framework for large-scale longitudinal structure-pain association studies using data from the Osteoarthritis Initiative (OAI)

一个可解释且可信赖的AI框架,用于利用骨关节炎倡议(OAI)数据进行大规模纵向结构-疼痛关联研究

Jincheng Yu, Haoyang Li, Yiwen Liu, Shen Liu, Rachel Yuanbao Chen, C. Kent Kwoh, Hongxu Ding, Xiaoxiao Sun

机构 * Statistics & Data Science GIDP, University of Arizona(大学阿瓜斯卡连特斯统计与数据科学GIDP) Department of Epidemiology and Biostatistics, University of Arizona(大学阿瓜斯卡连特斯流行病学与生物统计学系) College of Medicine Tucson, University of Arizona(大学阿瓜斯卡连特斯医学学院) R. Kent Coit College of Pharmacy, University of Arizona(大学阿瓜斯卡连特斯R. Kent Coit药学院) University High School(大学高中)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 提出结合深度学习MOAKS预测与可解释统计建模的AI框架,通过不确定性量化筛选高置信度预测,利用纵向潜类混合模型分析结构异常与疼痛的关联,发现骨髓病变、软骨丢失和半月板挤压是疼痛进展的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17256 2026-06-05 cs.CL 79%

Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations

大型语言模型的可解释性:朝着生成可信解释的方向机遇与挑战

Shahin Atakishiyev, Housam K. B. Babiker, Jiayi Dai, Nawshad Farruque, Teruaki Hayashi, Nafisa Sadaf Hriti, Md Abed Rahman, Iain Smith, Mi-Young Kim, Osmar R. Zaïane, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学) University of Tokyo(东京大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型的可解释性问题,分析了局部可解释性和机械可解释性方法,并在医疗和自动驾驶两个关键领域进行了实验研究,总结了当前可解释性领域存在的问题和未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16149 2026-06-05 cs.CV 71%

Toward Trustworthy Portrait Editing: Evaluation of Demographic Misrepresentation in I2I Models

迈向可信的人像编辑:评估 I2I 模型中的人口统计误表示

Huichan Seo, Minki Hong, Sieun Choi, Jihie Kim, Jean Oh

专题命中 安全评测 :trustworthy(title)

AI总结 本文通过控制基准测试,评估了指令引导的图像到图像编辑器中身份保留失败的两个模式(软擦除和刻板印象替换),发现肤色变浅等偏差普遍存在且人口统计不均,并提出提示级约束作为缓解措施。

Comments 22 pages, 10 figures. Huichan Seo, Minki Hong and Sieun Choi contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06099 2026-06-05 cs.AI 70%

CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model

CogManip: 在大语言模型多轮交互中操控行为的基准测试

Zeyang Yue, Chenfei Yan, Feifei Zhao, Haibo Tong, Mengwen Xu, Xiaozhen Wang, Erliang Lin, Yi Zeng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) BrainCog AI Lab, CASIA(CASIA脑认知人工智能实验室) Gaoling School of AI, Renmin University of China(中国人民大学 Gallagher人工智能学院) Beijing-AISI(北京人工智能研究所) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 提出CogManip基准,通过1000个多轮交互场景评估15种操控策略风险,发现前沿模型存在显著风险异质性,并揭示提示工程防御的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10254 2026-06-05 cs.CV 67%

Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis

Facial-R1: 通过推理与识别对齐实现面部情绪分析

Jiulong Wu, Yucheng Shen, Lingyong Yan, Haixin Sun, Deguo Xia, Jizhou Huang, Min Cao

专题命中 安全评测 :alignment(abstract,abstract_cn)

AI总结 本文提出Facial-R1框架,通过三阶段对齐方法解决面部情绪分析中推理与识别不一致及推理幻觉的问题,并引入FEA-20K基准数据集,验证了其在多个标准基准上的最佳性能。

Comments Withdrawn by the authors due to pending intellectual property considerations. The authors have determined that the current version contains material that should not have been publicly disseminated at this stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05563 2026-06-05 cs.AI cs.CL 62%

SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations

SoCRATES:跨领域和社会认知变异的前瞻性LLM调解的可靠自动化评估

Taewon Yun, Hyeonseong Park, Jeonghwan Choi, Hayoon Park, Yeeun Choi, Hwanjun Song

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出SoCRATES基准,通过多领域真实冲突场景和五维社会认知适应轴评估LLM调解员,使用主题定位评估器实现0.82的人类专家一致性,发现最强模型仅缩小约三分之一的未调解共识差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21700 2026-06-05 cs.CL cs.AI cs.IR cs.MA cs.SI 62%

Toward Culturally Aligned LLMs through Ontology-Guided Multi-Agent Reasoning

通过本体引导的多智能体推理实现文化对齐的大型语言模型

Wonduk Seo, Wonseok Choi, Junseo Koh, Juhyeon Lee, Hyunjin An, Minhyeong Yu, Jian Park, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * KAIST(韩国科学技术院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OG-MAR框架,通过本体引导的多智能体推理方法,提高大型语言模型在文化对齐和鲁棒性方面的性能,并生成更透明的推理轨迹。

Comments Accepted by ICML 2026 Regular Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05026 2026-06-05 cs.CL cs.LG 62%

Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding

多模态用户界面/用户体验设计理解的基准测试:MLLMs能否捕捉界面如何引导用户行为?

Jaehyun Jeon, Min Soo Kim, Jang Han Yoon, Sumin Shim, Yejin Choi, Hanbin Kim, Dae Hyun Kim, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) NC AI

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出WiserUI-Bench基准测试,用于评估多模态UI/UX设计对用户行为的影响,通过300对真实世界UI图像对和专家解读,发现MLLMs在理解UI/UX设计行为影响方面存在局限。

Comments ACL 2026 Main. Our code and dataset: https://github.com/jeochris/wiserui-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06420 2026-06-05 cs.CL 57%

A Komi-Yazva--Russian Parallel Corpus and Evaluation Protocol for Zero- and Few-Shot LLM Translation

科米-亚兹瓦语-俄语平行语料库及零样本和少样本LLM翻译评估协议

Petr Parshakov

机构 * HSE University, Perm, Russia(俄罗斯彼尔姆国立经济大学) School of Management SKOLKOVO, Moscow, Russia(莫斯科SKOLKOVO管理学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 构建首个科米-亚兹瓦语-俄语平行语料库,并提出显式评估协议,研究大语言模型在极度低资源濒危语言翻译中的零样本和检索增强少样本性能。

Comments 18 pages, 6 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06391 2026-06-05 stat.ML cs.LG 57%

Conformal Risk Sharing: Certified Cost Allocation with Participation Guarantees

共形风险分担:具有参与保证的认证成本分配

Ieva Kazlauskaite

机构 * Ieva Kazlauskaite(伊娃·卡祖利特)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 提出共形风险分担方法,通过可解释的分担策略与分裂共形校准相结合,从有限数据中无分布假设地分配罕见事件的财务影响,为每个参与者提供义务上限并验证无人受损。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06219 2026-06-05 cs.RO cs.AI 57%

CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving

CLEAR:端到端自动驾驶中的认知与潜在评估自适应路由

Yining Xing, Zehong Ke, Zhiyuan Liu, Yanbo Jiang, Wenhao Yu, Jianqiang Wang

机构 * Qwen 3.5 0.8B

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出CLEAR框架,通过单步条件漂移替代扩散模型的多步去噪,结合视觉编码器Drive-JEPA和微调Qwen 3.5 0.8B进行语义推理,实现高效多模态规划,在NAVSIM v1上达到93.7 PDMS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06217 2026-06-05 cs.CV cs.AI 57%

DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments

DisasterBench: 复杂环境中基于无人机灾害响应的多模态基准

Tan Zhang, Quanyou Li, Lu Zhang, Jun Liu, Xiaofeng Zhu, Ping Hu

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出DisasterBench多模态基准,涵盖14种灾害场景和9个响应任务,并设计轻量级模型DisasterVL通过三阶段优化在边缘设备上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06212 2026-06-05 cs.AI 57%

Evaluating Agentic Configuration Repair for Computer Networks

评估计算机网络中的代理配置修复

Rufat Asadli, Benjamin Hoffman, Ioannis Protogeros, Laurent Vanbever

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich(电子工程,苏黎世联邦理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究通过结合形式化网络验证和上下文检索工具,评估了开源和闭源大语言模型在代理架构下的配置修复能力,发现代理架构在修复效果和安全性上分别平均提升12%和17%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06117 2026-06-05 q-bio.QM cs.LG math.AT q-bio.GN 57%

$p$-adic Bi-Filtrations for Topological Machine Learning on Genomic Sequences

$p$-adic 双过滤用于基因组序列的拓扑机器学习

Tirtharaj Dash, Gunja Sachdeva

机构 * Department of CS & IS, BITS Pilani, K K Birla Goa Campus(计算机科学与信息系统系,比斯潘大学,KK Birla Goa校区) Department of Mathematics, BITS Pilani, K K Birla Goa Campus(数学系,比斯潘大学,KK Birla Goa校区)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出 pVR 框架,结合 $p$-adic 数与拓扑数据分析,通过双过滤 Vietoris-Rips 复形提取基因组序列拓扑特征,在低样本数据集上优于基线方法。

Comments 12 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05702 2026-06-05 cs.AI cs.CV 57%

Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

Seeing Time: 视觉-语言模型中的时间顺序推理与捷径偏差基准测试

Haoyu Zhou, Qing Qing, Caichong Li, Qixin Zhang, Yongcheng Jing, Ziqi Xu, Juncheng Hu, Xikun Zhang, Renqiang Luo

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一个新基准,通过三个专门数据集评估视觉-语言模型在图像内和跨图像的时间顺序推理能力,并揭示模型常利用颜色等表面线索而非真正时间特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05671 2026-06-05 cs.CL 57%

QueryAgent-R1: Bridging Query Generation and Product Retrieval for E-Commerce Query Recommendation

QueryAgent-R1:连接查询生成与商品检索的电商查询推荐

Dike Sun, Zheng Zou, Jingtong Zang, Qi Sun, Huaipeng Zhaoand Tao Luo, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出QueryAgent-R1框架,通过记忆增强和检索链优化,将查询生成与实际库存检索对齐,以提升电商搜索中查询推荐的产品转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05616 2026-06-05 cs.CL 57%

What's in a Name? Morphological Shortcuts by LLMs in Pharmacology

名字里有什么?LLM在药理学中的形态捷径

Kaijie Mo, Thomas Yang, Chantal Shaib, Qing Yao, William Rudman, Ramez Kouzy, Kanishka Misra, Byron C. Wallace, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Northeastern University(东北大学) MD Anderson Cancer Center(MD安德森癌症中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究LLM在药理学中依赖词缀线索进行推理的形态捷径行为,通过虚构药物名称实验和归因框架揭示其机制及安全风险。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05497 2026-06-05 cs.LG 57%

LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")

LEVANTE-bench: 使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生聪明吗?”)

Alvin Wei Ming Tan, David Cardinal, Tania Lorido-Botran, Laura Bravo-Sanchez, Sunny Yu, Michael C. Frank

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出LEVANTE-bench基准,基于儿童认知任务数据,从多个尺度系统评估视觉语言模型与5-12岁儿童在六项任务上的对齐程度,发现模型与人类认知仅部分对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28579 2026-06-05 cs.AI 57%

MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation

MUSE: 面向可制造、功能性和可装配的文本到CAD生成的基准测试

Xiaoyu Dong, Zhi Li, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Curvature Flow Co., Limited(曲率流有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出MUSE基准,通过三阶段评估协议(代码检查、几何检查、设计意图对齐)和基于规则的语言模型评判,衡量文本到CAD生成模型在功能、制造和装配方面的实际设计质量。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02628 2026-06-05 cs.LG 57%

A Generative Approach for Semantic Auditing of Electronic Health Records

电子健康记录语义审计的生成式方法

Irena Girshovitz, Atai Ambus, Moni Shahar, Ran Gilad-Bachrach

机构 * School of Biomedical Engineering, Faculty of Engineering, Tel Aviv University(特拉维夫大学生物医学工程学院,工程学院) AI and Data Science Center of Tel Aviv University (TAD)(特拉维夫大学人工智能与数据科学中心(TAD)) Safra Center for Bioinformatics, Tel Aviv University(特拉维夫大学萨弗拉生物信息学中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 提出一种基于大语言模型的生成式方法,通过语义数据覆盖和检索增强生成架构自动检测电子健康记录与流行病学证据之间的不一致性,实现可扩展的语义审计。

Comments 23 pages, 5 figures (+ appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏