arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-23 至 2026-06-23 共收录 60 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 60 篇

2606.22706 2026-06-23 cs.AI 新提交 83%

Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

通过多任务风险融合的LLM生成驾驶员干预信息的安全感知评估

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究推进中心)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出DSAIS指标,结合规则与LLM评估五个维度,通过多任务风险融合框架提升干预信息质量,实验表明多任务集成使上下文相关性提升9.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 83%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 83%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20626 2026-06-23 cs.CY cs.AI 新提交 81%

Efficient Safety Benchmarking via Item Response Theory

通过项目反应理论实现高效安全基准测试

Fabio Spagliardi, Mírian Silva, Ayan Datta, Aiden Zhou, Vamshi Bonagiri, Diogo Cruz

机构 * Supervised Program for Alignment Research (SPAR)(对齐研究监督计划) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Yale University(耶鲁大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 针对安全基准测试中项目信息量不均的问题,利用项目反应理论(IRT)实现自适应项目选择,将评估成本降低至少80%,最高达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交 79%

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21939 2026-06-23 cs.CL 新提交 79%

Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

超越价值基准:通过对称Q分类测量大型语言模型中的价值结构对齐

Jingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出基于Q方法的对称人机评估框架,通过140项道德陈述的强制分布排序,测量LLM价值结构对齐,发现跨家族异质性和局部错位。

Comments 32 pages, 8 figures, 16 tables; accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21415 2026-06-23 cs.LG 新提交 79%

One Size does not Fit All: Heterogeneous Latent Space Alignment for Unsupervised Domain Adaptation

一种尺寸并不适合所有情况:无监督域适应的异构潜在空间对齐

Evangelia Koskinioti, Yi Shen, Georgios Stamou, Michael M. Zavlanos

机构 * Duke University(杜克大学) National Technical University of Athens(雅典国家技术大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出ADualVUOT框架,结合双编码器VAE与连续归一化流增强潜在表达,利用非平衡最优传输(GGW距离)对齐域,并引入对抗增强提升鲁棒性,在医学图像分割中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20686 2026-06-23 cs.RO cs.AI 新提交 79%

JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems

JPPD:具有可微安全引导的联合预测-规划扩散框架用于智能交通系统中的动态障碍物规避

Jiahao Wu, Shengwen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出联合预测-规划扩散框架,将参与者预测与机器人规划视为条件轨迹生成问题,通过可微安全势引导和条件流匹配提升共享空间中的安全性与效率。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03579 2026-06-23 cs.RO cs.LG 版本更新 79%

Intent-Handover: Grounding Language in Human-Usage Regions for Trustworthy Robot-to-Human Handovers

Intent-Handover:在人类使用区域中接地语言以实现可信的机器人到人交接

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

机构 * DANiLab, University of Leicester(莱斯特大学DANiLab) University of Leicester(莱斯特大学) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.LG

AI总结 提出Intent-Handover方法,通过视觉语言模型识别目标物体和人类使用区域,结合抓取优化和人体姿态跟踪,实现安全、可信的机器人到人物体交接。

Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23629 2026-06-23 cs.HC 新提交 78%

Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation

为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐

Pei-Yu Tseng, Mahir Akgun, Peng Liu

专题命中 安全评测 :alignment(title,abstract)

AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07339 2026-06-23 cs.CR 78%

TDML -- A Trustworthy Distributed Machine Learning Framework

TDML -- 一个可信的分布式机器学习框架

Zhen Wang, Qin Wang, Guangsheng Yu, Shiping Chen

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出TDML框架,利用区块链协调远程训练器并验证工作负载,实现隐私、透明和高效的模型训练,克服性能限制和恶意节点检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29473 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 版本更新 75%

Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

告知、指导、共情、倾听:审计LLM护理支持角色

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Dong Whi Yoo, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交 73%

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20963 2026-06-23 cs.AI cs.CY cs.DB 新提交 73%

Generative Responsible AI Data Evaluation Schema (GRAIDES) for AI Assurance in Local Government

面向地方政府AI保障的生成式负责任AI数据评估模式(GRAIDES)

Ethan Knights, Christopher Conlan, Temilorun Gbolahan, Stephen Waterman, Gurpreet Muctor

机构 * AI Innovation Lab, Westminster City Council(威斯敏斯特市议会人工智能创新实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 提出轻量级开源数据模型GRAIDES,用于集中管理生成式AI的可观测性,通过代码、架构和统计评估蓝图,在组织层面实现系统保障,并在威斯敏斯特市议会案例中验证了人机对齐测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00326 2026-06-23 cs.AI cs.CL cs.IR 73%

Agent-OM: Leveraging LLM Agents for Ontology Matching

Agent-OM:利用大语言模型代理进行本体匹配

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Agent-OM框架,结合检索与匹配代理及OM工具,有效提升复杂和少样本本体匹配任务性能,接近传统最佳表现。

Comments 31 pages - VLDB 2025 (Page 1-20), OM 2025 (Page 21-31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23487 2026-06-23 cs.AI 新提交 70%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Amrita Singh, Rishabh Jha

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 70%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20663 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

DrugBench:评估用于减轻药物危害的AI控制协议

Guido Freire, Agustín Martínez-Suñé, Viviana Cotik

机构 * Universidad de Buenos Aires, Facultad de Ciencias Exactas y Naturales, Departamento de Computación(布宜诺斯艾利斯大学,精确与自然科学学院,计算机系) AI Safety Argentina (AISAR)(阿根廷人工智能安全组织 (AISAR)) Department of Computer Science, University of Oxford(牛津大学计算机科学系) CONICET-Universidad de Buenos Aires, Instituto de Ciencias de la Computación (ICC)(阿根廷国家科学与技术研究理事会-布宜诺斯艾利斯大学,计算机科学研究所 (ICC))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DrugBench基准,结合医疗对话与FDA标签,评估AI控制协议在减轻药物交互、禁忌症等四类危害中的有效性,并引入基于严重性的监控方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20624 2026-06-23 cs.AI cs.CL cs.LG stat.ML 新提交 67%

In LLM Reasoning, there is Irrationality on top of Value Misalignment

在LLM推理中,价值对齐之上存在非理性

Kejiang Qian, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00012 2026-06-23 cs.LG cs.AI cs.CY cs.IR 版本更新 67%

OGD4All: A Framework for Accessible Interaction with Geospatial Open Government Data Based on Large Language Models

OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架

Michael Siebenmann, Javier Argota Sánchez-Vaquerizo, Stefan Arisona, Krystian Samp, Luis Gisler, Dirk Helbing

机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) Esri R&D Center Zurich(埃斯里苏黎世研发中心) Complexity Science Hub(复杂性科学中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。

Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20668 2026-06-23 cs.CR cs.AI cs.LG 新提交 66%

BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

BELLS-O:评估LLM监督系统的运营权衡

Leonhard Waibl, Felix Michalak, Hadrien Mariaccia

机构 * University of Graz, Graz, Austria(格拉茨大学) Supervised Program for Alignment Research (SPAR)(对齐研究监督计划 (SPAR)) Centre pour la Sécurité de l'IA (CeSIA), Paris, France(人工智能安全研究中心 (CeSIA),巴黎,法国)

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 提出首个独立运营基准BELLS-O,评估28个LLM监督系统在检测率、误报率、延迟和成本上的权衡,发现专用护栏在内容审核中占优,而前沿通用模型在越狱检测中表现更好但成本更高。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD). 2 figures; main text plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 62%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23189 2026-06-23 cs.AI cs.CL 新提交 62%

Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?

有能力但粗心:计算机使用代理是否遵循情境完整性?

Anmol Goel, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室(UKP Lab)) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出AgentCIBench基准,测试计算机使用代理在跨应用操作时是否泄露不适当信息,发现15个前沿代理中11个在超过50%场景中泄露信息,平均泄露率67.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21981 2026-06-23 cs.CL cs.LG 新提交 62%

Can LLMs Control Readability? A Multi-Dimensional Evaluation Framework for CEFR-Controlled Arabic Generation

LLM能否控制可读性?面向CEFR可控阿拉伯语生成的多维评估框架

Nour Rabih, Chatrine Qwaider, Ted Briscoe

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出一个多维评估框架,通过结构化提示和词汇约束,使指令跟随型LLM在CEFR可控阿拉伯语生成中达到高可读性一致性(余弦相似度0.91,可读性预测一致性0.99)。

Comments 15 PAGES, READIxTSAR WORKSHOP, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21821 2026-06-23 cs.LG cs.CL 新提交 62%

Local Causal Attribution of Chain-of-Thought Reasoning

链式思维推理的局部因果归因

Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出AttriCoT算法,通过结构因果模型对链式思维推理中的单元进行局部因果归因,仅需O(U)次前向传播即可获得忠实于模型行为的归因结果。

Comments Camera-ready version for the Mechanistic Interpretability Workshop at ICML 2026. 37 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 62%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21460 2026-06-23 cs.CL cs.AI 新提交 62%

Evaluation of Small Language Models for Arabic Language Processing

小型语言模型在阿拉伯语处理中的评估

Jumana Alsubhi, Ahmed Alhusayni, Abdulrahman Gharawi, Israa Hamdine, Alshaymaa Allahim, Lamees Alhumaid, Ahmad Shabana, Rafik Madani

机构 * Naseej Innovation Lab(纳赛伊创新实验室) Naseej for Technology(纳赛伊技术)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了12种小型语言模型在阿拉伯语自然语言处理任务上的表现,构建了涵盖8个领域和10种语言技能的240项测试基准,发现模型大小并非决定因素,阿拉伯语对齐和指令遵循能力更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21344 2026-06-23 cs.AI cs.LG cs.RO 新提交 62%

Mind the Noise: Sensitivity of Transformer-based Interaction-Aware Trajectory Prediction Models to Noisy Data

注意噪声:基于Transformer的交互感知轨迹预测模型对噪声数据的敏感性

Shahab Salehi, Luca Lusvarghi, Miguel Sepulcre, Javier Gozalvez

机构 * Networked Systems Lab, Universidad Miguel Hernandez de Elche(网络系统实验室,米格尔·洪德斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究基于Transformer的交互感知轨迹预测模型在噪声数据下的性能退化,发现预测精度在低噪声下降低1.3倍,高噪声下降低3.9倍,强调需要更真实的训练数据和噪声缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21194 2026-06-23 cs.CV cs.AI cs.CL 新提交 62%

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔大学) Seoul National University Hospital(首尔大学医院) Seoul National University College of Medicine(首尔大学医学院) Sungkyunkwan University School of Medicine(成均馆大学医学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。

Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked

详情

展开后加载摘要…

URL PDF HTML 收藏