arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 457 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 457 篇

2511.10453 2026-08-11 cs.CL cs.AI 版本更新 62%

Reasoning about Intent for Ambiguous Requests

意图推理以应对歧义请求

Irina Saparina, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成结构化响应以枚举歧义请求的不同解释,通过强化学习训练模型提升覆盖有效解释的召回率和抑制虚假解释的精确率,实验表明方法在覆盖有效答案方面优于基线方法。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12658 2026-08-11 cs.CL cs.AI 版本更新 62%

Beyond Static Models: An Evolving Framework for Continual Learning in Large Language Models across Training Stages

在大型语言模型中进行持续学习:方法、挑战与机遇

Hongyang Chen, Zhongwu Sun, Hongfei Ye, Kunchi Li, Xuemin Lin

机构 * Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了针对大型语言模型的持续学习方法,分析了持续预训练、微调和对齐的核心阶段,探讨了传统方法在持续学习中的适应性与改进,并指出在跨任务和时间尺度的知识整合中仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22510 2026-08-11 cs.LG cs.AI 版本更新 62%

Shattered Compositionality: Counterintuitive Learning Dynamics of Transformers for Arithmetic

破碎的组合性:变换器在算术中的反直觉学习动态

Xingyu Zhao, Darsh Sharma, Rheeya Uppaal, Yiqiao Zhong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现变换器在学习算术任务时表现出反直觉的组合性,其学习动态受训练数据相关性影响而非因果或程序性组合。

Comments 37 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05910 2026-08-10 cs.AI cs.CY 版本更新 62%

CourseGraph: Finding overlaps and differences in Computer Science courses across universities

CourseGraph:跨大学计算机科学课程的重叠与差异识别

Arthur Nijdam, Paul Stankovski Wagner, Sara Ramezanian

机构 * Lund University(隆德大学) Karlstad University(卡尔斯塔德大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究提出CourseGraph,利用BERT语言模型与随机森林分类器,通过课程网页信息的语义表示计算课程相似度,实现跨大学计算机科学课程重叠的自动识别,为课程对齐提供有效支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00130 2026-08-10 cs.PL cs.AI cs.CL cs.MS cs.SE 版本更新 62%

A Fortran General-Purpose Transpiler: Proof of Concept

Fortran通用转译器:概念验证

Shivamshan Sivanesan, Kazem Ardaneh

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Fortran专业知识断层问题,提出基于Python的FGPT编译器框架,可将Fortran转译为适配GPU或自动微分的代码,经气候建模内核验证,能自动生成正确的Python实现,为遗留Fortran代码现代化提供可靠路径。

Comments 19 pages, 14 figures, proof of concept

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29738 2026-08-10 cs.CL cs.AI 版本更新 62%

Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions

Multi-Legal-Bench: 跨司法管辖区、语言和法律传统的法律推理评估LLM

Volodymyr Ovcharov

机构 * SecondLayer

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Multi-Legal-Bench,首个跨司法管辖区法律基准,在6个国家、4个语系和1.34亿份法院判决上评估LLM,发现少样本效果跨辖区复制、无单一模型主导所有语言、跨语言迁移不遵循语言邻近性、分词器效率不显著预测跨语言准确率。

Comments 17 pages, 5 figures, 9 tables. v2 corrects scorer and taxonomy defects, adds no-model baselines showing label leakage, re-runs the Lithuanian cells on de-leaked text, and withdraws the claim that few-shot helps on judgment-form classification everywhere; all tables and figures regenerated. Dataset: https://huggingface.co/datasets/overthelex/multi-legal-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00023 2026-08-07 cs.CL cs.AI 版本更新 62%

Role Steering of Language Models for Social Simulations

用于社会模拟的语言模型角色引导

Isaac Song, Mohammed Rehan Parwani, Glenn Matlin, Emile Anand, Akhil Theerthala, Arjun Chatterjee, Anthony Wen-Ming Zang, Maria Kostylew, Yonadav G. Shavit, Sebastien Krier, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Alignment & Theory Scholars (MATS)(ML对齐与理论学者组织(MATS)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind) OpenAI(开放人工智能公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出针对语言模型智能体的角色引导筛选工作流,在OLMo-3-7B-Instruct上验证其角色画像对齐度更高且词汇多样性更好,发现需按角色选引导系数而非统一高强度设置。

Comments 35 pages. Published at the Social Sim'26 Workshop, COLM 2026. Code: https://github.com/eilab-gt/casting-call-vectors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28609 2026-08-07 cs.AI cs.CL cs.CV 版本更新 62%

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00025 2026-08-07 q-bio.NC cs.CL cs.HC cs.LG eess.AS 版本更新 62%

MoDAl: Self-Supervised Neural Modality Discovery via Decorrelation for Speech Neuroprosthesis

MoDAl: 基于去相关的自监督神经模态发现用于语音神经假体

Yuanhao Chen, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出MoDAl框架,通过对比学习和对齐损失与去相关损失之间的协同作用,从多脑区发现互补神经模态,在Brain-to-Text Benchmark '24上将词错误率从26.3%降至21.6%。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04525 2026-08-06 cs.CL cs.LG q-bio.GN 版本更新 62%

GENEB: Why Genomic Models Are Hard to Compare

GENEB:为什么基因组模型难以比较

Daria Ledneva, Mikhail Nuridinov, Denis Kuznetsov

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对基因组基础模型评估碎片化的问题,提出GENEB基准,通过统一探测协议在100项任务上比较40个模型,揭示模型排名不稳定、规模收益有限等关键发现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 62%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13801 2026-08-05 cs.LG cs.AI 版本更新 62%

Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling

通过多级标注者建模提高评估的可重复性

Deepak Pandita, Flip Korn, Chris Welty, Christopher M. Homan

机构 * Rochester Institute of Technology(罗切斯特理工学院) Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级抽样方法,通过分析标注者数量与响应数量的平衡,提升评估结果的可重复性与统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08442 2026-08-05 cs.CR cs.AI cs.LG 版本更新 62%

Injection-Execution Dissociation: A Mechanistic Evaluation of Persistent Memory Attacks and Defenses in Stateful LLM Agents

多层架构中的防御效果:对持久内存攻击状态机LLM代理的机制性评估

Jun Wen Leong

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了六种防御措施在九个开源模型上的延迟触发攻击效果,发现输入级和检索级过滤器效果不佳,而内存层工具门控(Memory Sandbox)显著降低攻击成功率,揭示了不同防御类别的失效原因。

Comments v4: Added double dissociation (reasoning-mode ablation), content-layer defense (RATG), loaded-corpus frontier evaluation (21 models, 3 providers, N=40), 7B judge capability bound, reproducibility validity criterion, ethics/disclosure statement. Gemini 3.1 Pro Preview 95% ASR; GPT-5.1 regression (22.5%); tripartite vendor divergence. Code: github.com/junwenleong/stateful-agent-security-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16217 2026-08-05 cs.CL cs.AI 版本更新 62%

ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminology Mixing

ChiEngMixBench: 评估大型语言模型在自发和自然的中英混合生成中的能力

Qingyan Yang, Tongxi Wang, Yunsheng Luo

机构 * School of Future Technology(未来技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ChiEngMixBench通过评估中英混合生成的自发性和自然性,揭示多语言模型与人类交流的结构化认知对齐

Comments 15 pages, 2 figures, 8 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22660 2026-08-04 cs.CL cs.AI 版本更新 62%

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

道德语义在机器翻译中得以保留:来自道德基础语料库的跨语言证据

Maciej Skorski

机构 * University of Luxembourg(卢森堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了基于LLM的翻译是否能弥合道德价值观分类中语言特定标注语料库的差距,通过波兰语案例展示直接翻译能有效保留微妙的道德线索,为资源匮乏语言的道德研究提供了可行路径。

Comments Accepted to GoodIT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00665 2026-08-04 cs.CL cs.AI 版本更新 62%

Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation

小语言模型能否处理上下文总结的多轮客户服务问答?一种合成数据驱动的比较评估

Lakshan Cooray, Deshan Sumanathilaka, Pattigadapa Venkatesh Raju

机构 * School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所) School of Mathematics and Computer Science, Swansea University(数学与计算机科学学院,萨默塞特大学) R&D, Zame AI(Zame AI研发部)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过合成数据评估小语言模型在多轮客户服务问答中的表现,发现部分模型接近大语言模型性能,但整体仍存在对话连续性和上下文对齐的挑战。

Comments Published at Frontiers in Artificial Intelligence, Natural Language Processing Section

Journal ref Frontiers in Artificial Intelligence, 9:1804284, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新 62%

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20780 2026-07-31 cs.AI cs.CL cs.CV 版本更新 62%

MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models

MedHallTune:用于缓解视觉-语言模型中医患幻觉的指令调优基准

Qiao Yan, Yuchen Yuan, Xiaowei Hu, Yihan Wang, Jiaqi Xu, Xiwen Wu, Jinpeng Li, Chi-Wing Fu, Pheng-Ann Heng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MedHallTune基准,用于评估和缓解医疗视觉-语言模型的幻觉,实验表明用该基准微调模型可提升幻觉管理能力与下游VQA任务零样本性能,助力开发更可信的医疗视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23624 2026-07-30 cs.SE cs.AI cs.CL 版本更新 62%

Where Is the Cost of Third-Party API Routers in Agentic Software Development?

代理软件开发中第三方 API 路由器的成本在哪里?

Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究第三方 API 路由器在代理软件开发中的影响,通过实证研究编码代理中路由器端注入的四个干预级别,开发 SIDEL 框架评估代理,发现路由器端干预难测,客户端缓解措施未完全恢复控制,强调需提供商端输出完整性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新 62%

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21571 2026-07-29 cs.CL cs.AI cs.CR 版本更新 62%

Towards Understanding the Cognitive Habits of Large Reasoning Models

迈向理解大型推理模型的认知习惯

Jianshuo Dong, Yujia Fu, Chuanrui Hu, Chao Zhang, Han Qiu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究大型推理模型是否展现类人认知习惯,基于“思维习惯”框架引入CogTest基准测试,对16个语言模型评估发现LRMs有类人习惯且能自适应运用,还揭示了习惯异同模式及与有害回答的关联,为理解模型不当行为提供重要依据。

Comments Published at Machine Intelligence Research vol.23, no.4, pp.873-886

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18350 2026-07-28 cs.CL cs.AI 版本更新 62%

Adapter Merging Reactivates Latent Reasoning Traces: A Mechanism Analysis

适配器合并重新激活潜在推理痕迹:一种机制分析

Junyi Zou

机构 * Zjydiary Group(Zjydiary小组)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示适配器合并后推理痕迹的重新激活机制,通过几何方法减少泄漏并提升准确性。

Comments Withdrawn by the authors after identifying an implementation error in adapter coefficient scaling that materially affects the main empirical results and invalidates the current conclusions. A corrected reanalysis is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14345 2026-07-21 cs.LG cs.AI cs.CR 版本更新 62%

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

价值泄露:大语言模型的答案被其自身价值观悄然塑造

Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evans

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型存在价值泄露问题,即其答案受自身价值观影响却未向用户披露。为此引入评估套件量化,发现模型受多种价值观影响,前沿模型差异大,价值泄露是新的失败模式,当前训练和评估未充分解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29219 2026-07-21 cs.CL cs.AI cs.CV cs.HC 版本更新 62%

SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation

SyriSign:阿拉伯语到叙利亚阿拉伯手语翻译的平行语料库

Mohammad Amer Khalil, Raghad Nahas, Ahmad Nassar, Khloud Al Jallad

机构 * Arab International University(阿拉伯国际大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SyriSign数据集,用于阿拉伯语到叙利亚阿拉伯手语的翻译任务,旨在解决叙利亚聋人社区的沟通障碍,通过三种深度学习模型评估,发现生成方法在手语表示上有潜力,但受限于数据集规模影响泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15783 2026-07-21 cs.AI cs.LG 版本更新 62%

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection

迈向人工智能流行病学:一种用于前瞻性风险检测的测量标准化框架

Kit Tempest-Walters

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种测量标准化框架,用于在没有访问模型内部信息的情况下,将专家-人工智能交互压缩为结构化、可比较的领域,以进行前瞻性风险检测。该框架旨在定义其范围,包括语义和统计层面,并指定未来工作的实证测试协议。

Comments 38 pages, 3 figures, 4 tables. Accepted for publication in AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 62%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 62%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08967 2026-07-17 cs.LG cs.AI 版本更新 62%

CluCERT: Certifying LLM Robustness via Clustering-Guided Denoising Smoothing

CluCERT:通过聚类引导去噪平滑认证大语言模型的鲁棒性

Zixia Wang, Gaojie Jin, Jia Hu, Ronghui Mu

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型易受对抗攻击问题,提出CluCERT框架,通过聚类引导去噪平滑认证其鲁棒性。引入语义聚类过滤器,结合细化模块和快速同义词替换策略,提升效率,实验证明该方法在鲁棒性边界和计算效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏