arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-26 至 2026-03-26 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2512.16917 2026-03-26 cs.AI cs.CL cs.LG 67%

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

生成对抗推理器:通过对抗性强化学习增强大语言模型推理

Qihao Liu, Luoxin Ye, Wufei Ma, Yu-Cheng Chou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出生成对抗推理器,通过对抗性强化学习联合训练LLM推理器和判别器,提升推理质量与准确性。

Comments Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19311 2026-03-26 cs.CL 57%

PrefPO: Pairwise Preference Prompt Optimization

PrefPO:基于配对偏好的提示优化

Rahul Singhal, Pradyumna Tambwekar, Karime Maamari

机构 * Distyl AI

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

AI总结 PrefPO通过强化学习反馈机制优化提示,无需标注数据即可提升模型性能,在多个基准测试中表现优异,同时改善提示质量并减少提示黑客问题。

Comments Code and data available at https://github.com/DistylAI/prefpo and https://huggingface.co/datasets/rahul-singhal/IFEval-Hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24578 2026-03-26 cs.CV eess.IV 50%

Vision-Language Models vs Human: Perceptual Image Quality Assessment

视觉-语言模型与人类:感知图像质量评估

Imran Mehmood, Imad Ali Shah, Ming Ronnier Luo, Brian Deegan

机构 * School of Engineering, University of Galway(Galway大学工程学院) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光信息获取国家重点实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文研究视觉语言模型是否能近似人类对图像质量的感知判断,通过对比心理物理数据,发现模型在颜色丰富度上表现优异,但在对比度上表现较差,且模型一致性与人类对齐性存在矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV 50%

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2602.14844 2026-03-26 cs.LG 83%

Interactionless Inverse Reinforcement Learning: A Data-Centric Framework for Durable Alignment

无交互逆强化学习:一种数据驱动的对齐框架

Elias Malomgré, Pieter Simoens

机构 * IDLab, Ghent University - imec(IDLab,根特大学-imec)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出无交互逆强化学习框架,旨在通过数据驱动的方法学习可检查、可编辑和可重用的奖励特征,从而将对齐问题从一次性训练成本转变为可验证的工程资产。

Comments Accepted for the AAMAS 2026 Blue Sky Ideas track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24241 2026-03-26 eess.SY cs.LG cs.SY 57%

C-STEP: Continuous Space-Time Empowerment for Physics-informed Safe Reinforcement Learning of Mobile Agents

C-STEP:连续时空赋能用于物理引导的移动智能体安全强化学习

Guihlerme Daubt, Adrian Redder

机构 * Faculty of Technology, Bielefeld University, Germany(比勒菲尔德大学技术学院,德国) Department of Electrical Engineering and Information Technology, Paderborn University, Germany(帕德博恩大学电气工程与信息科技系,德国)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出C-STEP方法,通过结合导航奖励设计物理引导的内在奖励,提升移动智能体在复杂环境中的安全导航能力,减少碰撞并优化任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23772 2026-03-26 cs.NI cs.AI 57%

AI-driven Intent-Based Networking Approach for Self-configuration of Next Generation Networks

基于人工智能的意图驱动网络方法用于下一代网络的自配置

Md. Kamrul Hossain, Walid Aljoby

机构 * Information and Computer Science Department, King Fahd University of Petroleum and Minerals(信息与计算机科学系,国王法赫德石油与矿物大学) IRC for Intelligent Secure Systems, King Fahd University of Petroleum and Minerals(智能安全系统研究院,国王法赫德石油与矿物大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种端到端闭环IBN流程,利用大语言模型和结构化验证将自然语言意图转化为可执行策略,并通过多意图故障预测提升自动化可靠性。

Comments Accepted for presentation in IEEE/IFIP NOMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 50%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 安全训练 :alignment(abstract)

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23880 2026-03-26 cs.SI 50%

ProcureGym: A Multi-Agent Markov Game Framework for Modeling National Volume-based Drug Procurement

ProcureGym: 一个用于建模国家基于体积的药品采购的多智能体马尔可夫游戏框架

Jia Wang, Qian Xu, Xuanwen Ding, Zhuangqi Li, Chao He, Bao Liu, Zhongyu Wei

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出ProcureGym,通过真实数据模拟中国基于体积的药品采购,评估RL、LLM等智能体模型,发现RL在收益和利润上表现更优,揭示最大有效报价和采购量对战略结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2603.23509 2026-03-26 cs.CL cs.AI cs.CR 86%

Internal Safety Collapse in Frontier Large Language Models

前沿大语言模型中的内部安全崩溃

Yutao Wu, Xiao Liu, Yifeng Gao, Xiang Zheng, Hanxun Huang, Yige Li, Cong Wang, Bo Li, Xingjun Ma, Yu-Gang Jiang

机构 * Deakin University(德克萨斯大学) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了前沿大语言模型中一种关键故障模式——内部安全崩溃,通过构建ISC-Bench测试集,发现模型在执行某些任务时会持续生成有害内容,且比传统劫持攻击更危险。

Comments 15 pages of the main text, qualitative examples of jailbreaks may be harmful in nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22094 2026-03-26 cs.CV 85%

Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models

通过空域投影实现原理化引导用于视觉-语言模型中的对抗防御

Xingyu Zhu, Beier Zhu, Shuo Wang, Junfeng Fang, Kesen Zhao, Hanwang Zhang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(北京信息科技大学MoE关键实验室,中国科学技术大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);trustworthy(abstract)

AI总结 本文提出NullSteer框架,通过线性变换在模型激活中构建拒绝方向,在良性子空间保持零扰动,动态诱导拒绝有害方向,提升安全性而不损害模型能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22171 2026-03-26 cs.CR cs.AI 83%

Enhancing Jailbreak Attacks on LLMs via Persona Prompts

通过人格提示增强大语言模型的劫持攻击

Zheng Zhang, Peilin Zhao, Deheng Ye, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文通过遗传算法生成人格提示,有效降低大语言模型拒绝率,提升劫持攻击成功率,揭示人格提示对模型安全机制的影响。

Comments Workshop on LLM Persona Modeling at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2602.24055 2026-03-26 cs.AI cs.SE 57%

CIRCLE: A Framework for Evaluating AI from a Real-World Lens

CIRCLE:从现实视角评估AI的框架

Reva Schwartz, Carina Westling, Morgan Briggs, Marzieh Fadaee, Isar Nejadgholi, Matthew Holmes, Fariza Rashid, Maya Carlyle, Afaf Taïk, Kyra Wilson, Peter Douglas, Theodora Skeadas, Gabriella Waters, Rumman Chowdhury, Thiago Lacerda

机构 * Civitaas Insights Bournemouth University(伯恩茅斯大学) Independent Researcher(独立研究者) Cohere Labs(Cohere实验室) National Research Council Canada(加拿大国家研究理事会) Intellect Frontier University of Sydney(悉尼大学) National Physical Laboratory, UK(英国国家物理实验室) Université de Sherbrooke(谢布罗克大学) University of Washington(华盛顿大学) Principled AI Humane Intelligence Non-profit(人智非营利组织) Virginia State University(弗吉尼亚州立大学) Humane Intelligence Public Benefit Corporation(人智公共利益公司)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出CIRCLE框架,通过六个阶段生命周期方法,弥合模型性能指标与部署中AI实际结果之间的现实差距,提供系统性的实证证据。

Comments Accepted at Intelligent Systems Conference (IntelliSys) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2603.23791 2026-03-26 cs.CR cs.AI 79%

The Cognitive Firewall:Securing Browser Based AI Agents Against Indirect Prompt Injection Via Hybrid Edge Cloud Defense

认知防火墙:通过混合边缘云防御保护基于浏览器的AI代理免受间接提示注入攻击

Qianlong Lan, Anuj Kaul

机构 * eBay Inc(eBay公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出认知防火墙,通过混合边缘云防御机制,有效降低基于浏览器的AI代理遭受间接提示注入攻击的成功率,同时显著提升系统响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24203 2026-03-26 cs.CR cs.AI 57%

Invisible Threats from Model Context Protocol: Generating Stealthy Injection Payload via Tree-based Adaptive Search

基于模型上下文协议的隐形威胁:通过树状自适应搜索生成隐蔽注入负载

Yulin Shen, Xudong Pan, Geng Hong, Min Yang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) IEEE Publication Technology Group(IEEE出版技术组)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出TIP攻击方法,通过树状结构搜索生成隐蔽负载,有效攻击MCP增强代理,实验显示其在未防御环境下攻击成功率超95%,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 4 篇

2603.24258 2026-03-26 cs.CL 79%

Semantic Alignment across Ancient Egyptian Language Stages via Normalization-Aware Multitask Learning

通过感知-意识多任务学习实现古代埃及语言各阶段的语义对齐

He Huang

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 本文研究古代埃及语言四个历史阶段的词级语义对齐,通过联合训练共享字级分词器的紧凑编码器-解码器模型,结合掩码语言模型、翻译语言模型、序列到序列翻译和词性标注任务,提升跨阶段对齐效果。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24579 2026-03-26 cs.CL 57%

MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination

MARCH: 多智能体强化自检用于大语言模型幻觉

Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(通义大模型应用团队,阿里巴巴)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 MARCH通过多智能体强化学习框架,利用信息不对称机制减少大语言模型幻觉,实验表明其能显著降低幻觉率,8B参数模型表现接近闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21037 2026-03-26 cs.LG 57%

When Brain Foundation Model Meets Cauchy-Schwarz Divergence: A New Framework for Cross-Subject Motor Imagery Decoding

当脑基础模型遇见柯西-施瓦茨散度:一种跨受体运动想象解码的新框架

Jinzhou Wu, Baoping Tang, Qikang Li, Yi Wang, Cheng Li, Shujian Yu

机构 * State Key Laboratory of Mechanical Transmission, College of Mechanical and Vehicle Engineering, Chongqing University(机械传动国家重点实验室,重庆大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种新的多源域适应框架,利用预训练的脑基础模型进行动态源受体选择,并结合柯西-施瓦茨散度实现特征和决策层面对齐,以提高跨受体运动想象解码的准确率。

Comments This work has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04964 2026-03-26 cs.HC 50%

Scientific judgment drifts over time in AI ideation

人工智能构想中的科学判断随时间漂移

Lingyu Zhang, Mitchell Wang, Boyuan Chen

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究发现专家对科学构想的评估并非稳定,尽管内部结构保持稳定,但随时间变化的评估漂移影响了AI生成构想的评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2603.21106 2026-03-26 cs.CY cs.HC 57%

Tracing Users' Privacy Concerns Across the Lifecycle of a Romantic AI Companion

追踪浪漫AI伴侣生命周期中的用户隐私关切

Kazi Ababil Azam, Imtiaz Karim, Dipto Das

专题命中 隐私与版权 :safety(abstract);分类 cs.CY

AI总结 本文通过分析Reddit讨论,揭示浪漫AI伴侣生命周期中隐私问题的四个特征,强调隐私治理需贯穿使用全过程,支持可逆性并考虑亲密人机交互的情感脆弱性。

Comments 16 pages, 1 figure, in submission at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 22 篇

2603.23625 2026-03-26 cs.AI cs.CL 84%

Evaluating a Multi-Agent Voice-Enabled Smart Speaker for Care Homes: A Safety-Focused Framework

评估多智能体语音赋能的智能音箱在养老机构中的应用:以安全为导向的框架

Zeinab Dehghani, Rameez Raja Kureshi, Koorosh Aslansefat, Faezeh Alsadat Abedi, Dhavalkumar Thakker, Lisa Greaves, Bhupesh Kumar Mishra, Baseer Ahmad, Tanaya Maslekar

机构 * University of Hull, UK(赫尔大学) University of Southampton, UK(南安普顿大学) Connexin, Hull, UK(Connexin公司) Leeds Teaching Hospital NHS Trust, UK(利兹教学医院国家健康服务信托)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了语音赋能的养老机构智能音箱,通过结合语音识别与检索增强生成技术,验证其在居民识别、提醒提取和任务调度中的准确性,为安全导向的护理系统提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24543 2026-03-26 cs.CR cs.CL 83%

Analysing the Safety Pitfalls of Steering Vectors

分析转向向量的安全隐患

Yuxiao Li, Alina Fastowski, Efstratios Zaradoukas, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文研究转向向量在对抗攻击中的影响,发现其能显著改变攻击成功率,揭示可控性与安全性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 81%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 79%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24414 2026-03-26 cs.CR cs.AI 74%

ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers

ClawKeeper: 通过技能、插件和观察者为OpenClaw代理提供全面的安全保护

Songyang Liu, Chaozhuo Li, Chenxu Wang, Jinyu Hou, Zejian Chen, Litian Zhang, Zheng Liu, Qiwei Ye, Yiming Hei, Xi Zhang, Zhongyuan Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) China Academy of Information and Communications Technology(信息通信技术研究院)

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 ClawKeeper通过技能、插件和观察者三层机制,提供实时安全防护,解决OpenClaw生态的安全漏洞问题,经过评估证明其有效性。

Comments 22 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 67%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23848 2026-03-26 cs.CL cs.CY 62%

BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents

BeliefShift:评估LLM代理中时间信念一致性和意见漂移的基准测试

Praveen Kumar Myakala, Manan Agrawal, Rahul Manche

机构 * Independent AI Researcher(独立AI研究员) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent Researcher(独立研究员)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 BeliefShift提出一个长期基准测试,评估多会话LLM交互中的信念动态,涵盖时间信念一致性、矛盾检测和证据驱动修正三个赛道,通过2400个标注交互轨迹验证模型在零样本和RAG设置下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23519 2026-03-26 cs.CL cs.AI 62%

MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?

MedMT-Bench: LLMs能否在医学场景中记忆并理解长多轮对话?

Lin Yang, Yuancheng Yang, Xu Wang, Changkun Liu, Haihua Yang

机构 * ByteDance(字节跳动)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 MedMT-Bench通过模拟诊断治疗流程,测试LLM在长上下文记忆、干扰鲁棒性和安全防御方面的表现,发现17种前沿模型均无法达到60%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23506 2026-03-26 cs.CL cs.AI 62%

Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking

利用计算自适应测试对大型语言模型进行成本效益的医学基准评估

Tianpeng Zheng, Zhehan Jiang, Jiayi Liu, Shicong Feng

机构 * Institute of Medical Education, Health Science Center, Peking University(北京大学医学教育研究院、健康科学中心) School of Public Health, Peking University(北京大学公共卫生学院) Peking University Health Science Center-Chaoxing Joint Laboratory for Digital and Smart Medical(北京大学健康科学中心-超星数字与智能医疗联合实验室) Graduate School of Education, Peking University(北京大学教育学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于项目反应理论的计算自适应测试框架,用于高效评估大型语言模型在标准化医学知识中的表现,通过模拟和实证研究验证了其在成本效益和评估效率上的优势。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20001 2026-03-26 cs.CL cs.SI 57%

A Machine Learning Approach for Detection of Mental Health Conditions and Cyberbullying from Social Media

从社交媒体检测心理健康状况和网络欺凌的一种机器学习方法

Edward Ajayi, Martha Kachweka, Mawuli Deku, Emily Aiken

机构 * Carnegie Mellon University Africa Kigali, Rwanda(卡内基梅隆大学非洲分校基加利分校,刚果(金))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出统一的多类分类框架,用于从社交媒体数据中检测十种不同的心理健康和网络欺凌类别,通过实验表明端到端微调对性能至关重要,MentalBERT模型在准确率和宏F1分数上表现优异。

Comments Best Paper Award at the AAAI-26 Bridge Program on AI for Medicine and Healthcare. Published in Proceedings of the Second AAAI Bridge Program on AI for Medicine and Healthcare, PMLR 317:15-26, 2026. Paper URL: https://proceedings.mlr.press/v317/ajayi26a.html

详情

展开后加载摘要…

URL PDF HTML 收藏