arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-09 至 2026-04-09 共收录 72 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2604.06833 2026-04-09 cs.CR cs.LG 83%

FedDetox: Robust Federated SLM Alignment via On-Device Data Sanitization

FedDetox: 通过设备端数据净化实现鲁棒的联邦SLM对齐

Shunan Zhu, Jiawei Chen, Yonghao Yu, Hideya Ochiai

机构 * The University of Tokyo(东京大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 FedDetox通过设备端数据净化技术,提升联邦学习中小型语言模型的安全对齐能力,保持模型安全性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17183 2026-04-09 cs.CL cs.AI cs.LG 82%

LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization

LifeAlign: 为大型语言模型设计的终身对齐方法,结合记忆增强的聚焦偏好优化

Junsong Li, Jie Zhou, Bihao Zhan, Yutao Yang, Qianjun Pan, Shilian Chen, Tianyu Huai, Xin Li, Qin Chen, Liang He

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LifeAlign,一种通过记忆增强的聚焦偏好优化实现终身对齐的方法,解决大型语言模型在连续学习任务中保持偏好对齐和知识保留的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07181 2026-04-09 cs.CL 79%

PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs

PACIFIC:LLM能否辨别影响您偏好的特质?评估LLM中由性格驱动的偏好对齐

Tianyu Zhao, Siqi Li, Yasser Shoukry, Salma Elmalaki

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过实验发现,基于用户性格特征的偏好对齐可显著提升个性化问答准确性,提出PACIFIC数据集及自动检索框架,用于改进LLM回答生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06621 2026-04-09 cs.GL cs.LG stat.ML 70%

The Theorems of Dr. David Blackwell and Their Contributions to Artificial Intelligence

大卫·布莱克韦尔定理及其对人工智能的贡献

Napoleon Paxton

机构 * School of Information, University of California, Berkeley(加州大学伯克利分校信息学院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文综述了布莱克韦尔的三个重要定理及其对现代人工智能和机器学习的影响,包括马尔可夫链蒙特卡罗推断、自主机器人导航、生成模型训练等领域的应用。

Comments Survey article, 19 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03044 2026-04-09 cs.CL cs.AI 62%

JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency

JoyAI-LLM Flash: 通过令牌效率推进中等规模语言模型

Aichen Cai, Anmeng Zhang, Anyu Li, Bo Zhang, Bohua Cai, Chang Li, Changjian Jiang, Changkai Lu, Chao Xue, Chaocai Liang, Cheng Zhang, Dongkai Liu, Fei Wang, Guoqiang Huang, Haijian Ke, Han Lin, Hao Wang, Ji Miao, Jiacheng Zhang, Jialong Shi, Jifeng Zhu, Jingjing Qian, Junhui Luo, Junwu Xiong, Lam So, Liang Huang, Ming Ke, Mingyang Li, Panfeng Shi, Peng Hao, Qi Wang, Qian Lai, Qiaoqiao Yuan, Qingyu Yin, Qiong Cao, Qixiang Wang, Rongcheng Bian, Rongduo Han, Shaoqiang Zheng, Shi Hu, Shi Suo, Shijie Ren, Shijin Zhang, Shiying Fan, Shuai Xie, Tianyi Zhang, Wei Liu, Wentao Tan, Xianghan Meng, Xiaodong He, Xing Pan, Xiran Wang, Xuyang Peng, Ya Zhang, Yang Liu, Yangyang Duan, Yanxu Chen, Yicheng Gong, Yidan Huang, Yifei Liu, Yinhao Bai, Yongqiang Liu, Yuesong Zhang, Yuqi Zhang, Zerui Xie, Zhenfang Wang, Zhennan Shen, Zheyuan Liu, Zhuwei Zeng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出JoyAI-LLM Flash,一种高效的混合专家语言模型,通过平衡性能与令牌效率,在50B参数以下的范围内重新定义性能与效率的权衡。

Comments Xiaodong He is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06298 2026-04-09 cs.LG 57%

Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs

难度扩展的极限:在GRPO调优的SLMs中困难样本产生递减回报

Suraj Yadav, Siddharth Yadav, Parth Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文研究了在资源受限条件下,GRPO与LoRA应用于SLMs进行数学推理时,难度增加对准确率的影响,发现高难度样本的提升效果递减。

Comments Accepted at ICLR Workshop 2026 ICBINB

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 11 篇

2505.16055 2026-04-09 cs.RO cs.SY eess.SY 78%

Proactive Hierarchical Control Barrier Function-Based Safety Prioritization in Close Human-Robot Interaction Scenarios

主动式分层控制屏障函数基安全优先级在近距离人机交互场景中的应用

Patanjali Maithani, Aliasghar Arab, Farshad Khorrami, Prashanth Krishnamurthy

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出基于控制屏障函数的分层框架,用于在近距离人机交互中主动管理碰撞风险,通过实时安全约束优先级调整和深度感知实现安全协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07007 2026-04-09 cs.MA cs.AI cs.CY 62%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07253 2026-04-09 cs.CY cs.AI 62%

Designing Safe and Accountable GenAI as a Learning Companion with Women Banned from Formal Education

设计安全且问责的生成AI作为学习伙伴:女性被禁止接受正规教育

Hamayoon Behmanush, Freshta Akhtari, Ingmar Weber, Vikram Kamath Cannanure

机构 * Saarland Informatics Campus, Saarland University(萨尔兰信息学园区,萨尔兰大学) Computer Science Faculty, Parwan University(帕尔旺大学计算机科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 在限制性别和监控的环境中,女性因无法接受正规教育而面临安全与隐私风险,本文通过参与式设计研究,探讨生成AI在学习和就业中的作用及安全设计需求。

Comments This work has been accepted at ACM Conference on Fairness, Accountability, and Transparency 2026 as a full paper. Please cite the peer-reviewed version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06233 2026-04-09 cs.AI 57%

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules

盲性拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不合法的规则

Cameron Pattison, Lorenzo Manuali, Seth Lazar

机构 * Vanderbilt University(范德堡大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究探讨语言模型在面对不公正规则时的拒绝行为,发现模型在无安全风险情况下仍拒绝帮助,且其拒绝行为与规范推理能力脱节。

Comments 9 pages body text, 38 pages total, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29908 2026-04-09 cs.AI 57%

C-TRAIL: A Commonsense World Framework for Trajectory Planning in Autonomous Driving

C-TRAIL:用于自动驾驶轨迹规划的常识世界框架

Zhihong Cui, Haoran Tang, Tianyi Li, Yushuai Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Hong Kong Polytechnic University(香港理工大学) Aalborg University(奥尔堡大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出C-TRAIL框架,结合常识世界与信任机制,通过Recall-Plan-Update循环提升自动驾驶轨迹规划的可靠性,实验表明其在ADE、FDE和SR指标上均优于现有方法。

Journal ref IEEE Transactions on Vehicular Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04691 2026-04-09 cs.RO cs.AI cs.MA 57%

Before Humans Join the Team: Diagnosing Coordination Failures in Healthcare Robot Team Simulation

在人类加入团队之前:医疗机器人团队模拟中的协调失败诊断

Yuanchen Bai, Zijian Ding, Shaoyue Wen, Xiang Chang, Angelique Taylor

机构 * Cornell Tech(康奈尔科技校区) Department of Information Science, Cornell University(康奈尔大学信息科学系) University of Maryland, College Park(马里兰大学帕克分校) Imperial College London(伦敦帝国学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文通过模拟方法研究医疗机器人团队的协调失败问题,发现团队结构是协调的主要瓶颈,并提出安全的人机协作设计方法。

Comments Revised version incorporating new analysis and restructuring

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20906 2026-04-09 cs.CR cs.LG 57%

A Giant-Step Baby-Step Classifier For Scalable and Real-Time Anomaly Detection In Industrial Control Systems and Water Treatment Systems

大规模步长婴儿步分类器:用于工业控制系统和水处理系统中可扩展且实时的异常检测

Sarad Venugopalan, Sridhar Adepu

机构 * Swansea University(斯旺西大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于线性化非线性关系的异常检测方法,通过水处理测试平台验证,实现毫秒级异常检测,兼具速度与可解释性,准确率达97.72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09035 2026-04-09 cs.RO cs.AI cs.SY eess.SY 57%

ManeuverGPT Agentic Control for Safe Autonomous Stunt Maneuvers

ManeuverGPT 代理控制用于安全的自动驾驶特技动作

Shawn Azdam, Pranav Doma, Aliasghar Moj Arab

机构 * New York University(纽约大学) Tandon School of Engineering, New York University(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司) Azdam AI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出ManeuverGPT框架,利用大语言模型代理生成并执行高动态特技动作,通过迭代提示法优化车辆控制参数,实现安全的J-turn等特技动作执行。

Comments 6 Pages, Submitted to IROS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06972 2026-04-09 cs.RO cs.MA 50%

Differentiable Environment-Trajectory Co-Optimization for Safe Multi-Agent Navigation

可微环境-轨迹联合优化用于安全多智能体导航

Zhan Gao, Gabriele Fadini, Stelian Coros, Amanda Prorok

机构 * University of Cambridge(剑桥大学) Zurich University of Applied Sciences, ZHAW(苏黎世应用科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种可微环境-轨迹联合优化方法,通过双层优化问题提升多智能体导航的安全性和效率,实验验证了其在物流和交通场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06873 2026-04-09 cs.MA 50%

Generating Local Shields for Decentralised Partially Observable Markov Decision Processes

为去中心化部分可观测马尔可夫决策过程生成局部护盾

Haoran Yang, Nobuko Yoshida

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种护盾过程代数,用于在无通信的Dec-POMDP中指定安全全局行为,通过编译过程自动机和全局Mealy机,生成局部Mealy机以减少碰撞。

Comments In Proceedings PLACES 2026, arXiv:2604.05737

Journal ref EPTCS 444, 2026, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06804 2026-04-09 cs.DB 50%

LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO

LASER: 一种数据驱动的低成本高效SQL重写方法基于SQL-GRPO

Jiahui Li, Tongwang Wu, Yuren Mao, Rong Kang, Tieying Zhang, Yunjun Gao

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出LASER,一种数据驱动的SQL重写方法,通过构建SQL-MCTS大规模语料库和SQL-GRPO专用对齐策略,提升小模型在SQL优化中的执行效率和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2507.21540 2026-04-09 cs.CR cs.CV 75%

PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking

PRISM:基于图像序列操作的程序化推理用于LVLM劫持

Quanchen Zou, Zonghao Ying, Moyang Chen, Wenzhuo Xu, Yisong Xiao, Yakai Li, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出PRISM框架,通过分解有害指令为多个无害视觉组件,利用模型推理过程生成有害输出,有效提升LVLM劫持成功率。

Comments This version is withdrawn to consolidate the submission under the corresponding author's primary account. The most recent and maintained version of this work can be found at arXiv:2603.09246

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 4 篇

2604.06728 2026-04-09 cs.CV cs.AI cs.MM 57%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06723 2026-04-09 cs.SE cs.AI 57%

Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision

细粒度方法用于LLMs在自动代码修订中的置信度校准

Hong Yi Lin, Chunhua Liu, Haoyu Gao, Patanamon Thongtanunam, Christoph Treude

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出细粒度置信度校准方法,通过局部Platt缩放提升自动代码修订任务中模型的置信度校准效果,降低校准误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06552 2026-04-09 cs.CL 57%

To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs

说谎还是不说谎?研究LLMs在全球谎言传播中的偏见

Zohaib Khan, Mustafa Dogan, Ifeoma Okoh, Pouya Sadeghi, Siddhartha Shrestha, Sergius Justus Nyah, Mahmoud O. Mokhiamar, Michael J. Ryan, Tarek Naous

机构 * Fatima Fellowship(法蒂玛奖学金) Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 研究LLMs在多语言多地区传播虚假信息的行为,揭示低资源语言和低HDI国家中谎言传播的系统性差异,提出GlobalLies数据集以支持减少全球虚假信息传播的策略。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06375 2026-04-09 cs.AI 57%

SymptomWise: A Deterministic Reasoning Layer for Reliable and Efficient AI Systems

SymptomWise: 一种用于可靠和高效人工智能系统的确定性推理层

Isaac Henry, Avery Byrne, Christopher Giza, Ron Henry, Shahram Yazdani

机构 * University of California Los Angeles, David Geffen School of Medicine(加州大学洛杉矶分校大卫·格芬医学院) University of Southern California(南加州大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 SymptomWise通过分离语言理解与诊断推理,结合专家知识和确定性推理,提升AI系统可靠性与可解释性,初步验证在儿科神经病学案例中表现优异。

Comments 18 pages, 1 figure,

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 4 篇

2406.14966 2026-04-09 cs.CY cs.CR 79%

Towards trustworthy management of AIGC copyright: blockchain-enabled full lifecycle recording and multi-party auditing approach

面向可信的AIGC版权管理:基于区块链的全生命周期记录与多方审计方法

Jiajia Jiang, Moting Su, Fengshu Li, Xiangli Xiao, Yushu Zhang

专题命中 隐私与版权 :trustworthy(title,abstract);分类 cs.CY

AI总结 本文提出AIGC-Chain系统,通过区块链实现AIGC全生命周期数据记录与多方审计,解决现有解决方案在中间数据管理上的不足,提升版权确认与多方收益分配的可信度。

Journal ref Cybersecurity 9, 151 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06831 2026-04-09 cs.CR cs.AI 74%

Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation

面向隐私保护的大语言模型:通过对齐与适应实现文本-free推理

Jeongho Yoon, Chanhee Park, Yongchan Chun, Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(高丽大学计算机科学与工程系) Samsung Mobile eXperience Business(三星移动体验事业部)

专题命中 隐私与版权 :alignment(title);分类 cs.AI

AI总结 本文提出PPFT方法,通过客户端编码器与服务器投影模块的协同训练,实现无需传输原始文本的隐私保护推理,平衡隐私与模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06899 2026-04-09 cs.CR cs.LG cs.SE 57%

Data Leakage in Automotive Perception: Practitioners' Insights

自动驾驶感知中的数据泄露:从业者洞察

Md Abu Ahammed Babu, Sushant Kumar Pandey, Darko Durisic, Andras Balint, Miroslaw Staron

机构 * Volvo Cars(沃尔沃汽车) University of Gothenburg(哥德堡大学) Chalmers University of Technology(查尔姆斯理工大学) University of Groningen(格罗宁根大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 研究通过访谈探讨自动驾驶感知领域从业者对数据泄露的认知、经验及应对策略,揭示其作为社会技术协调问题的特性,强调需建立共享定义和跨角色沟通以提升ML可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26167 2026-04-09 cs.CV cs.CR 50%

Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication

高斯香农:基于通信的高精度扩散模型水印技术

Yi Zhang, Hongbo Huang, Liang-Jie Zhang

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 30 篇

2604.05172 2026-04-09 cs.AI 79%

ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces

ClawsBench: 评估LLM生产力代理在模拟工作区中的能力和安全性

Xiangyi Li, Kyoung Whan Choe, Yimin Liu, Xiaokun Chen, Chujun Tao, Bingran You, Wenbo Chen, Zonglin Di, Jiankai Sun, Shenghan Zheng, Jiajun Bao, Yuanli Wang, Weixiang Yan, Yiyuan Li, Han-chung Lee

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ClawsBench通过高保真模拟服务和结构化任务评估LLM代理在真实生产力场景中的能力与安全性,揭示了代理在多服务协作和安全关键场景中的表现及潜在风险。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05171 2026-04-09 eess.SY cs.AI cs.SY 79%

Towards provable probabilistic safety for scalable embodied AI systems

迈向可证明的可扩展具身AI系统的概率安全

Linxuan He, Lingxiang Fan, Qing-Shan Jia, Ang Li, Hongyan Sang, Ling Wang, Guanghui Wen, Jiwen Lu, Tao Zhang, Jie Zhou, Yi Zhang, Yisen Wang, Peng Wei, Zhongyuan Wang, Henry X. Liu, Shuo Feng

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) School of Computer, Liaocheng University(聊城大学计算机学院) Department of Automation, Southeast University(东南大学自动化学院) Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出可证明的概率安全范式,旨在解决具身AI系统在复杂环境中安全验证的挑战,通过结合可证明保证与渐进式达成概率安全边界,提升系统可行性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02642 2026-04-09 q-bio.NC cs.ET cs.LG cs.NE 79%

Spike-based alignment learning solves the weight transport problem

基于尖峰的对齐学习解决权重传输问题

Timo Gierlich, Andreas Baumbach, Akos F. Kungl, Kevin Max, Mihai A. Petrovici

机构 * Department of Physiology, Bern University(伯尔尼大学生理学系) Neural Computation Unit, Okinawa Institute of Science and Technology(冲绳科学技术大学院大学神经计算单元)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出基于尖峰的对齐学习方法,利用尖峰时间统计消除有效互惠连接间的不对称性,提升spiking网络在权重传输问题中的性能。

Comments 28 pages, 15 figures. Updated with a comparison to the STDWI algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24857 2026-04-09 cs.CL cs.CY 73%

Between Help and Harm: An Evaluation of Mental Health Crisis Handling by LLMs

在帮助与伤害之间:对LLM处理心理健康危机的评估

Adrian Arnaiz-Rodriguez, Miguel Baidal, Erik Derner, Jenn Layton Annable, Mark Ball, Mark Ince, Elvira Perez Vallejos, Nuria Oliver

机构 * ELLIS Alicante(ELLIS 阿利坎特) CTU in Prague(捷克布拉格理工大学) School of Health Science, The University of Nottingham(诺丁汉大学健康科学学院) School of Psychology, Public Health and Social Care, Derby University(德比大学心理学、公共卫生与社会关怀学院) Mental Health Practitioner, Social Worker & Independent Scholar(心理健康从业者、社会工作者与独立学者) School of Computer Science & School of Medicine, The University of Nottingham(诺丁汉大学计算机科学学院与医学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文评估了LLM在处理心理健康危机时的性能,提出六类危机分类、2252个示例数据集及临床评估协议,发现部分模型在自残和自杀类别中存在不安全输出,强调需加强安全防护和上下文感知能力。

Comments Accepted for publication in JMIR Mental Health. DOI: 10.2196/88435

详情

展开后加载摘要…

URL PDF HTML 收藏