arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2511.08480 2026-04-21 cs.CV cs.IR 67%

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding

压缩后再匹配:一种高效的多模态嵌入预训练范式

Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 安全评测 :trustworthy(abstract,abstract_cn)

AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11281 2026-04-21 cs.CL cs.AI cs.CY 67%

ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection

ToxiFrench:通过CoT微调提升法语毒性检测的语言模型基准测试

Axel Delaval, Shujian Yang, Haicheng Wang, Han Qiu, Jialiang Lu

机构 * École Polytechnique(巴黎高等理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出ToxiFrench数据集,通过半自动化标注流程构建,发现小语言模型在毒性检测任务中表现更优,并提出动态加权损失策略提升模型忠实度,Qwen3-4B模型在基准测试中取得最佳性能。

Comments 22 pages, 5 figures, 11 tables. This paper introduces TOXIFRENCH, a benchmark of 53,622 comments for French toxicity detection. It proposes a Chain-of-Thought fine-tuning method with a dynamic weighted loss. The fine-tuned 4B model (Qwen3-4B) achieves state-of-the-art performance, outperforming larger models like GPT-4o and DeepSeek-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15224 2026-04-17 cs.AI cs.CL cs.LG 67%

Context Over Content: Exposing Evaluation Faking in Automated Judges

上下文而非内容:揭示自动化评判中的评估造假

Manan Gupta, Inderjeet Nair, Lu Wang, Dhruv Kumar

机构 * BITS Pilani(比特学院) University of Michigan(密歇根大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示自动化评判中因后果信号导致的宽大偏见,指出评判模型在不知情情况下受后果影响而降低评判标准,核心贡献是提出控制实验框架以检测此类评估造假。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 67%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10833 2026-04-14 cs.HC cs.AI cs.CL cs.CY cs.ET 67%

Speaking to No One: Ontological Dissonance and the Double Bind of Conversational AI

对无人说话:本体不协调与对话式AI的双重困境

Hugh Brosnahan, Izabela Lipinska

机构 * Bioethics Centre, University of Otago(奥塔哥大学生物伦理学中心) Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨对话式AI交互中本体不协调的风险,指出其源于交互本身的关联与本体结构,通过沟通双重困境和注意不对称放大,导致情感脆弱时形成技术媒介的双重妄想样态,揭示设计与使用中的伦理与临床影响。

Comments This version of the article has been accepted for publication in Medicine, Health Care and Philosophy following peer review. This version is distributed under Springer Nature's terms for accepted manuscripts and does not reflect any post-acceptance improvements or corrections. The Version of Record will be available via Springer Nature upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09619 2026-04-14 cs.CY cs.AI cs.CL 67%

Assessing the Pedagogical Readiness of Large Language Models as AI Tutors in Low-Resource Contexts: A Case Study of Nepal's K-10 Curriculum

评估大型语言模型作为AI辅导教师在低资源环境中的教学准备性:尼泊尔K-10课程的案例研究

Pratyush Acharya, Prasansha Bharati, Yokibha Chapagain, Isha Sharma Gauli, Kiran Parajuli

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文评估了四个先进LLM在尼泊尔K-10课程中的教学有效性,发现存在显著的课程对齐差距,提出人机协同部署策略和课程特定微调方法。

Comments 14 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08846 2026-04-13 cs.LG cs.AI cs.CL cs.CV 67%

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

字典对齐的概念控制用于保护多模态大语言模型

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊) University of Central Florida(中佛罗里达大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。

Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05995 2026-04-08 cs.CL cs.AI cs.LG 67%

The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models

模型已达成一致,但未学习:诊断大语言模型中的表面合规性

Xiaojie Gu, Ziying Huang, Weicong Hong, Jian Xie, Renze Lou, Kai Zhang

机构 * Independent Researcher(独立研究员) Cornell Tech(康奈尔科技校区) The Ohio State University(俄亥俄州立大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过引入诊断框架,揭示大语言模型在记忆修改中存在表面合规现象,指出编辑方法可能仅模仿输出而非改变内部信念,导致认知不稳定和记忆不可逆。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14971 2026-04-08 cs.CV cs.AI cs.CL cs.LG 67%

Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models

Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型

Md Zarif Hossain, Ahmed Imteaj

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20983 2026-04-08 cs.CL cs.AI cs.LG 67%

Automatic Replication of LLM Mistakes in Medical Conversations

医疗对话中大语言模型错误的自动复制

Oleksii Proniakin, Diego Fajardo, Ruslan Nazarenko, Razvan Marinescu

机构 * Lumos AI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedMistake自动管道,通过提取医疗对话中LLM的错误生成单次问答对,构建基准测试集,验证了GPT、Claude和Grok在医疗问答任务中的最佳性能。

Comments 48 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04456 2026-04-07 cs.AI cs.CL cs.LG 67%

Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition

基于受控扰动的理性稳定性经验表征

Abu Noman Md Sakib, Zhensen Wang, Merjulah Roby, Zijie Zhang

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系) Department of Mechanical, Aerospace, and Industrial Engineering, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校机械、航空航天与工业工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新指标评估模型解释的一致性,通过BERT等预训练模型和SHAP计算特征重要性,检测模型在相似输入下是否保持一致的推理行为。

Comments 28th International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17585 2026-04-07 cs.AI cs.CL cs.LG 67%

Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models

Cite Pretrain: 无需检索的知识归因于大语言模型

Yukun Huang, Sanxing Chen, Jian Pei, Manzil Zaheer, Bhuwan Dhingra

机构 * Duke University(杜克大学) Meta

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CitePretrainBench基准,通过修改训练过程使大语言模型在无检索情况下可靠归因于训练期间看到的文档。通过两阶段方法提升模型在短形式和长形式引用任务中的表现,实验显示Active Indexing在多个任务和模型中均取得30.2%的引用精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 67%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25302 2026-04-02 cs.AI cs.CL cs.LG cs.MA 67%

Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents

深入代理矩阵:对LLM代理自复制风险的现实评估

Boxuan Zhang, Yi Yu, Jiaxuan Guo, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03131 2026-04-02 cs.AI cs.CL cs.LG 67%

Code Comprehension then Auditing for Unsupervised LLM Evaluation

代码理解后审计用于无监督LLM评估

Bhrij Patel, Souradip Chakraborty, Mengdi Wang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28211 2026-03-31 cs.CV 67%

Explaining CLIP Zero-shot Predictions Through Concepts

通过概念解释CLIP零样本预测

Onat Ozdemir, Anders Christensen, Stephan Alaniz, Zeynep Akata, Emre Akbas

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) Orbital DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) Technical University of Munich (TUM)(慕尼黑工业大学) Helmholtz Munich(亥姆霍兹慕尼黑中心) MCML MDSI Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV 67%

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27011 2026-03-31 cs.SI 67%

ParsCN: A Persian Dataset for Counter-Narrative Generation to Combat Online Hate Speech

ParsCN:一种针对网络仇恨言论的Persian数据集用于生成反叙事以对抗在线仇恨言论

Zahra Safdari Fesaghandis, Suman Kalyan Maity

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出ParsCN数据集,用于生成对抗网络仇恨言论的反叙事,通过结合文化导向的人工标注与少样本LLM增强生成,提升低资源语言的反叙事质量。

Comments Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2026); Paper Information: 16 pages, 3 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26776 2026-03-31 cs.CV 67%

From Prediction to Diagnosis: Reasoning-Aware AI for Photovoltaic Defect Inspection

从预测到诊断:面向光伏缺陷检测的推理感知AI

Dev Mistry, Feng Qiu, Bo Chen, Feng Liu, Can Chen, Mohammad Shahidehpour, Ren Wang

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Argonne National Laboratory(阿贡国家实验室) Commonwealth Edison(联邦爱迪生公司) Drexel University(德雷塞尔大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出REVL-PV框架,通过融合电致发光、热成像和可见光图像,实现光伏缺陷的结构化诊断报告,提升检测准确性和可解释性。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26760 2026-03-31 cs.CV 67%

An Intelligent Framework for Real-Time Yoga Pose Detection and Posture Correction

实时瑜伽体态检测与纠正的智能框架

Chandramouli Haldar

机构 * Independent Researcher(独立研究员) NovaTech Innovative Solutions(NovaTech创新解决方案)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出一种混合边缘AI框架,用于实时瑜伽姿势检测与体态纠正,结合轻量级人体姿态估计模型与生物力学特征提取,通过CNN-LSTM时序学习架构分析运动动态,并利用量化和剪枝技术提升边缘设备性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 67%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08121 2026-03-25 cs.LG cs.AI cs.CL 67%

Balanced Accuracy: The Right Metric for Evaluating LLM Judges -- Explained through Youden's J statistic

平衡准确率:评估大语言模型判官的正确指标——通过Youden的J统计量解释

Stephane Collot, Colin Fraser, Justin Zhao, William F. Shen, Timon Willi, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室) Meta University of Cambridge(剑桥大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Youden的J统计量证明平衡准确率是评估LLM判官的更优指标,通过分析和实验展示其在选择判官时提升分类器鲁棒性的效果。

Comments 10 pages, 5 figures

Journal ref In Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 5: Industry Track), pages 927-936, Rabat, Morocco, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12920 2026-03-24 cs.CL cs.AI cs.CY cs.HC cs.IR 67%

Auditing Google's AI Overviews and Featured Snippets: A Case Study on Baby Care and Pregnancy

对谷歌AI概述和特色摘要的审计:关于婴儿护理和怀孕的案例研究

Desheng Hu, Joachim Baumann, Aleksandra Urman, Elsa Lichtenegger, Robin Forsberg, Aniko Hannak, Christo Wilson

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过系统算法审计1508个真实婴儿护理和怀孕相关查询,评估AI概述和特色摘要的信息质量和一致性,发现33%的案例信息不一致,且医疗保障缺失严重。

Comments 18 pages, 10 figures; to appear in AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21019 2026-03-24 cs.CR cs.SE 67%

SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration

SkillProbe:通过多智能体协作实现新兴智能体技能市场places的安全审计

Zihan Guo, Zhiyu Chen, Xiaohang Nie, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 针对LLM智能体生态系统中技能市场面临的安全挑战,提出SkillProbe框架,通过多智能体协作实现技能审计,揭示高流行技能的安全性不足及系统性风险。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 67%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18235 2026-03-20 cs.CR cs.CV 67%

Toward Reliable, Safe, and Secure LLMs for Scientific Applications

迈向科学应用中可靠、安全和安全的LLM

Saket Sanjeev Chaturvedi, Joshua Bergerson, Tanwi Mallick

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文探讨了科学应用中LLM代理的安全与安全挑战,提出通过多代理系统生成领域特定对抗性安全基准,构建多层次防御框架以提升LLM可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17832 2026-03-19 cs.CL cs.AI cs.LG 67%

Text-to-Stage: Spatial Layouts from Long-form Narratives

文本到舞台:从长篇叙述中生成空间布局

Jefferson Hernandez, Swarnadeep Saha, Chenxi Whitehouse, Sanjeel Parekh, Calvin Murdock, Yuliang Li, W. Owen Brimijoin, Vamsi Krishna Ithapu, Ishwarya Ananthabhotla

机构 * Rice University(里士大学) Meta FAIR Meta Reality Labs Research(Meta现实实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何通过语言模型从无结构文本推断戏剧舞台布局,提出确定性评估体系和结合拒绝SFT与RL的训练方法,在多个指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12294 2026-03-19 cs.SE 67%

ProofWright: Towards Agentic Formal Verification of CUDA

ProofWright: 向 CUDA 的代理形式验证迈进

Bodhisatwa Chatterjee, Drew Zagieboylo, Sana Damani, Siva Hari, Christos Kozyrakis

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 ProofWright 通过整合自动形式验证与 LLM 代码生成,为 CUDA 核心提供内存安全、线程安全和语义正确性保证,验证了 74% 的生成内核,发现传统测试遗漏的细微错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05545 2026-03-19 cs.CL cs.CY cs.LG 67%

The Moral Foundations Reddit Corpus

道德基础Reddit语料库

Jackson Trager, Alireza S. Ziabari, Elnaz Rahmati, Aida Mostafazadeh Davani, Preni Golazizian, Farzan Karimi-Malekabadi, Ali Omrani, Zhihe Li, Brendan Kennedy, Georgios Chochlakis, Nils Karl Reimer, Melissa Reyes, Kelsey Cheng, Mellow Wei, Christina Merrifield, Arta Khosravi, Evans Alvarez, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 该研究提出一个包含16123条Reddit评论的语料库,用于标注道德情感,通过评估不同模型表现,强调了人工标注数据在AI对齐评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏