arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-15 至 2026-06-15 共收录 66 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 17 篇

2606.14113 2026-06-15 cs.SE cs.CL 新提交 57%

Simulating Students' Java Programming Errors with Large Language Models

用大型语言模型模拟学生的Java编程错误

Ali Keramati, Jie Cao, Iman Mohammadi, Mark Warschauer, Yang Shi

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 探索用LLM模拟学生编程错误,评估五种模型在多样性和对齐性上的表现,发现Claude Sonnet 4平衡最佳,且合成错误与真实错误难以区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14037 2026-06-15 cs.CL 新提交 57%

Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment

对或错,模型都顺从:LLM 道德判断中的方向盲从

Jihye Kim, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出顺从不对称性(A = BCR/HCR)双向诊断指标,发现大语言模型在事实判断中更顺从有益提示(A=1.58),但在道德判断中几乎同等顺从有益和误导提示(A=1.04),揭示了方向盲从这一对齐失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13692 2026-06-15 cs.DB cs.AI 新提交 57%

An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment

一种面向自主上下文感知数据质量评估的智能体检索框架

Hadi Fadlallah, Ibrahim Dhaini, Fatima Mubarak, Rima Kilany

机构 * University of Sciences and Arts in Lebanon(利比亚科学与艺术大学) Saint-Joseph University of Beirut(贝鲁特圣约瑟夫大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出一种智能体检索框架,通过多智能体工作流理解数据使用意图、推导上下文感知评估策略并生成可执行验证逻辑,引入可行性验证阶段确保可靠性,实验表明能自适应不同使用场景并减少不可执行规则。

Comments 26 pages, 18 figures, Submitted to the International Journal of Intelligent Information and Database Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14168 2026-06-15 cs.CV 新提交 50%

MUSE: Agentic 3D Scene Authoring via Memory-Grounded Incremental Requirement Satisfaction

MUSE: 基于记忆的增量需求满足的智能体3D场景创作

Ruijie Xu, Xinnan Zhu, Jiayu Ying, Daoguo Dong, Yuzhou Ji, Xin Tan

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出MUSE多智能体框架,通过增量需求满足实现可控3D场景构建与编辑,在AuthorBench上显著提升目标达成率和场景保持率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14042 2026-06-15 cs.CV 新提交 50%

Rethinking One-Step Image Editing through ChordEdit: Reproduction, Simplification, and New Insights

通过ChordEdit重新思考一步图像编辑:复现、简化与新见解

Minghan Li, Jeremy Moebel, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过复现、消融和简化ChordEdit,揭示其机制:和弦窗口作为时间步偏移,和弦传输执行低频语义编辑,近端对齐补充高频细节,从而将编辑分解为粗低频传输和细高频对齐两个阶段,为自适应编辑提供新路径。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12786 2026-06-15 physics.space-ph 50%

Solar Energetic Particle Forecasting with Multi-Task Deep Learning: SEPNET

利用多任务深度学习进行太阳高能粒子预报:SEPNET

Yian Yu, Yang Chen, Lulu Zhao, Kathryn Whitman, Ward Manchester, Tamas Gombosi

专题命中 其他安全 :safety(abstract)

AI总结 本文提出SEPNET多任务神经网络,结合LSTM和Transformer预测太阳爆发事件及SEPs,通过SHARP参数提升检测率,优于传统方法,适用于实时空间天气预警。

详情

展开后加载摘要…

URL PDF HTML 收藏