arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-11 至 2026-06-11 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2606.11218 2026-06-11 cs.CY cs.AI 新提交 62%

An Ethical eValuation Agent (EeVA): Results of a Proof-of-Concept Test on a Prototype Agentic-like Workflow to Assist Ethical Deliberations

伦理评估代理(EeVA):在原型类代理工作流中辅助伦理审议的概念验证测试结果

Stephen Milford, B. Zara Malgir, Miguel Vazquez

机构 * Institute for Biomedical Ethics, Basel University(伦理研究所,巴塞尔大学) North-West University(北开普大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出基于LLM的类代理工作流EeVA,通过10种伦理框架评估用例,生成结构化评估与综合,促进伦理反思而非给出绝对答案,在三个案例中验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11198 2026-06-11 cs.CL cs.AI 新提交 62%

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

结构注意力税:检索格式如何劫持上下文学习而与内容无关

Yuqi Zhang, Di Zhang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究发现知识图谱三元组因其格式结构比自然语言吸引2-3倍注意力,压缩演示注意力达42%,并提出了分解注意力为语义与结构成分的框架及缓解策略。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13841 2026-06-11 cs.CY cs.AI cs.HC 62%

Cultural Dimensions of AI Perception: Charting Expectations, Risks, Benefits, Tradeoffs, and Value in Germany and China

人工智能感知的文化维度:在德国和中国绘制期望、风险、收益、权衡与价值

Philipp Brauner, Felix Glawe, Gian Luca Liehner, Luisa Vervier, Martina Ziefle

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过比较德国和中国公众对人工智能的期望、风险与收益的权衡,揭示文化差异对AI接受度的影响,为AI与社会价值观的对齐提供见解。

Journal ref Acta Psychologica (2026), volume 268, article 107094

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11835 2026-06-11 cs.HC cs.AI 新提交 57%

Designing AI-Supported Focus Groups: A Role x Modality Playbook

设计AI支持的焦点小组:角色×模态剧本

Zhiqing Wang, Steven Dow

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对焦点小组资源密集且对引导高度敏感的问题,提出按AI角色(工具、联合主持、主持)和模态(文本、语音、具身)组织的剧本,并分析交互权衡与开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12258 2026-06-11 cs.CV 新提交 50%

Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning

连接昼夜:基于协同提示与原型学习的无监督跨域重识别

Jiyang Xu, Rui Liu, Hang Dai

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出无监督昼夜重识别框架,结合提示学习和原型表示学习,通过两阶段训练实现无标注跨域身份关联,性能媲美全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07833 2026-06-11 cs.RO 版本更新 50%

Harnessing Embodied Agents: Runtime Governance for Policy-Constrained Execution

利用具身体 agent:运行时治理以实现政策约束执行

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出了一种政策约束执行框架,通过将 agent 认知与执行监督分离,增强了具身体 agent 的运行时治理能力,通过 1000 次随机模拟验证,显著提高了对未经授权动作的拦截率和系统恢复成功率。

Comments 36 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏