arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-17 至 2026-07-17 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2607.14126 2026-07-17 cs.AI cs.CL cs.LG 新提交 67%

Interpretable Language Model for Closed-Loop Type 1 Diabetes Control

用于闭环1型糖尿病控制的可解释语言模型

Maya Sarkar

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14185 2026-07-17 cs.LG cs.AI 新提交 62%

Closed-Loop Knowledge Dynamics: An Operational Framework for Saturation and Escape

闭环知识动力学:饱和与逃逸的操作框架

Xuening Wu, Shan Yu, Shenqin Yin

机构 * Pfizer(辉瑞公司) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究闭环知识系统饱和及逃逸问题,引入三级操作框架,利用李雅普诺夫漂移条件等刻画系统动态,通过案例展示反馈影响,建立了稳定性工具、干预效果与跨域诊断间的操作联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14110 2026-07-17 cs.CL cs.AI 新提交 62%

MAPS: Modeling Co-Existing Subjective Perspectives and Shared Meaning in Multi-Agent Cognitive Dialogue

MAPS:在多智能体认知对话中建模共存的主观视角和共享意义

Molood Arman, Clément Bonnafous

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对当前AI对话系统问题,提出MAPS框架,通过领域加权配置文件、动态GRU记忆和令牌级注意力,让智能体保持个性化推理并趋向共享意义,在多数据集评估中支持语义对齐且不损主观性,为可解释对话系统发展提供路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 57%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14190 2026-07-17 cs.LG cs.IR stat.ML 新提交 57%

A Temporal Machine Learning-Based Time-to-Event Model for Predicting ALS Progression and Healthcare Utilization

基于时间序列机器学习的事件发生时间模型预测肌萎缩侧索硬化症进展及医疗保健利用情况

Zongliang Yue, Qi Li, Terry Heiman-Patterson, Frank Bearoff, Zhaohui Qin, Huanmei Wu

机构 * Harrison College of Pharmacy, Auburn University(奥本大学哈里森药学院) Fisk University(菲斯克大学) Lewis Katz School of Medicine, Temple University(天普大学刘易斯·卡茨医学院) Emory University(埃默里大学) Barnett College of Public Health, Temple University(天普大学巴尼特公共卫生学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究针对ALS预测临床有意义事件的挑战,开发受数字孪生启发的事件发生时间框架,整合多源数据,经聚类、建模等确定功能域及预测因素,构建TTE模型,能生成个性化生存曲线,为ALS相关决策支持提供可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14093 2026-07-17 cs.AI 新提交 57%

Intelligent Three Level Learning Architecture for Autonomous UAV Swarms in Search and Rescue

用于自主无人机群搜索和救援的智能三级学习架构

Oleksii Bychkov

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文针对无人机群搜索和救援提出智能三级学习架构,集成三种学习机制,通过架构契约形式化,引入群体元认知,有进展函数和主整合定理,解决了现有分层强化学习方法的五个基本限制。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23667 2026-07-17 cs.SD cs.AI eess.AS 版本更新 57%

Echoes: A semantically-aligned music deepfake detection dataset

回声:一种语义对齐的音乐深度伪造检测数据集

Octavian Pascu, Dan Oneata, Horia Cucu, Nicolas M. Muller

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰亚西夫技术大学布加勒斯特分校) Fraunhofer AISEC(弗劳恩霍夫信息安全研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Echoes数据集通过语义对齐提升音乐深度伪造检测的鲁棒性,证明提供者多样性与语义对齐能提升检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14870 2026-07-17 physics.med-ph 新提交 50%

One-for-All Adaptive Radiotherapy Planning Agent: A Foundation Framework for Daily CBCT-guided Radiotherapy

一适用于所有情况的自适应放射治疗计划智能体:基于每日锥束CT引导的放射治疗基础框架

Shaoyan Pan, Kirk Jon Luca, Yuan Gao, Shansong Wang, Mingzhe Hu, Ryan Sanford, Mojtaba Safari, Justin Roper, Zhen Tian, Tonghe Wang, Xiaofeng Yang

专题命中 其他安全 :alignment(abstract)

AI总结 介绍一适用于所有情况的自适应放射治疗计划智能体,它基于统一基础模型,能从每日锥束CT执行在线自适应计划,自主预测关键组件并设计临床计划,经多数据集评估,其准确性和计划质量与临床方案相当,为放射治疗带来新机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-07-17 cs.CV 版本更新 50%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13348 2026-07-17 cs.LO math.LO 版本更新 50%

Adequate Losses via Quantitative Linear Logic

量化线性逻辑

Matteo Capucci, Robert Atkey, Charles Grellois, Ekaterina Komendantskaya, Matthew Daggitt

专题命中 其他安全 :safety(abstract)

AI总结 本文提出量化序列演算,结合实数上的加法与乘法性质及序列演算修订,解决线性与模糊逻辑中加法连接词的软语义问题,并展示其在扩展残余软格中的完备性。

Comments Once 'Quantitative Linear Logic', the ML applications have been outlined more clearly and the exposition tightened. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏