arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-10 至 2026-07-10 共收录 36 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2607.08034 2026-07-10 cs.CL cs.AI cs.CY 新提交 82%

PLURAL: A Global Dataset for Value Alignment

PLURAL:一个用于价值对齐的全球数据集

Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究针对大语言模型反映西方价值观问题,引入基于IVS的PLURAL数据集,通过两阶段管道生成偏好三元组,经三种方式评估,结果显示其含价值引导可学习信号,能为多元对齐提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08257 2026-07-10 cs.AI 新提交 70%

MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters

精神病院:一个用于评估精神科临床问诊的虚拟环境

Yuming Yang, Xiao Sun, Yuanwei Zou, Zhengxiao Wu, Yun Chen, Jiang Zhong, Haoyang Zeng, Jingwang Huang, Kaiwen Wei

机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Computer Science, Hunan University(湖南大学计算机科学学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 研究针对大语言模型在精神科临床问诊评估不足的问题,引入MentalHospital虚拟环境,实例化S.O.A.P.工作流程,用双轨协议评估,开发MentalEval,经测试其具有临床保真度且与专家高度一致,指出大语言模型在精神状态评估上落后临床医生。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2607.07766 2026-07-10 cs.AI 新提交 83%

Alignment Plausibility: A New Standard for Assuring AI in Healthcare

对齐合理性:确保医疗保健领域人工智能的新标准

Gwydion Williams, Sara Zannone, Bilal A Mateen

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在医疗保健领域的安全问题,提出需在价值规范、训练、监督三层面进行对齐以实现结构安全,进而产生对齐合理性这一监管结构,为论证AI与健康结果的关系提供方式。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08409 2026-07-10 cs.CL cs.AI 新提交 62%

When Synthetic Speech Is All You Have: Better Call GRPO

当你只有合成语音时:最好调用GRPO

Shashi Kumar, Yanis Labrak, Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08066 2026-07-10 cs.AI cs.LG 新提交 62%

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

说服攻击会降低思维链监测的有效性

Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky, Tanush Chopra, Victoria Krakovna

机构 * LASR Labs(LASR实验室) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08054 2026-07-10 cs.LG cs.AI 新提交 62%

Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

谁来分析分析器?使用结构化元安全分析过程的自验证大语言模型风险分析

Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型辅助安全分析工具自身缺乏分析的问题,提出结构化元安全分析过程,通过运行元安全分析过程推导治理章程,包含21条工具原则和8条元安全原则,还报告了自推导等四个发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08028 2026-07-10 cs.AI cs.CL cs.SE 新提交 62%

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

从提示到契约:用于可审计企业大语言模型代理的 harness 工程

Joongho Ahn, Moonsoo Kim

机构 * AI Leadership Research Center(人工智能领导力研究中心)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对企业大语言模型应用从原型到产品化的需求,提出 harness 工程方法,在韩国企业数据切片上实例化并评估三个问题,包括契约保留、模型替换检查及代码执行效果,形成可将原型转为可审计应用的工程模式。

Comments 32 pages, 6 figures, 16 tables. Reference implementation and evaluation artifacts: https://github.com/hammerbaki/enterprise-llm-agent-harness (archived at https://doi.org/10.5281/zenodo.21269426)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 57%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 50%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 安全训练 :safety(abstract)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2607.07903 2026-07-10 cs.CR cs.AI 新提交 70%

Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

通过内部归因图对大语言模型越狱进行机制性可解释性研究

Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang

机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2607.08147 2026-07-10 cs.CR cs.AI 新提交 79%

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 1 篇

2607.07760 2026-07-10 cs.AI cs.SI 新提交 57%

Adversarial Social Epistemology for Assemblies of Humans and Large Language Models

人类与大语言模型集合的对抗性社会认识论

Mihnea C. Moldoveanu, Joel A. C. Baum

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 研究人类与大语言模型集合在密集互动交流场景中的信息问题,提出对抗性社会认识论,借助语言、机制及基于认知网络的 machinery 来分析、破坏信任并审计纠正信任违规。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2607.08282 2026-07-10 cs.CR cs.AI cs.MA 新提交 57%

Multi-Agent Firewall Architecture for Privacy Protection of Sensitive Data in Interactions with Language Models

用于在与语言模型交互中保护敏感数据隐私的多智能体防火墙架构

Hugo García Cuesta, Pablo Mateo Torrejón, Alfonso Sánchez-Macián

机构 * Universidad Carlos III de Madrid(卡洛斯三世大学)

专题命中 隐私与版权 :prompt injection(abstract);分类 cs.AI

AI总结 针对大语言模型集成到工作流程中缺乏保障措施的风险,提出开源多智能体防火墙架构,结合浏览器扩展和代理拦截流量,通过混合方法防止数据泄漏,分层架构可跨异构环境部署,最佳配置下F1分数达94.93%。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 14 篇

2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 84%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 81%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08038 2026-07-10 cs.AI 新提交 79%

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架

Fan Ma, Mauro Giuffrè, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu

机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) Università degli Studi di Trieste(的里雅斯特大学) Vanderbilt University(范德堡大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 79%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07762 2026-07-10 cs.LG math.OC 新提交 79%

Trustworthy Machine Learning through the Lens of Combinatorial Optimization: Survey and Research Perspectives

从组合优化视角看可信机器学习:综述与研究展望

Thibaut Vidal, Julien Ferry

机构 * CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 探讨如何从组合优化视角实现可信机器学习,回顾并综合其与组合优化交叉领域进展,涵盖训练及训练后多任务,指出组合优化公式比纯启发式方法更具优势,虽有挑战,但在可信机器学习系统设计和部署中作用将增大。

Comments 67 pages, 16 mathematical highlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07881 2026-07-10 cs.SE cs.CR cs.LG 新提交 77%

Functional and Secure Code Generation with Task Vectors

使用任务向量进行功能和安全代码生成

Felix Wang, Anudeep Das, Mei Nagappan, N. Asokan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 安全评测 :alignment(abstract);harmlessness(abstract);trustworthy(abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08215 2026-07-10 cs.DC 新提交 67%

On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend

论非 GPU 人工智能加速器在大模型推理中的局限性:基于华为昇腾的 MoE 和多模态服务的实地研究

Zheng Yu

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 研究非 GPU 人工智能加速器在大模型推理中的局限性,通过在华为昇腾系统上部署两个大型推理工作负载进行实地研究,总结平台八类限制及原因,量化相关指标,为评估或操作此类加速器的团队提供可重复参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08651 2026-07-10 cs.LG cs.DC 新提交 57%

Secure Decentralized Federated Learning via Gossip and Virtual Voting

通过八卦和虚拟投票实现安全的去中心化联邦学习

Amirhossein Taherpour, Xiaodong Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究如何实现安全的去中心化联邦学习,提出gspDAG-FL框架,通过八卦历史达成共识,结合多种验证方法提高弹性,经实验验证其在减少协调瓶颈、提高吞吐量及检测无效起源等方面效果良好,学习质量接近基于验证的账本FL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08602 2026-07-10 cs.AI 新提交 57%

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance

迈向肝细胞癌的精准治疗:用于风险分层和治疗指导的临床推理大语言模型

Peng Cui, Jitao Wang, Siyan Xue, Yao Huang, Haoming Xia, Dong Li, Dengxiang Liu, Weilin Wang, Liping Liu, Leida Zhang, Yunfu Cui, Tao Peng, Daolin Ji, Haitao Zhao, Wei Zhang, Xiaojuan Wang, Weijie Ma, Zongren Ding, Jinlong Li, Yuan Ding, Jiajing Zhao, Zhiyu Chen, Chengkun Yang, Ziyue Huang, Jiaqi Liu, Fusheng Liu, Yang Zhou, Xiaojuan Wang, Zhongquan Sun, Shiyun Bao, Xiaojun Wang, Ming Yang, Guangxin Li, Bin Shu, Yong Liao, Hongxuan Li, Yao Tang, Shizhong Yang, Yongyi Zeng, Yufeng Yuan, Yinpeng Dong, Jihui Hao, Jun Zhu, Jiahong Dong

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对肝细胞癌治疗问题,提出HCC-STAR临床推理大语言模型。通过处理电子病历叙述输出风险分层、治疗方案等。经多中心队列验证,性能领先,能助医生决策,是可靠的肝细胞癌风险分层和精准治疗决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 57%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 57%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 50%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08274 2026-07-10 cs.HC cs.SE 新提交 50%

How Analysts Use AI in High-Stakes Crime Linkage: An Industrial Study

分析师如何在高风险犯罪关联中使用人工智能:一项行业研究

Jessica Woodhams, Amy Burrell, Wanyin Li, Fahim Ahmed, Matthew Tonkin, Jan Lemeire, Arkady Konovalov, Steven Frisson, Mark Webb, Sarah Galambos, Vesna Nowack, Dalal Alrajeh

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨分析师在高风险犯罪关联中如何用AI,通过与英国执法机构合作开发工具并进行混合方法可用性研究,发现分析师有选择地用AI预测且常验证,还关注模型特征,强调AI决策支持工具要整合解释与传统方法及现场评估的重要性。

Comments 12 pages, 6 figures, FSE Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 50%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 1 篇

2607.06269 2026-07-10 cs.AI cs.CL 新提交 62%

From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution

从应用层模拟到原生元架构:结构张力作为异构人工智能进化的内生驱动因素

Heting Mao

机构 * Shanghai Lixin University of Accounting and Finance(上海立信会计金融大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型无状态需应用层模拟的问题,提出理论框架,引入结构张力、离线循环回路、推理时可塑性三种机制,使模型实例能演化出不同拓扑结构,构成异构智能生态,重新定位治理为架构智能主要标准。

Comments 17 pages, 1 equation, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他安全 7 篇

2607.08043 2026-07-10 cs.SE cs.AI 新提交 79%

Aleena: Alignment Agent for Research Software Engineering Collaborations

Aleena:用于研究软件工程协作的对齐代理

Kshitij Dani, Cordero Core, Landung Setiawan, Carlos Garcia Jurado Suarez, Anshul Tambay, Vani Mandava, Anant Mittal

机构 * eScience Institute(eScience研究院) University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。

Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏