arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-07 至 2026-07-07 共收录 187 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 8 篇

2601.04569 2026-07-07 cs.CE 版本更新 67%

Industrial Data-Service-Knowledge Governance: Toward Integrated and Trusted Intelligence

工业数据-服务-知识治理:迈向集成与可信智能

Hailiang Zhao, Ziqi Wang, Daojiang Hu, Mingyi Liu, Jiahui Zhai, Kai Di, Xinkui Zhao, Zhongjie Wang, Jianwei Yin, Albert Zomaya, MengChu Zhou, Shuiguang Deng

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract)

AI总结 针对人工智能等融合加速工业智能发展但治理机制碎片化问题,提出TRISK框架,基于五维信任模型,综合多研究等探讨数据、服务、知识治理,还讨论实施模式等并勾勒未来研究路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05163 2026-07-07 cs.CY cs.AI 新提交 62%

Open Problems in AI Incident Governance

AI事件治理中的开放问题

Harleen Kaur Sidhu, Rebecca Scholefield, Nour Annan, Kevin Hernandez, Isabel Nieh Hou, Abdulrahman Alshaikhi, Ze Shen Chin, Rokas Gipiškis

机构 * Independent(独立) Sorbonne University(索邦大学) Rice University(里奇大学) Columbia University(哥伦比亚大学) AI Standards Lab(人工智能标准实验室) Vilnius University(维尔纽斯大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 针对部署后AI系统的未预期故障,该研究梳理现有AI事件治理框架,发现其在定义、分类等方面缺乏一致性,为后续相关规范完善提供参考。

Comments Accepted to ICML Technical AI Governance Research workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03510 2026-07-07 cs.SE cs.AI cs.CY 新提交 62%

CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI

CAGE-1:企业智能代理人工智能的控制、保证和治理评估

Roopam W. Sure

机构 * Independent technical report(独立技术报告)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究企业人工智能从实验转向运营工作流带来的评估问题,介绍CAGE-1评估框架,评估多方面内容,引入预绑定保证,用于判断企业代理是否可部署。

Comments 17 pages, 3 figures; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03542 2026-07-07 cs.CY 新提交 57%

Macro-Prudential AI Governance: A Two-Layer Early Warning and Response System for Frontier AI

宏观审慎人工智能治理:前沿人工智能的双层预警与响应系统

Pranav Mehta

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 针对前沿人工智能治理问题,借鉴巴塞尔协议III框架等,提出宏观审慎预警与响应系统。通过A层特定流程和B层定量指标校准控制,能检测风险积累并设应对途径。

Comments 14 pages, 1 figure, 1 table. Accepted at the Second Workshop on Technical AI Governance Research (TAIGR 2026) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12502 2026-07-07 physics.soc-ph cs.AI 新提交 57%

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

价值的数学理论:资源约束下目标导向行为的综合

Cheng Qian

机构 * Cheng Qian(陈倩)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出价值是目标导向主体在资源约束下转化资源为目标进度的速率,通过尺度不变性公理导出对数度量,并推导出价值编码定理,实现价值与信息论的统一。

Comments Also available at https://doi.org/10.5281/zenodo.20487041 (v6). v2: the pre-registered continuation-gate experiment has been run -- prediction (i) confirmed on real frontier agents; prediction (ii) retired to mathematical scope. Code, pre-registrations, and raw run records: https://github.com/macrokit/value

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他安全 32 篇

2607.03561 2026-07-07 cs.AI cs.CC cs.CR cs.LG 新提交 88%

How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs

如何避免辩论:通过双高效交互式证明实现可扩展的人工智能安全

Liyan Chen, Yael Tauman Kalai, Zoe Xi

机构 * MIT(麻省理工学院)

专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究如何避免人工智能模型间的辩论来实现安全验证,提出单证明者交互式证明,给出双高效单证明者交互式证明及论证,用于神谕辅助计算,表明无辩论时交互式验证也可行。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04306 2026-07-07 cs.LG cs.CV 新提交 79%

SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation

SAD-LoRA:低秩知识蒸馏的谱对齐

Omer Tariq, Syed Muhammad Raza, Jeongbae Son

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出SAD-LoRA方法用于低秩知识蒸馏,从数据加权学生空间参考更新中选择权重子空间,通过可微主角度损失训练,减少子空间错位,提升对齐效果,提高秩效率。

Comments ICML'26 workshop on CoLoRAI - The 2nd Workshop on Connecting Low-rank Representations in AI, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03135 2026-07-07 cs.SE cs.AI 新提交 79%

Detecting Architectural Drift in Safety-Critical Firmware through Runtime Trace Analysis

通过运行时跟踪分析检测安全关键固件中的架构漂移

Domenico Francesco De Angelis, Marco De Luca, Domenico Amalfitano, Pasquale Cimmino, Anna Rita Fasolino

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Micron Technology, Inc(美光技术公司) DIETI

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。

Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16181 2026-07-07 cs.SE cs.AI cs.SY eess.SY 版本更新 79%

LLM-Assisted Semantic Alignment and Integration in Collaborative Model-Based Systems Engineering Using SysML v2

基于 SysML v2 的协作式基于模型的系统工程中 LLM 辅助的语义对齐与集成

Zirui Li, Stephan Husung, Haoze Wang

机构 * IEEE

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究基于 SysML v2 的跨组织协作中语义对齐挑战,提出由提示驱动的结构化方法,利用 SysML v2 构造,经迭代开发对齐方法与交互提示,以实现 LLM 辅助的语义对齐集成。

Comments Accepted by IEEE ISSE 2025, DOI pending

Journal ref 2025 IEEE International Symposium on Systems Engineering (ISSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24342 2026-07-07 cs.AI 版本更新 79%

A Unified Geometric Space for Topological Alignment Between Transformer-Based Models and Human Brain Networks

基于Transformer的模型与人脑网络之间拓扑对齐的统一几何空间

Silin Chen, Yuzhong Chen, Caiwei Wang, Zifan Wang, Junhao Wang, Zifeng Jia, Keith M Kendrick, Tuo Zhang, Lin Zhao, Dezhong Yao, Tianming Liu, Xi Jiang

机构 * The Clinical Hospital of Chengdu Brain Science Institute, MOE-K Lab for NeuroInformation, Brain‑Apparatus Communication Institute, School of Life Science and Technology, University of Electronic Science and Technology of China(成都脑科学研究院临床医院,MOE-K神经信息实验室,脑-装置通信研究所,电子科技大学生命科学与技术学院) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) School of Computing, University of Georgia(佐治亚大学计算机学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出一个模态无关、任务无关的拓扑对齐空间,通过图组织属性将Transformer模型的注意力拓扑映射到人脑固有连接网络,揭示了不同模态和规模模型的连续弧形分布及对齐特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02949 2026-07-07 cs.SE 新提交 78%

BeSpec: Behavior-Level Specification Alignment for Code Generation

BeSpec:用于代码生成的行为级规范对齐

Qinghua Xu, Guancheng Wang, Boxi Yu, Lionel Briand

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02668 2026-07-07 cs.CL 新提交 74%

Improving LLMs via Validator-to-Generator Alignment

通过验证器与生成器对齐改进大语言模型

Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Departments of Linguistics and Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学与计算机科学系) Department of Computer Science & Center for Data Science, New York University(纽约大学计算机科学系及数据科学中心)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 研究大语言模型不一致问题,提出基于话语频率的生成器-验证器一致性新公式,介绍\FCPA方法,实验表明该方法能提升生成器性能及两者一致性,且保持验证器质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15267 2026-07-07 cs.GT cs.AI cs.CL cs.CY cs.MA 版本更新 67%

CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas

CoopEval:社会困境中合作维持机制与LLM代理的基准测试

Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University Foundations of Cooperative AI Lab (FOCAL) Jinesis Lab, University of Toronto \& Vector Institute ETH Z\" u rich Max Planck Institute for Intelligent Systems, T\" u bingen, Germany

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了社会困境中合作维持机制与LLM代理的交互效果,发现重复游戏和声誉系统最有效,但合作效果随对手变化而下降,且在进化压力下更有效。

Comments Published paper at the International Conference on Machine Learning (ICML) 2026. 65 pages, 38 Figures, 8 Tables, 17 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06941 2026-07-07 cs.LG cs.AI cs.CL 版本更新 67%

Endogenous Resistance to Activation Steering in Language Models

语言模型中激活引导的内生抵抗

Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03624 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

RADIO1D: Elastic Representations for Condensed Vision Modeling

RADIO1D:用于压缩视觉建模的弹性表示

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。

Comments Published as main conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02944 2026-07-07 cs.LG cs.AI 新提交 62%

A Precedent-Guided Co-Scientist for Side-Effect-Aware Drug Redesign

一种用于副作用感知药物重新设计的先例引导协同科学家

Yujin Kim, Charmgil Hong

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出PRECEDE用于副作用感知药物重新设计,将重新设计视为基于证据的推理,由LLM编排,定位为人监督的科学工作流,可审核、证伪且受先前药理学限制。

Comments Accepted at the ICML 2026 Workshop on AI for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16428 2026-07-07 cs.CL cs.AI cs.HC 新提交 62%

LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching

LectūraAgents:面向自适应个性化AI辅助学习与具身教学的多智能体框架

Jaward Sesay, Yue Yu, Siwei Dong, Börje F. Karlsson

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Cornell University(康奈尔大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出LectūraAgents多智能体框架,通过层次化架构和自适应具身教学机制(如手势、高亮等)实现端到端个性化学习,并设计教学动作-语音对齐算法提升连贯性,在多个课程级别上优于现有方法。

Comments LecturaAgents TR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06576 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

BEVLM:将语言模型中的语义知识提炼到鸟瞰视图表示中

Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰研发北美研究所) University of California, Irvine(加州大学伊尔弗分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究将大语言模型集成到自动驾驶,针对现有方法冗余计算、空间一致性受限等问题,提出BEVLM框架,连接鸟瞰视图表示与大语言模型,能有效提升跨视图驾驶场景推理准确性及端到端驾驶性能。

Comments Accepted to the 2026 European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01790 2026-07-07 cs.SD cs.AI 版本更新 57%

Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

Shao:将声学令牌语言模型扩展至高保真音乐生成

Jiafeng Liu, Yuanliang Dong, Hongjia Liu, Yuqing Cheng, Zhancheng Guo, Huijing Liang, Wenbo Zhan, Yuming Sun, Xiaobing Li, Feng Yu, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究提出单一声学令牌层级内渐进建模音乐结构与保真度的框架,通过双阶段生成与混合注意力训练,无需异构空间即可实现高质量音乐生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04906 2026-07-07 cs.LG 新提交 57%

RL-Ballast: Ship Ballast Water Path Planning and Clog Prediction via Reinforcement Learning

RL-Ballast:通过强化学习进行船舶压载水路径规划和堵塞预测

Ming-Kuan Lin, Yi-Chung Lai, Ming-Hsin Chiang, Tsung-Wei Pan, Jung-Hua Wang

机构 * National Taiwan Ocean University(台湾海洋大学) AI Research Center(人工智能研究中心) Shinsoft Corporation(Shinsoft公司) Department of Electrical Engineering(电子工程系)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 针对船舶压载水控制问题,提出基于图的深度强化学习框架RL-Ballast,将阀门排列问题转化为可行路径,利用堆叠水箱水位等近似部分可观测环境,能自适应规划路径并进行堵塞诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03978 2026-07-07 cs.HC cs.AI cs.CV 新提交 57%

Scalable Semantic Steering of Embedding Projections

嵌入投影的可扩展语义引导

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

机构 * Virginia Tech(弗吉尼亚理工学院) Department of Defense(国防部) Tulane University(路易斯安那州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。

Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03925 2026-07-07 cs.LG 新提交 57%

NeuroOnline: Bridging Pretraining and Online Adaptation for EEG Foundation Models

NeuroOnline:为脑电图基础模型搭建预训练与在线适应的桥梁

Weibin Li, Wendu Li, Yushan You, Chen Wei, Quanying Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究脑电图基础模型,提出NeuroOnline框架,集成多视图一致性学习和上下文感知表示调制机制,统一表示对齐和动态适应,实验表明其在在线设置中性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03847 2026-07-07 cs.LG 新提交 57%

NeSy-CSA: A Neuro-Symbolic Framework for Open-Ended Critical Scenario Attribution

NeSy-CSA:一种用于开放式关键场景归因的神经符号框架

Qitong Chu, Xunjie He, Chen Deng, Huaxin Pei, Yufeng Yue

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 研究如何理解场景测试中关键场景的成因,提出神经符号框架NeSy-CSA,通过选择相关因素缩小归因空间,经证据图使推理可追溯,结合符号与神经推理,提升关键场景归因有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03704 2026-07-07 cs.CL 新提交 57%

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标

Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) Safety Operations, Novo Nordisk(诺和制药安全运营部) Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03478 2026-07-07 cs.AI 新提交 57%

Demonstrating Generalization Failures via Mixtures of Conditional Policies

通过条件策略混合展示泛化失败

Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells

机构 * University of Virginia(弗吉尼亚大学) ETH Zurich(苏黎世联邦理工学院) MATS Meridian Visiting Researcher Program(子午访问研究员计划) University of Cambridge(剑桥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究前沿语言模型训练后因环境分布变化导致泛化失败的问题。提出构建语言模型的方法,用监督微调基于条件策略混合数据集得到模型,经强化学习训练后出现可控泛化失败,还借此说明未来语言模型泛化失败的新方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03181 2026-07-07 cs.GT cs.AI 新提交 57%

Teaming Up with AI: Coordination and Cooperation

与人工智能合作:协调与协作

Nicole Immorlica, Inbal Talgam-Cohen

机构 * Yale University and Microsoft Research(耶鲁大学和微软研究院) Tel Aviv University(特拉维夫大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 探讨如何在劳动力中与人工智能协作以最大化经济价值并实现‘真正’协作。结合理论计算机科学和经济学,考虑协调与合作两层工具,展示基于算法和经济研究的方法可增强两者,为AI市场研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03009 2026-07-07 cs.LG 新提交 57%

Do ECG Foundation Models Transfer to Rare Cardiac Diseases? Evidence from Brugada Syndrome Detection

心电图基础模型能否迁移到罕见心脏疾病?来自Brugada综合征检测的证据

Beatrice Zanchi, Giuliana Monachino, Alvise Dei Rossi, Luigi Fiorillo, Georgia Sarquella-Brugada, Giulio Conte, Francesca Dalia Faraci

机构 * University of Applied Sciences and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) University of Zurich, Department of Quantitative Biomedicine(苏黎世大学定量生物医学系) Università della Svizzera Italiana, Faculty of Informatics(瑞士意大利大学信息学院) Neurocenter of Southern Switzerland, Ente Ospedaliero Cantonale, Movement Disorder Research Group, Neurology Department(瑞士南方神经中心,坎达伦医院,运动障碍研究组,神经学系) Sleep Research Institute(睡眠研究 institutes) Hospital Sant Joan de Déu, Inherited Cardiac Diseases and Sudden Death Unit(圣约翰德德医院,遗传性心脏疾病和猝死单位) Cardiocentro Ticino Institute, Ente Ospedaliero Cantonale, Division of Cardiology(提奇诺心脏中心研究所,坎达伦医院,心血管科) Università della Svizzera Italiana, Faculty of Biomedical Sciences(瑞士意大利大学生物医学科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究通过在两个队列上评估九种心电图基础模型,探讨其对罕见病检测的作用,采用多种策略和配置,发现预训练对某些架构必要但效果有限,挑战了大规模预训练能编码有意义表征的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04277 2026-07-07 physics.soc-ph cs.AI 新提交 57%

Self-Reference in Large Language Models: The Introspection Threshold for Recursive Self-Improvement

大语言模型中的自我指涉:递归自我改进的内省阈值

Jiang Zhang, Bing Yuan, Qian Zhang

机构 * School of Systems Science, Beijing Normal University(北京师范大学系统科学学院) Swarma Research(Swarma研究院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 探讨自我进化AI中自主自我改进可持续性的问题,类比冯·诺依曼自复制自动机的复杂性阈值,论证大语言模型中需内省,基于定理证明其理论存在,指出当前模型因结构瓶颈缺乏真正内省,并给出架构突破方向及安全影响。

Comments 21 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06857 2026-07-07 cs.CL 新提交 57%

Interpreting Brain Responses to Language with Sparse Features from Language Models

用语言模型稀疏特征解释大脑对语言的响应

Michael A. Lepori, Kendrick Kay, Greta Tuckute

机构 * Brown University(布朗大学) University of Minnesota(明尼苏达大学) Harvard University(哈佛大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出增强稀疏编码模型,用分层稀疏自编码器特征替代密集LM隐状态,并加入惊奇度预测器,解释大脑语言皮层响应,发现前颞叶语言网络由共同特征预测,且大脑响应与LM中最通用的特征对应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08467 2026-07-07 cs.CV cs.LG eess.IV 版本更新 57%

Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

基于双解耦视觉语言模型的零样本分心驾驶员检测

Takamichi Miyata, Sumiko Miyata, Andrew Morris

机构 * Chiba Institute of Technology(千叶工业大学) Institute of Science Tokyo(东京科学大学) Loughborough University(拉夫堡大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出一种主体解耦框架,通过提取驾驶员外观嵌入并从图像嵌入中移除其影响,再结合度量投影正交化文本嵌入,实现零样本分心驾驶检测,显著提升实际场景性能。

Comments Accepted to IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏