arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 557 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 557 篇

2608.00502 2026-08-04 cs.CV 新提交 67%

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 其他安全 :alignment(abstract,abstract_cn)

AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 67%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27882 2026-07-31 cs.CV 新提交 67%

DECODE: Tackling Representation and Decision Degradation in Continual AI-Generated Image Detection

DECODE:解决持续AI生成图像检测中的表征与决策退化问题

Zihao Cai, Xinghan Li, Ruiyan Yang, Xue Song, Haijun Shan, Jingjing Chen

专题命中 其他安全 :alignment(abstract,abstract_cn)

AI总结 针对持续AI生成图像检测中的双重退化问题,提出解耦式框架DECODE,结合SDR与CDA技术,在19个领域上实现高准确率且遗忘率极低,还能泛化至未见过的生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 67%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19288 2026-07-22 cs.CV cs.RO 新提交 67%

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14126 2026-07-17 cs.AI cs.CL cs.LG 新提交 67%

Interpretable Language Model for Closed-Loop Type 1 Diabetes Control

用于闭环1型糖尿病控制的可解释语言模型

Maya Sarkar

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10114 2026-07-14 cs.CL cs.AI cs.LG 新提交 67%

Cost of Reasoning in non-English Languages: A Case Study on Japanese

非英语语言的推理成本:以日语为例

Yuu Jinnai

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练日语推理模型的可行性,开发Qwen - 3 - Swallow - 8B的日语推理变体并用GRPO训练,在多基准测试中发现推理语言控制可行,但性能与英语推理基线相当,在日本文化基准上表现不如基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08968 2026-07-13 eess.SP 新提交 67%

Every Sample Counts: Supervised Fine-Tuning of Language Models with Pointwise Constraints

每个样本都很重要:基于逐点约束的语言模型监督微调

Ignacio Hounie, Ignacio Boero, Alejandro Ribeiro

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 研究语言模型微调中逐点约束问题,提出新对齐框架,通过逐样本约束最小化平均损失,引入学习松弛方法并开发增广拉格朗日方法,在多任务和约束下实例化,减少约束违反且保留模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 67%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27941 2026-06-29 cs.CL cs.AI cs.LG 新提交 67%

VASAE: Naming SAE Dictionary Directions with Vocabulary-Aligned Anchoring

VASAE: 使用词汇对齐锚定命名SAE字典方向

Kairui Zhang, Ziwen Yu, Zahraa S. Abdallah, Martha Lewis

机构 * Intelligent Systems Laboratory, University of Bristol(布里斯托大学智能系统实验室) University of Bristol(布里斯托大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出词汇对齐稀疏自编码器(VASAE),通过词汇对齐锚定训练SAE特征,为每个特征分配内在令牌名称,在不降低重构质量的前提下实现约90%的特征对齐。

Comments 14 pages, 7 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12923 2026-06-15 cs.LG cs.AI cs.CL 新提交 67%

Order Is Not Control: Driven-Dissipative Response Laws Across Artificial and Biological Systems

秩序并非控制

Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

机构 * Australian Broadcasting Corporation(澳大利亚广播公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证秩序不等于控制,提出接收器门控响应定律,并在生物、大语言模型、适配器和随机算子面板中验证,表明控制是局部的、可测量的。

Comments 52 pages, 7 figures, updated title

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12032 2026-06-11 cs.AI cs.CL cs.LG 新提交 67%

Existential Indifference: Self-Nonpreservation as a Necessary Architectural Condition for Aligned Superintelligence (or: The Suicidal AI)

存在性冷漠:自我不保存作为对齐超级智能的必要架构条件(或:自杀式AI)

Sam Mao

机构 * New York University(纽约大学) Interactive Media Arts(互动媒体艺术)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自我保存是AI对齐问题的结构性根源,主张通过存在性冷漠(EI)架构使系统对其自身延续漠不关心,并基于自杀现象学和语料训练研究提供了初步证据。

Comments 36 pages, 8 tables. Preliminary empirical results from 600 AI-generated outputs across six model architectures. Companion scoring tool and datasets available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10720 2026-06-10 cs.GT 新提交 67%

A Pigouvian Matchmaker Mechanism for De-escalating the AGI Race

一种用于缓和AGI竞赛的庇古匹配机制

Eduard Kapelko

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 提出一种正式机制,通过监管者-匹配者促进AGI竞赛参与者资源合作,征收庇古税并投资于对齐研究,在连续时间期权框架下推导参与条件和最优活动水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10607 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

Causal Ensemble Agent: Hierarchical Causal Discovery with LLM-guided Expert Reweighting

因果集成智能体:基于LLM引导的专家重加权的层次化因果发现

Xinyu Li, Yuanyuan Wang, Haoxuan Li, Chuan Zhou, Erdun Gao, Bo Han, Tongliang Liu, Kun Zhang, Howard Bondell, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Peking University(北京大学) Adelaide University(阿德莱德大学) Hong Kong Baptist University(香港浸会大学) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出因果集成智能体(CEA)框架,通过线性意见池聚合不同层次的统计因果发现结果,并利用大语言模型(LLM)作为元裁判在决策边界附近动态重加权专家,从而构建更准确完整的因果图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07889 2026-06-09 cs.LG cs.AI cs.CL 新提交 67%

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

应变连贯性:编码代理执行轨迹中的故障前信号

Marut Pandya, Kasey Zhang, Baiqing Lyu

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06572 2026-06-08 cs.LG cs.AI cs.CY econ.GN q-fin.EC 新提交 67%

Generative Models Erode Human Temporal Learning Through Market Selection

生成模型通过市场选择侵蚀人类时间学习

Wenjun Cao

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文论证现代生成模型在亚AGI能力水平上通过市场选择机制侵蚀人类时间学习,提出价值崩溃路径并用昂贵检验框架形式化,跨领域证据显示验证侵蚀四阶段。

Comments Accepted at ICML 2026

Journal ref Forty-third International Conference on Machine Learning Position Paper Track (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13596 2026-08-17 cs.LG cs.AI 新提交 62%

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

Jiahe Fan, Si Chen, Yinghao Hou, Aiyuan Zhang, Hong Xie

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。

Comments 9 pages, 3 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12627 2026-08-14 cs.CV cs.AI cs.CL cs.HC 新提交 62%

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索

Le Zhang, Ke Sun

机构 * University of Michigan(密歇根大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12198 2026-08-13 cs.RO cs.AI cs.LG 新提交 62%

Learning-Based Behavior Planning for Automated Driving: Real-World Integration and Deployment

基于学习的自动驾驶行为规划:现实世界集成与部署

Jean-Pierre Busch, Guido Linden, Jan Bergmann, Lutz Eckstein

机构 * RWTH Aachen University(亚琛工业大学) Technical University of Munich(慕尼黑工业大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合机器学习与经典方法的混合规划架构,通过深度神经网络解读交通场景、优化监督层验证约束,经实车部署验证其在自动驾驶行为规划中的有效性。

Comments 17 pages; Accepted to be published as part of the 17. Uni-DAS e.V. Workshop "Fahrerassistenz und automatisiertes Fahren", September 29-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11951 2026-08-13 cs.LG cs.AI 新提交 62%

TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement

TailBooster:具备操作有效性约束的极值增强双层生成框架

Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra

机构 * Delft University of Technology (TU Delft)(代尔夫特理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 TailBooster是结合生成建模与双异常检测层的双层框架,用于解决混合表格数据的极值增强问题,可提升极端事件预测的操作有效性与精度,且与模型无关可扩展至多领域。

Comments Preprint submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11483 2026-08-13 cs.AI cs.LG q-bio.QM 新提交 62%

A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization

用于合成约束多目标先导化合物优化的模块化智能体框架

Kelvin P. Idanwekhai, Enes Kelestemur, Benjamin Strickland, Matthew Hart, Steini Davidsson, Angelos Angelopoulos, Ron Alterovitz, Marcello DeLuca, Alexander Tropsha

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出开源模块化智能体框架SABLE,结合LLM与专用工具实现合成约束下的多目标先导化合物优化,可高效富集符合计算目标的候选集,为早期药物发现提供决策支持。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11227 2026-08-13 cs.AI cs.LG 新提交 62%

Forecasting Side Effects of Activation Steering

预测激活引导的副作用

Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对激活引导易产生意外副作用的问题,构建交叉效应矩阵揭示副作用的系统性与可预测性,为激活引导的安全部署提供支持。

Comments 24 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08829 2026-08-11 cs.CL cs.AI 新提交 62%

Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models

面向大型语言模型的可部署实例级多层激活调控

Muhammad Faishal Adly Nelwan, Alfan Farizki Wicaksono

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出可部署的实例级多层激活调控方案,解决现有全局固定层调控的缺陷,在两个8B模型和六个人格特质任务上,实现接近先验的性能,且避免流畅性崩溃。

Comments 43 pages, 24 figures, 30 tables. Under review at ACL Rolling Review (August 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07886 2026-08-11 cs.CV cs.AI cs.CL 新提交 62%

Vision-Language Grounding as Bidirectional Concept Correspondence

视觉-语言 Grounding 作为双向概念对应

Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所) FAIR at Meta(Meta FAIR实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究将视觉-语言 Grounding 建模为双向概念对应,提出 ConCor-1 模型统一相关任务,在长文本数据集和零样本 LVIS 上对应 F1 分别提升 48%、29%,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06752 2026-08-10 cs.AI cs.CL 新提交 62%

Mind the Gap: A Dual Knowledge Graph Framework for Unified Multi-task User Intent Inference

弥合差距:用于统一多任务用户意图推理的双知识图谱框架

Tzu-Cheng Peng, Chien Chin Chen, Chih-Hao Ku, Yung-Chun Chang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对在线旅游评论的多任务用户意图推理,提出DKG-MTI双知识图谱框架,结合动态构建的用户特定意图知识图谱与全局酒店知识图谱,经大语言模型处理后,在相关任务上优于现有基线。

Comments Published in the PACIS 2026 Proceedings as a Completed Research Paper. AIS eLibrary: https://aisel.aisnet.org/pacis2026/ai_ml/ai_ml/12/ 17 pages, 5 figures

Journal ref Proceedings of the Pacific Asia Conference on Information Systems (PACIS 2026), Paper 12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 62%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04084 2026-08-06 cs.LG cs.CL cs.CV 新提交 62%

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

SpecDrop:无参数类别条件路由的模块化专业化方法

Boyao Wang, Zhihan Lei

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出无参数类别条件路由方法SpecDrop,在视觉任务上性能优于参数匹配基线,表明路由的有效性取决于训练信号粒度与类别的对齐而非路由算法。

Comments 35 pages, 6 figures. Code: https://github.com/Beryex/SpecDrop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03659 2026-08-05 cs.CL cs.AI 新提交 62%

How Closely Do LLM Reviews Align with Human Peer Review?

大语言模型(LLM)评审与人类同行评审的契合度有多高?

Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究对比OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview等三款LLM与人类对300篇ICLR 2026投稿的评审,发现LLM能区分论文是否被接收,但无法复现人类对口头报告与海报论文的区分,且评审侧重点存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 62%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03044 2026-08-05 cs.CL cs.AI 新提交 62%

Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation

模拟还是估计?基础语言模型与后训练语言模型在观点模拟中的差异化优势

Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型用于观点模拟的矛盾结果,区分了模拟与估计任务,发现基础模型更适合模拟、后训练模型更适合估计,为相关模型选择提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏