arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2678 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2608.04626 2026-08-06 cs.CR 新提交 85%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01538 2026-08-04 cs.NI cs.SY eess.SY 新提交 85%

From Network Automation to Trustworthy Autonomous Networking in the LLM Era: A Network Control Intelligence Perspective

从网络自动化到大语言模型(LLM)时代的可信自主网络:网络控制智能视角

Tianzhu Zhang, Changgang Zheng, Shanshan Wang, Yarui Zhang, Lina Shi, Yue Jin, Xiaofei Wang, Meikang Qiu

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文以网络控制智能(NCI)为框架,梳理网络控制系统三阶段演进,提出可信自主网络定义及参考架构,明确LLM赋能运营的集成模式与相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26121 2026-07-30 cs.RO cs.AI cs.CY 新提交 84%

Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels

面向可信赖的具身智能:一个系统框架与分级可信赖性水平

Xinyu Yang, Tianxing Chen, Honghao Su, Minxuan Wang, Chenze Yu, Zhangzheng Tu, Yue Chen, Yuxiao Huo, Lingfeng Zhang, Yan Huang, Yan Qin, Shaolong Zhu, Qiwei Liang, Hekun Tian, Shujia Liu, Guangyu Chen, Junhao Gong, Zixuan Li, Wenwei Lin, Zijian Lin, Wenxuan Zhu, Eric J Chen, Yue Yuan, Qize Yu, Jiaqi Liang, Haowen Yan, Hengfei Zhao, Weijie Wan, Zikun Xiao, Junyuan Tang, Baijun Chen, Kai-Chong Lei, Kaixuan Wang, Kailun Su, Zanxin Chen, Yao Mu, Renjing Xu, Chuqiao Lyu, Qi Xiong, Ping Luo, Wenbo Ding

机构 * THU(清华大学) PKU(北京大学) HKUST (GZ)(香港科技大学(广州))

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。

Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11243 2026-08-13 cs.AI cs.LG 新提交 84%

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示

Yoshinori Watanabe

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01046 2026-08-04 cs.CL cs.AI 新提交 84%

DeBERTa-Sentinel: Toward Transparent and Trustworthy Detection of AI-Generated Text

DeBERTa-Sentinel:实现透明且可信的AI生成文本检测

Muhammad Yousaf Rehman, Muhammad Islam

机构 * University of Hertfordshire(赫特福德大学) James Cook University(詹姆斯库克大学)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 DeBERTa-Sentinel是基于DeBERTa-v3的透明AI生成文本检测框架,在GLC-AIText数据集上实现优异检测性能,可公开token级解释以支持利益相关者审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 84%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 84%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 84%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交 83%

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 83%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10176 2026-08-12 cs.AI 新提交 83%

TRACE: Trustworthy Retrieval-Augmented Conversational Engine

TRACE:可信赖的检索增强对话引擎

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威奇托州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 研究人员提出TRACE框架,通过强化检索提升公共服务对话系统的约束满足度、减少幻觉,降低对模型规模的依赖,证实检索质量是系统稳健性的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07862 2026-08-11 cs.CL 新提交 83%

SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

SurakshaEval:面向多语言大语言模型的印度语安全基准

Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah, Xudong Han, Yuxia Wang, Parameswari Krishnamurthy, Utkarsh Agarwal, Atharva Kulkarni, Swaran Lata, Ayush Munot, Dhruv Sahnan, Aaryamonvikram Singh, Preslav Nakov, Monojit Choudhury

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 针对现有LLM安全评估数据集忽视印度语言文化安全风险的问题,本文推出SurakshaEval基准,测试发现多语言LLM在印度语场景下安全表现不足,凸显了适配区域数据的安全评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06202 2026-08-07 cs.HC cs.AI 新提交 83%

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

当前AI基准测试未测量的内容:模态、搜索、引用及其对安全评估的启示

Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究发现AI基准测试未涵盖模态、搜索等关键因素,以ChatGPT为例对比两种模态及搜索条件,发现这些因素会影响模型准确率、一致性等,主张AI安全评估需纳入这些维度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28685 2026-08-03 cs.AI cs.IR 新提交 83%

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks

安全,还是仅仅是能力?智能体安全基准的有效性审计

Youting Wang, Xiao Han, Dingyan Shang, Yuan Tang, Bowen Liu

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究审计了R-Judge等四个智能体安全基准的有效性,发现其排名分歧源于小样本偏差,能力与对齐错误安全负相关,AgentHarm与越狱安全的关联为收敛效度而非通用安全,强调安全主张需明确关键要素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18259 2026-07-22 cs.AI 新提交 83%

Probabilistic Concept-Aware Steering for Trustworthy LLM Inference

用于可信大语言模型推理的概率概念感知引导

Brian Becker, Rui Chu, Yingjie Lao

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究针对大语言模型推理中现有引导向量方法的问题,提出概率概念感知引导框架,通过概念驱动检索和概率校准,在保留模型能力的同时实现可控、安全的语义偏差引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15992 2026-07-20 cs.AI 新提交 83%

Closing the AI Trust Gap: The Case for Independent Certification for Trustworthy AI

缩小人工智能信任差距:可信人工智能独立认证的案例

Trisevgeni Papakonstantinou, Cansu Canca, Farah Nanji, Waheedullah Pardess, Jen Weedon, Jasmijn Remmers, Eliza Krigman, Matthew Ball, Yalda Daryani, Kiran Iqbal, Francielle Vargas, María Llorente Sánchez, Joe Humphreys, Fendi Tsim, Kelly Fitzpatrick, Jeff Dunn, Catherine Feldman

机构 * University College London(伦敦大学学院) AI Ethics Lab(人工智能伦理实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) MATS Tech with Intention(技术与意图) University of Southern California(南加州大学) Kyushu University(九州大学) University of Chile(智利大学) BehSci Meets AI(行为科学与人工智能) Digital Trust Council(数字信任委员会)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究指出负责任AI虽有实践但未形成奖励可信度的市场,存在信任差距。原因包括关注重点偏差及三个复合失败。通过审查治理工具发现不足,进而提出以结果为导向的独立认证来缩小信任差距,补充监管与内部治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14570 2026-07-17 cs.AI cs.CR 新提交 83%

Democratizing Agent Deployment Safety: A Structural Monitoring Approach

使智能体部署安全民主化:一种结构监测方法

Preeti Ravindra, Rahul Tiwari, Vincent Wolowski

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。

Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10871 2026-07-14 cs.AI cs.HC 新提交 83%

Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

迈向沉思型大语言模型:心理健康领域中评估与增强大语言模型对齐性的模块化框架

Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao

机构 * Purdue University(普渡大学) Washington University in St. Louis(圣路易斯华盛顿大学) Yixue Research Institute(易学研究所)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 针对新模型等涌现使评估沉思原则增强大语言模型对齐性具挑战的问题,提出模块化可扩展评估框架,能集成新元素并重现先进结果,支持交叉评估,其提示模块便于纳入伦理视角,为跨学科研究及有益人机生态系统奠定基础。

Comments Accepted as an oral presentation at HARMONY 2026 (Human-centered AI Research for Mental Health, an Open Networking Symposium), co-located with IEEE/ACM Conference on Connected Health: Applications, Systems, and Engineering Technologies (CHASE 2026) held in Pittsburgh, August 6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22706 2026-06-23 cs.AI 新提交 83%

Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

通过多任务风险融合的LLM生成驾驶员干预信息的安全感知评估

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究推进中心)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出DSAIS指标,结合规则与LLM评估五个维度,通过多任务风险融合框架提升干预信息质量,实验表明多任务集成使上下文相关性提升9.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 83%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 83%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18656 2026-06-18 cs.CL 新提交 83%

The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

错误的正确:量化和定位大语言模型中的失调对齐

Naihao Deng, Yiming Feng, Chimaobi Okite, Kaijian Zou, Lu Wang, Rada Mihalcea, Yulong Chen

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出VETO基准和失调对齐率(MAR)指标,发现所有LLM在刻板印象相关问题上均存在非平凡的失调对齐,且人类为0%,机制分析表明对齐诱导的线索会放大该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13884 2026-06-15 cs.AI 新提交 83%

Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents

能力最小化作为安全原语:风险感知因果门控实现最小特权LLM代理

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出风险感知因果门控(RACG)框架,通过因果效应估计与校准风险控制决定是否采纳模型预测,显著降低高成本错误,同时保持非门控策略的大部分效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13854 2026-06-15 cs.HC cs.AI 新提交 83%

SpheriCity: Designing Trustworthy Conversational AI for Sustainability Decision Support

SpheriCity:为可持续发展决策支持设计可信赖的对话式AI

Ahmed Qayyum, Madison Werner, Kathryn Youngblood, Jenna R. Jambeck, Tahiya Chowdhury

机构 * Department of Computer Science, Colby College(科里尔学院计算机科学系) Circularity Informatics Lab, University of Georgia(佐治亚大学循环信息实验室)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出SpheriCity,一种基于来源的对话式AI原型,通过结构化合成和交互支架,支持从城市循环性评估报告中可信地获取知识,解决大语言模型在可持续性高风险领域中的透明度与信任问题。

Comments Accepted to ACM SIGCAS/SIGCHI Conference on Computing and Sustainable Societies (COMPASS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12797 2026-06-12 cs.AI 新提交 83%

The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements

遏制缺口:已部署的自主AI框架如何未能满足面向公众的安全要求

Md Jafrin Hossain, Mohammad Arif Hossain, Weiqi Liu, Nirwan Ansari

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究发现主流自主AI框架缺乏架构级安全保证,内存完整性漏洞可导致定向腐败,提出轻量级遏制机制消除攻击向量。

Comments ICML 2026 (AI4GOOD Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 82%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08485 2026-08-11 cs.AI cs.CL cs.LG 新提交 82%

HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails

HoloAegis:冻结表示、拓扑推理:用于零样本大语言模型(LLM)护栏的最小参数安全流形

Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee, Kin Chung Ho, Ping Shum, Michael K. Ng

机构 * Hong Kong Baptist University(香港浸会大学) Guangdong Polytechnic Normal University(广东技术师范大学) Guangdong Institute of Digital Industry(广东数字产业研究院) The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloAegis是一种最小参数拓扑推理框架,通过冻结语义表示的纯几何推理实现零样本LLM安全护栏,在8个基准测试中达到最先进准确率,兼具低延迟、零冷启动数据和跨语言迁移能力。

Comments Preprint, August 2026. 10 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29199 2026-08-03 cs.CR 新提交 82%

Alignment Is Local: A Paired Diagnostic for GUI Agents under User-Side Persuasion

对齐是局部的:用户侧说服下GUI智能体的配对诊断

Haoxin An, Yunpeng Song, Zihao Bai, Zhongmin Cai, Guojun Xiong, Chenhao Lin, Wentao Chen, Feng Wei, Chao Shen

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract)

AI总结 本文通过配对诊断发现GUI智能体的提示级对齐是局部现象,一行防护栏可大幅降低单次ASR,但四轮升级链会使其防护效果下降,静态单轮ASR高估了实际部署的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20485 2026-07-24 cs.AI cs.CL cs.LG 新提交 82%

Expectation Alignment of Language Models for Real-World User Expectations

语言模型与现实世界用户期望的期望对齐

Miaomiao Li, Yang Wang, Bin Liang, Shudong Liu, Zhiwei Zhang, Kam-Fai Wong

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLMs是否满足用户期望,提出提取期望程序并引入ExpectBench基准,分析发现LLMs存在问题,进而提出LENS框架,可让模型内化期望以生成更契合的响应,凸显明确建模用户期望对实现现实人机对齐的重要性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15202 2026-06-16 cs.CV 新提交 82%

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

安全相关环境中的人类注视与视觉语言模型注意力的比较

Marta Vallejo, Siwen Wang

机构 * Heriot-Watt University(赫瑞-瓦特大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 本研究通过眼动追踪实验和GPT-4o等视觉语言模型,比较了人类与模型在安全相关场景中的注意力分布,发现模型无需训练数据即可近似人类注视模式。

Comments 30 pages, 33 figures. Submitted as a preprint. Code and data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏