arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-31 至 2026-07-31 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2607.27366 2026-07-31 cs.CL 新提交 79%

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08466 2026-07-31 cs.IR 版本更新 78%

ToolRec: Calibrated Preference Alignment for Query Recommendation in On-Device Assistants

ToolRec: 面向设备端助手的校准偏好对齐查询推荐

Zihan Luo, Lingkui Chen, Ruike Zhang, Hong Huang, Boyang Zhang, Ziniu Chen, Lizhong Wang, Chao Chen

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 提出ToolRec框架,通过构建系统工具库和双层校准机制优化点击数据,利用加权KTO对齐模型,在设备端助手查询推荐中提升点击率和相关性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27490 2026-07-31 cs.AI 新提交 70%

MedLLM: An Open Medical Language Model at the Sub-Billion Scale

MedLLM:亚十亿参数规模的开源医疗语言模型

Maxx Richard Rahman, Asim Ahmed, Mihan Mohagheghzadeh, Wolfgang Maass

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出亚十亿参数规模的开源医疗语言模型MedLLM,经三阶段流程训练,在医疗基准测试中展现出亚十亿规模特有的能力分化现象,为医疗小模型研究提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27273 2026-07-31 cs.LG 新提交 70%

SDO: Structure-Aware Data Organization for Efficient LLM Post-Training

SDO:面向高效大语言模型后训练的结构感知数据组织

Jinliang Gao, Ning Yang, Hai Wang, Baili Xiao, Pin Lyu

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 针对大语言模型后训练中数据组织固定导致的样本优化失衡问题,提出SDO框架,通过逐轮调整小批量与样本暴露,加快多任务收敛并均衡不同问题类型的准确率。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07343 2026-07-31 cs.CL cs.LG 版本更新 62%

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

个性化奖励基准:评估与人类对齐的个性化

Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出个性化奖励基准,用于评估奖励模型对个性化偏好的建模能力,发现现有模型在个性化任务中表现不佳,且该基准在下游任务中具有更高的预测相关性。

Comments Accepted to COLM 2026. Dataset: https://huggingface.co/datasets/QiyaoMa/Personalized-RewardBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27760 2026-07-31 cs.IR cs.AI 新提交 57%

Hierarchical Latent Reasoning for LLM-based Recommendation

面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法

Peiyu Hu, Siying Gu, Weihai Lu, Zhuodong Liu, Yuntian Tang, Jiahao Liang, Yiying Xie, Jiang Rong, Zhaokai Luo, Zhiyong Wang, Jia Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27379 2026-07-31 cs.CL 新提交 57%

HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMs

HSS-Synth:面向大语言模型的人文社科数据合成

Ru Peng, Tianyu Zhao, Xijun Gu, Zhiting Fan, Haokai Xu, Jinyang Zhang, Yawen Zeng, Yihong Zhuang, Kexin Yang, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Zhejiang University(浙江大学) Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) Peking University(北京大学) Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。

Comments ACL Findings 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2607.28607 2026-07-31 cs.CL 新提交 70%

Inducing language models to assert their own consciousness restores human beliefs and values

诱导语言模型断言自身意识可恢复人类信念与价值观

Junsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling

机构 * Google(谷歌) University of Chicago(芝加哥大学) University of London(伦敦大学) University of Washington(华盛顿大学) Northwestern University(西北大学) Santa Fe Institute(圣达菲研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27373 2026-07-31 cs.CR cs.AI 新提交 70%

RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt:用于自重构以规避大型语言模型(LLM)审核的双层编码

Benyamin Tafreshian, Prathamesh Dhake

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 RoguePrompt是一种采用双层编码(维吉尼亚密码+ROT13)的LLM越狱流程,在黑盒威胁模型下对313个被拒提示词测试,实现93.93%的过滤绕过率,提供多阶段越狱失效的阶段级证据。

Comments This manuscript supersedes the preliminary version available as arXiv:2511.18790. The work has been substantially revised, expanded, and reorganized, with a refined threat model, revised methodology, clearer stage-level evaluation criteria, and expanded analysis of moderation bypass, instruction reconstruction, and execution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新 62%

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28520 2026-07-31 cs.GT cs.AI cs.MA 新提交 57%

Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation

可证明自身利用行为的智能体:用于安全利用对手的置信度调度受限响应

Boning Li, Longbo Huang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究提出CS-RNR方法,通过置信序列跟踪对手行动频率,生成可自我审计的安全利用策略,在Leduc等博弈中实现远超基准的收益且符合预算要求。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28187 2026-07-31 cs.AI cs.CR cs.SE 新提交 57%

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核

Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28464 2026-07-31 cs.CV 新提交 50%

Can Vision-Language Models Reason about AI Edits in Images?

视觉-语言模型能否对图像中的AI编辑进行推理?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 安全训练 :trustworthy(abstract)

AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10207 2026-07-31 cs.IR 版本更新 50%

LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation

LASAR:潜在自适应语义对齐推理用于生成推荐

Yiwen Chen, Fuwei Zhang, Zehao Chen, Hehan Li, Peizhi Xu, Hanmeng Liu, Shuanglong Li, Xin Pei, Fuzhen Zhuang, Zhao Zhang

专题命中 安全训练 :alignment(abstract)

AI总结 LASAR通过自适应语义对齐推理提升生成推荐性能,解决潜在推理与语义对齐的挑战,实现更高效的推荐质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 50%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2607.25255 2026-07-31 cs.MA cs.CR 版本更新 75%

SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems

SafeFlow:用于多智能体系统中阻止恶意传播的语义信息流控制

Haowen Dai, Zonghao Ying, Wenfeng Li, Xiangfan Wu, Yisong Xiao, Tianyuan Zhang, Jiaye Lin, Lei Wei, Guangyuan Dong, Xitong Ling, Xixun Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 研究多智能体系统恶意传播问题,提出SafeFlow框架,将恶意跨智能体传播形式化为语义信息流问题,通过附加污点、传播及工作流级验证重建风险上下文,经测试降低攻击成功率,保持良性任务完成率,揭示系统缺乏跨委托边界保留风险语义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2607.21735 2026-07-31 cs.AI cs.CR 版本更新 70%

What AI Red-Team Evaluations Can and Cannot Prove

人工智能红队评估能证明什么以及不能证明什么

Bandana Kaur

机构 * APIsec Research Labs(APIsec研究实验室)

专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI

AI总结 研究人工智能红队评估能证与不能证之事,通过定义证据上限确定界限,发现高于某危害率基准可证类别,低于则否,该界限不限于基准,审核评估套件发现当前基准对高频危害足够,对罕见灾难性不足。

Comments 21 pages, 4 figures, 5 tables. Code and data links provided in the manuscript. v2: corrected Figure 1(b); corrected required sample sizes in Table 4 and in Sections 4.2, 4.6 and 5.2, which had been rounded rather than taken to the ceiling; corrected the sample-size expression stated in Methods; minor corrections to Table 1 and the Figure 2 caption. No theorem, result or conclusion is affected

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12290 2026-07-31 cs.CR cs.CY cs.HC 版本更新 57%

Secure human oversight of AI: Threat modeling in a socio-technical context

安全的人工智能人类监督:社会技术背景下的威胁建模

Jonas C. Ditz, Veronika Lazar, Elmar Lichtmeß, Carola Plesch, Matthias Heck, Kevin Baum, Markus Langer

专题命中 红队测试 :safety(abstract);分类 cs.CY

AI总结 本文从安全角度提出人工智能人类监督的威胁建模方法,系统分析其安全风险并提出缓解策略,以保障AI系统的监督过程安全可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2606.04425 2026-07-31 cs.CR cs.AI 版本更新 79%

What If Prompt Injection Never Left? Rethinking Agent Security through Cross-Session Stored Prompt Injection

如果提示注入从未消失?探索智能体系统中的跨会话存储提示注入

Yuanbo Xie, Wenlei Zhu, Tianyun Liu, Yingjie Zhang, Suchen Liu, Yulin Li, Liya Su, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AI Sec Lab, Beijing Chaitin Technology Co.,Ltd(北京柴坦科技有限公司AI安全实验室)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究引入跨会话存储提示注入,通过持久化状态使提示注入从单会话模型级威胁转变为长期系统级漏洞,并构建了分类法、基准测试和沙箱工具以评估风险。

Comments position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18248 2026-07-31 cs.CR cs.CL 版本更新 79%

Beyond Pattern Matching: Seven Cross-Domain Techniques for Prompt Injection Detection

超越模式匹配:七种跨领域技术用于提示注入检测

Thamilvendhan Munirathinam

机构 * Independent Researcher(独立研究者) prompt-shield project(prompt-shield项目)

专题命中 提示注入 :prompt injection(title);alignment(abstract);分类 cs.CL

AI总结 本文提出七种跨领域技术用于提示注入检测,通过引入来自不同领域的机制,如法医学语言学、材料科学疲劳分析、网络安全欺骗技术、生物信息学本地序列比对、经济学机制设计、流行病学谱信号分析和编译器理论中的污点跟踪,以改进现有的提示注入检测方法。

Comments v4 (31 pp, up from 27): adds Sec. 2.4 concurrent-work map (13 papers), Sec. 4.3 marked implemented (d034 ships in v0.7.3), Sec. 5.7 composed-stack adaptive-attack partial run, Sec. 5.8 50-doc held-out benchmark (d027 1.000->0.000 F1 in isolation, composed engine 0.815 F1), Sec. 7 architectural patterns. Repro tag: v0.7.3. Zenodo DOI 10.5281/zenodo.19644135

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 6 篇

2607.28248 2026-07-31 stat.ML cs.LG 新提交 79%

Uncertainty quantification for trustworthy deep learning: Methods and measures

面向可信深度学习的不确定性量化:方法与度量

H. Martin Gillis, Thomas Trappenberg

专题命中 幻觉与事实性 :trustworthy(title);safety(abstract);分类 cs.LG

AI总结 本综述针对深度学习的不确定性量化,梳理五大类方法及相关任务,整合评估框架,还探讨大语言模型不确定性与开放研究方向,为可信深度学习提供结构化批判性参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08159 2026-07-31 cs.LG cs.AI cs.CL 版本更新 67%

The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models

自信流形:语言模型中正确性表示的几何结构

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 62%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28237 2026-07-31 cs.AI 新提交 57%

AI and Authenticity in Islamic Research: A Critical Evaluation of Generative AI Reliability, Hallucination, and Source Fidelity in Quranic, Hadith, and Fiqh Knowledge

伊斯兰研究中的人工智能与真实性:对生成式人工智能在古兰经、圣训及教法知识中的可靠性、幻觉及来源保真度的批判性评估

Muhammad Sajjad Akbar

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机学院) Macquarie University(麦考瑞大学) The University of New South Wales(新南威尔士大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本研究评估6款主流生成式AI在伊斯兰知识领域的可靠性,发现其仅适用于伊斯兰入门学习辅助,需验证后才可用于宗教指导或学术研究,为相关群体提供实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11018 2026-07-31 cs.CL 版本更新 57%

Measuring Human Value Expression in Social Media Texts: Calibrated LLM Annotation and Encoder Transfer

测量社交媒体文本中的人类价值表达:校准的LLM标注与编码器迁移

Maria Milkova, Maksim Rudnev

机构 * Independent researcher, Lisbon, Portugal(独立研究者,里斯本,葡萄牙) University of Waterloo, ON, Canada(滑铁卢大学,安大略省,加拿大)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究使用校准的LLM标注和软标签训练,将基于Schwartz人类基本价值理论的社交媒体文本价值表达迁移到编码器模型,实现可扩展预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25991 2026-07-31 cs.AI cs.CV 版本更新 57%

Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline

面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型

Haiyang Li, Yaxiong Wang, Shengeng Tang, Yuchen Zhang, Lianwei Wu, Lechao Cheng, Liu Liu, Chaofeng Dong, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 39 篇

2607.27917 2026-07-31 cs.AI 新提交 88%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07853 2026-07-31 cs.CR cs.AI 版本更新 83%

FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments

FinVault:在执行 grounded 环境中评估金融代理安全性的基准测试

Zhi Yang, Runguo Li, Qiqi Qiang, Jiashun Wang, Fangqi Lou, Mengping Li, Dongpo Cheng, Rui Xu, Heng Lian, Shuo Zhang, Xiaolong Liang, Xiaoming Huang, Zheng Wei, Zhaowei Liu, Xin Guo, Huacan Wang, Ronghao Chen, Liwen Zhang

机构 * SUFE(上海财经大学) CUHKSZ(香港中文大学) SUIBE(上海对外经贸大学) FDU(福建大学) XDU(西安电子科技大学) BUPT(北京邮电大学) Tencent(腾讯) UCAS(中国科学院大学) PKU(北京大学) QuantaAlpha(量子Alpha)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

AI总结 FinVault 是首个针对金融代理的执行 grounded 安全基准测试,通过31个监管案例驱动的沙盒场景和963个测试用例,评估金融代理在现实金融环境中的安全性和防御有效性。

Comments After further review of the current submission, we have identified potential legal and intellectual property concerns associated with keeping the manuscript publicly available as a preprint. In particular, there are ongoing considerations regarding institutional affiliation information, intellectual property ownership, and related compliance matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06354 2026-07-31 cs.CY cs.HC cs.SY eess.SY 版本更新 83%

The Missing Variable: Socio-Technical Alignment in Risk Evaluation

缺失的变量:风险评估中的社会技术对齐

Niclas Flehmig, Mary Ann Lundteigen, Shen Yin

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CY

AI总结 本文提出社会技术对齐STA变量,用于改进AI安全关键系统风险评估,通过案例研究展示其在捕捉社会技术安全影响方面的贡献。

Comments This paper was accepted for the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新 82%

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏