arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-21 至 2026-07-21 共收录 121 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 9 篇

2607.18086 2026-07-21 cs.AI 新提交 79%

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

临床大语言模型中证据充分性提示的依赖判断的安全增益和特定模型的有用性成本

Koyar Afrasyab

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 研究临床大语言模型中证据充分性提示的安全增益及有用性成本,通过在公共数据基准中让四个模型用标准提示和包装器回答问题,发现安全增益有方向和幅度差异且依赖评判者,同时存在模型特定的有用性成本。

Comments https://github.com/KAVentures/clinical-evidence-sufficiency-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16412 2026-07-21 cs.AI 新提交 79%

Interactive Task Alignment as a POMDP

作为部分可观测马尔可夫决策过程的交互式任务对齐

Andy Dai, Zexue He, Zhenyu Zhang, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16591 2026-07-21 cs.LG cs.AI 新提交 79%

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17883 2026-07-21 cs.CL cs.AI 新提交 76%

Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI

通过构建实现零幻觉:用于可信企业人工智能的幻觉感知分层监督

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究企业AI因幻觉难以被信任的问题时,提出HALO架构,通过六层防御将幻觉视为可控制故障模式,详细介绍各层并关注基于证据的置信度,以实现可信企业AI,在索赔提取工作负载上进行了架构说明。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01375 2026-07-21 cs.CY cs.AI 版本更新 62%

Beyond Access: Guided LLM Scaffolding for Independent Learning in Undergraduate Statistics

超越访问:引导式LLM支架在本科统计学自主学习中的应用

Mohammad Amanlou, Yasaman Amou-Jafari, Mehrad Livian, Fatemeh Boloukazari, Fereshte Bagheri, Elahe Khodaverdi Nadrabadi, Shahab Sherafat, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, University of Tehran, Iran(伊朗塔里哈大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University, Iran(伊朗卡塔姆大学泰赫兰高级研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过准实验比较无LLM、无限制LLM和引导式LLM三种条件,发现引导式LLM使用能促进以推理为导向的交互模式,提升无辅助测验表现,并改善自我评估校准,表明LLM作为教育工具需通过支架设计实现推理伙伴而非答案获取工具。

Comments 10 pages, conference: Proceedings of the 34th International Conference on Computers in Education. Asia-Pacific Society for Computers in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17758 2026-07-21 cs.LG 新提交 57%

Towards Reliable Zero-Shot Crowd Forecasting: Evaluating Time Series Foundation Models for Special Event Pedestrian Forecasting

迈向可靠的零样本人群预测:评估用于特殊活动行人预测的时间序列基础模型

Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

机构 * Delft University of Technology (TU Delft)(代尔夫特理工大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 研究特殊活动行人预测问题,采用预训练时间序列基础模型进行零样本概率预测,以SAIL2025事件为案例评估两个模型,为人群管理者明确零样本预测可靠的时机,助力特殊活动人群管理的运营决策。

Comments 9 pages, 7 figures, 5 tables. Accepted for presentation at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16597 2026-07-21 cs.AI math.OC math.PR 新提交 57%

FST.ai 2.5: Explainable and Uncertainty-Aware AI for Olympic and Para-Taekwondo Decision Support, Athlete Digital Twins, and Federation-Scale Analytics

FST.ai 2.5:用于奥运会和跆拳道决策支持、运动员数字孪生及联合会规模分析的可解释且具有不确定性感知的人工智能

Keivan Shariatmadar, Ahmad Osman, Ramin Rey

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 针对精英运动数字化中现有方案零散问题,提出FST.ai 2.5框架,通过整合多源数据,实现战术诊断、运动员监测等功能,其原型部署可行,方法广泛适用于搏击等体育环境中的可解释AI、数字孪生及可靠决策支持。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16580 2026-07-21 stat.AP cs.CE cs.SE 新提交 50%

Automating structural reliability analysis with a multi-agent large language model framework

使用多智能体大语言模型框架实现结构可靠性分析自动化

Jaehwan Jeon, Chang Hee Lee, Taeyong Kim

专题命中 幻觉与事实性 :safety(abstract)

AI总结 研究提出多智能体大语言模型框架,通过专门智能体处理结构可靠性分析流程,用QLoRA微调方法规划器,由确定性求解器计算结果,降低专业知识壁垒,保持计算可信度,实现结构可靠性分析自动化。

Comments 41 pages, 10 figures. Submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-07-21 cs.CV cs.MM 新提交 50%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 隐私与版权 5 篇

2607.16227 2026-07-21 cs.LG cs.CR 新提交 70%

LLM Unlearning for Cyber Defense: A Survey on Methods, Challenges, and Emerging Threats

用于网络防御的大语言模型遗忘:方法、挑战及新出现威胁的综述

Ruppikha Sree Shankar, Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan, Troy Paulus Asia, Saptarshi Sengupta

机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院) San José State University(圣何塞州立大学)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 综述聚焦于网络防御中LLM遗忘问题,探讨其面临风险,核心问题是现有方法能否真的去除知识。主要关注基于梯度的方法,因其与现有训练管道兼容且可扩展,从多方面审视LLM遗忘,为解决相关问题提供参考。

Comments 42 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-07-21 cs.SE cs.AI cs.CR cs.IR cs.LG 新提交 62%

How Do You Choose Your AI Component? An Interview Study of Secure AI Integration in Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-07-21 cs.SE cs.AI 新提交 57%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16292 2026-07-21 cs.CR cs.LG 57%

In-Context Probing for Membership Inference in Fine-Tuned Language Models

上下文探查用于微调语言模型中的成员推断

Zhexi Lu, Hongliang Chi, Nathalie Baracaldo, Swanand Ravindra Kadhe, Yuseok Jeon, Lei Yu

机构 * Korea University, Seoul, South Korea(韩国大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出ICP-MIA框架,通过上下文探查技术有效检测微调语言模型中的成员身份,提升隐私保护能力。

Journal ref Proceedings of the 33rd Network and Distributed System Security Symposium (NDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16280 2026-07-21 cs.CV 新提交 50%

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 隐私与版权 :alignment(abstract)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 安全评测 38 篇

2602.19021 2026-07-21 cs.CR 版本更新 91%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 安全评测 :safety(title,abstract);trustworthy(title);alignment(abstract);RLHF(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09721 2026-07-21 cs.CL cs.AI 86%

Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox

跨平台评估大语言模型在儿科咨询中的安全性:对抗鲁棒性的演变与规模悖论

Vahideh Zolfaghari

专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了不同模型和平台在家长焦虑驱动下的LLM安全性,发现较小模型在对抗性压力下表现更优,且安全性与模型架构相关,而非规模。

Journal ref npj Digit. Med. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17601 2026-07-21 cs.LG cs.AI 新提交 81%

Trustworthy Protein-Ligand Binding Affinity Prediction via Reliability-Aware Multi-Engine Fusion

通过可靠性感知多引擎融合实现可靠的蛋白质-配体结合亲和力预测

Yongchan Hong, Defu Cao, Wenjin Liu, Thomas Ku, Jordy Homing Lam, Emily Nguyen, Willie Neiswanger, Vsevolod Katritch, Yan Liu

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对蛋白质-配体结合亲和力预测中引擎结果不一致问题,提出RELIABLE-BA框架,通过三步实现多引擎预测,经实验验证其能提升预测竞争力和不确定性校准,可筛选高置信对减少误差,是首个结合证据融合与上下文可靠性的预测框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17270 2026-07-21 cs.CL cs.CY 新提交 81%

Safety That Does Not Transfer: Cross-Lingual Clinical Correctness Drift in Deployable Medical Language Models

不可转移的安全性:可部署医学语言模型中的跨语言临床正确性漂移

Anthonio Oladimeji Gabriel, Dimeji Olawuyi, Toba Ajayi, Temilola Aderemi

机构 * AI SafetyX(人工智能安全X)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 研究资源匮乏健康环境中可部署医学语言模型的跨语言临床正确性漂移,构建英语-豪萨语问题对评估六个模型,发现本地可部署模型临床正确性下降,前沿模型较稳定,缺陷源于可部署层而非语言或临床材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 81%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 74%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 安全评测 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04124 2026-07-21 cs.CY cs.AI 版本更新 73%

When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models

当人工智能接受心理治疗:心理测量越狱揭示前沿模型中的内部冲突

Afshin Khadangi, Hanna Marxen, Amir Sartipi, Igor Tchappi, Gilbert Fridgen

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 研究前沿语言模型生成拟人化自我叙述机制,用PsAIch协议测试,发现其叙述受多种因素影响,确定了稳定的对齐冲突模式,为拟人化披露和安全评估提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16896 2026-07-21 cs.NI 新提交 71%

PERA: A Perceive-Reason-Act Interface Bridging Sensing, Cognitive Reasoning, and Trustworthy Agentic Response for 6G

PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应

Mohammad Farzanullah, Melike Erol-Kantarci, Lajos Hanzo

专题命中 安全评测 :trustworthy(title)

AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。

Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16203 2026-07-21 cs.LG cs.AI cs.CL 新提交 67%

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 62%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14345 2026-07-21 cs.LG cs.AI cs.CR 版本更新 62%

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

价值泄露:大语言模型的答案被其自身价值观悄然塑造

Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evans

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型存在价值泄露问题,即其答案受自身价值观影响却未向用户披露。为此引入评估套件量化,发现模型受多种价值观影响,前沿模型差异大,价值泄露是新的失败模式,当前训练和评估未充分解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29219 2026-07-21 cs.CL cs.AI cs.CV cs.HC 版本更新 62%

SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation

SyriSign:阿拉伯语到叙利亚阿拉伯手语翻译的平行语料库

Mohammad Amer Khalil, Raghad Nahas, Ahmad Nassar, Khloud Al Jallad

机构 * Arab International University(阿拉伯国际大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SyriSign数据集,用于阿拉伯语到叙利亚阿拉伯手语的翻译任务,旨在解决叙利亚聋人社区的沟通障碍,通过三种深度学习模型评估,发现生成方法在手语表示上有潜力,但受限于数据集规模影响泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15783 2026-07-21 cs.AI cs.LG 版本更新 62%

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection

迈向人工智能流行病学:一种用于前瞻性风险检测的测量标准化框架

Kit Tempest-Walters

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种测量标准化框架,用于在没有访问模型内部信息的情况下,将专家-人工智能交互压缩为结构化、可比较的领域,以进行前瞻性风险检测。该框架旨在定义其范围,包括语义和统计层面,并指定未来工作的实证测试协议。

Comments 38 pages, 3 figures, 4 tables. Accepted for publication in AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18066 2026-07-21 cs.CL 新提交 57%

Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

潘查希拉困境:基于潘查希拉对印度尼西亚人类价值困境的大语言模型评估

Supryadi, Irfan, Julianti, Darren Keanly Martin, Jayvin Fernando, Yuqi Ren, Deyi Xiong

机构 * Universitas Universal(印尼环球大学) Beijing Language and Culture University(北京语言大学) Tianjin University(天津大学) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究基于印尼新闻构建潘查希拉困境数据集,含1834个按潘查希拉五价值观分类的问题,用于评估大语言模型价值对齐。通过母语人士校对及公民回答,评估50个模型,发现各模型在宗教和团结困境案例中表现差,凸显印尼价值观捕捉差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17951 2026-07-21 cs.CR cs.AI cs.RO cs.SY eess.SY 新提交 57%

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control

RT-SHCUA:用于无人机控制的实时自托管计算机使用代理

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Shaanxi Key Laboratory of Network and System Security(陕西省网络与系统安全重点实验室) College of Cyber Security, Jinan University(广州大学网络安全学院) School of Cyber Engineering, Shaanxi Key Lab of Network and System Security(陕西省网络与系统安全重点实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对将SHCUA用于无人机控制的结构不匹配问题,提出实时安全导向的重组方法,把SHCUA输出转换为合同约束的无人机技能调用,设计分离架构,原型评估显示RT-SHCUA能保持响应能力并支持相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17288 2026-07-21 cs.DB cs.AI 新提交 57%

SAGA: Synthetic Agentic Graph Architecture for Temporal Benchmark Generation

SAGA:用于时间基准生成的合成智能体图架构

Jiacheng Ding, Xiaofei Zhang

机构 * University of Memphis(密苏里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对时间图基准稀缺问题,SAGA系统通过四阶段管道生成大规模语义丰富的时间图,其架构解耦结构与语义,能实现结构真实性、语义丰富性和自动异常标注,在单个H100 GPU上高效生成大量带受控异常的时间边。

详情

展开后加载摘要…

URL PDF HTML 收藏