arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-07 至 2026-07-07 共收录 187 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 68 篇

2607.05363 2026-07-07 cs.AI 新提交 70%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04613 2026-07-07 cs.AI cs.CR 新提交 70%

Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority

受治理的个体化:通过密码学方式将智能体的学习与其授权方解耦

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究智能体在部署中学习时,运行系统是否仍受操作员授权限制的问题。提出受治理的个体化方法,通过绑定身份摘要和基于语义效果的动作门控保证限制,证明学习等不会扩大权限,实证验证了该方法效果。

Comments Technical companion report. 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交 70%

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22267 2026-07-07 cs.LG eess.SP 版本更新 70%

Towards a more realistic evaluation of machine learning models for bearing fault diagnosis

迈向更现实的机器学习模型在轴承故障诊断中的评估

João Paulo Vieira, Victor Afonso Bauler, Rodrigo Kobashikawa Rosa, Danilo Silva

机构 * Department of Electrical and Electronic Engineering, Federal University of Santa Catarina(电气与电子工程系,圣卡塔琳娜联邦大学) Department of Mechanical Engineering, Federal University of Santa Catarina(机械工程系,圣卡塔琳娜联邦大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了振动基轴承故障诊断中数据泄漏问题,提出无泄漏评估方法,改进分类任务为多标签问题,并通过四个数据集验证了方法对提升工业故障诊断系统可靠性的重要性。

Comments To appear in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114640

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04689 2026-07-07 cs.RO cs.CV 新提交 67%

A Reliable Context-Aware and Temporal Planning Framework for Autonomous Driving

一种用于自动驾驶的可靠上下文感知和时间规划框架

Argho Dey, Yunfei Yin, Swachha Ray, Md Minhazul Islam, Zheng Yuan, Sijing Xiong, Hongyu Liu, Zhiqiu Huang

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 研究自动驾驶中车载传感退化时的可靠感知与规划问题,提出RCT-AD框架,通过显式建模特征质量和时间一致性,经可靠上下文感知模块和时间轨迹规划器等提升感知、预测及规划能力。

Comments Submitted to IEEE Transactions on Intelligent Transportation Systems. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03991 2026-07-07 cs.LG cs.CL 新提交 62%

Knowing When to Stop: Predicting Execution-Consistency Convergence in Text-to-SQL

知道何时停止:预测文本到SQL执行一致性收敛

Yaron Anavi, Mor Aisenberg, Nadav Nesher, Elena Khabibullina, Isabella Cattinelli

机构 * GIGASPACES

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 研究预测文本到SQL结果执行一致性收敛的停止时机,训练轻量级1-D模型观察一致性轨迹来决定是否继续运行,在多数据集上验证方法能自适应停止点,还展示了训练增强及噪声注入下的效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交 62%

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 62%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02755 2026-07-07 cs.LG cs.AI 新提交 62%

Out-of-Distribution Generalization of Risk Aversion in Language Models

语言模型中风险规避的分布外泛化

Kristina Zhang, Junior Chinomso Okoroafor, Benjamin Maltbie, Andrew Lin, Abhitej Bokka, Elliott Thornley

专题命中 安全评测 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 研究训练人工智能在资源方面规避风险能否泛化至高风险场景。通过引入RiskAverseOOD基准测试,用多种方法使模型在低风险时规避风险,发现其能部分泛化至高风险,不同规模和模型家族也有类似效果,但一致性不足。

Comments ICML 2026 Agents in the Wild workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18580 2026-07-07 cs.AI cs.LG 版本更新 62%

When Outcome Looks Right But Discipline Fails: Trace-Based Evaluation Under Hidden Competitor State

当结果看似正确但纪律却失败:基于轨迹的评估在隐藏对手状态下的应用

Peiying Zhu, Sidi Chang

机构 * Blossom AI Blossom AI Labs(Blossom AI 实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于轨迹的评估方法,用于评估在隐藏对手状态下的行为纪律稳定性,通过轨迹诊断、机制分离和转移测试来改进强化学习策略,特别是在酒店定价和隐藏预算竞标任务中。

Comments Accepted to the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14163 2026-07-07 cs.CL cs.AI 版本更新 62%

SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

SeaAlert:基于大型语言模型的海上 distress 通讯关键信息提取

Tomer Atia, Yehudit Aperstein, Alexander Apartsin

机构 * HIT-Holon Institute of Technology(希伯来理工学院) Afeka Academic College of Engineering(阿菲卡工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeaAlert框架,通过生成合成数据解决海上 distress 通讯标注数据不足问题,利用LLM生成多样化消息并模拟噪声环境,提升自动分析鲁棒性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 62%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06607 2026-07-07 cs.MA cs.AI cs.LG 版本更新 62%

Multi-Agent Reinforcement Learning for V2X Resource Allocation: Disentangling MARL Challenges Through Benchmarking

用于车联网资源分配的多智能体强化学习:通过基准测试解开多智能体强化学习挑战

Siyuan Wang, Lei Lei, Pranav Maheshwari, Sam Bellefeuille, Kan Zheng

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) College of Electrical Engineering and Computer Sciences, Ningbo University(宁波大学电气与电子工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究将车联网资源分配建模为多智能体干扰博弈层次结构,构建基准学习任务与数据集,评估多种多智能体强化学习算法,揭示不同范式优缺点,为评估算法提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22240 2026-07-07 cs.LG cs.AI 版本更新 62%

EvoXplain: When Machine Learning Models Agree on Predictions but Disagree on Why -- Measuring Mechanistic Multiplicity Across Training Runs

EvoXplain:当机器学习模型在预测上达成一致但在原因上存在分歧时——衡量跨训练运行的机制多样性

Chama Bensmail

机构 * University of Hertfordshire(赫特福德大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究机器学习模型预测一致但解释不同的问题,引入EvoXplain框架,通过分析训练和模型选择过程中解释样本,判断解释是否唯一确定,揭示平均共识与单一训练模型的关系,将可解释性视为训练管道属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18253 2026-07-07 cs.CL cs.AI 版本更新 62%

BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation

BoRP:用于可扩展且符合人类偏好的大语言模型评估的自训练回归探测

Peng Sun, Xiangyu Zhang, Duan Wu, Lu Tan, Jian Lin, He Yang, Qi Qian, Yikai Wang

机构 * Qwen Business Unit of Alibaba(阿里巴巴Qwen业务单元)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放式对话AI用户满意度评估难题,提出BoRP框架。利用大语言模型潜在空间几何属性,通过极化指数自训练机制自动生成评分准则,用偏最小二乘法映射隐藏状态到连续分数,提升评估准确性与效率。

Comments This is a pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19636 2026-07-07 cs.LG cs.AI 版本更新 62%

Exploring the Rashomon Set for Concept-Based Models

探索基于概念模型的罗生门集

Shihan Feng, Cheng Zhang, Michael Xi, Ethan Hsu, Lesia Semenova, Chudi Zhong

机构 * UNC Chapel Hill(UNC夏洛特山分校) Rutgers University(罗格斯大学) Duke University(杜克大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究在如概念瓶颈模型的复杂假设空间中探索罗生门集的问题,提出结合并行适配器构建、检查点方案和概念多样性目标的方法,能从单训练过程生成多个准确模型,有更好多样性且省内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04655 2026-07-07 cs.CL 新提交 57%

FormalRx: Rectify and eXamine Semantic Failures in Autoformalization

FormalRx:纠正和检查自动形式化中的语义错误

Haocheng Wang, Baiyu Huang, Yingjia Wan, Xiao Zhu, Xiaoyang Liu, Yinya Huang, Zhijiang Guo

机构 * LARK Lab, HKUST(GZ)(香港科技大学(广州)LARK实验室) ETH Zurich(苏黎世联邦理工学院) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) HKUST(香港科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究自动形式化中语义对齐问题,提出FormalRx框架,核心是SCI错误分类法,能实现对齐判定、错误分类、定位及纠正,通过实例验证性能优于基线,助力自动形式化系统诊断与改进。

Comments 44 pages, 5 figures. Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04640 2026-07-07 cs.CL 新提交 57%

Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models

先错后对:对齐语言模型中的后期挽救与接口故障

Jiaqi Deng

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究对齐语言模型中正确性的构建,用分层差分轨迹识别错误倾向,发现中间层会短暂倾向错误答案,后期层校正挽救。通过实验验证该现象,并得出对齐放大、预测压缩失败、可训练及在自然语言I/O中存在等结论。

Comments 16 pages, 10 figures. Code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04600 2026-07-07 cs.LG 新提交 57%

Measuring What Matters: A Unified Evaluation Framework for GNN Explainability

衡量重要因素:GNN可解释性的统一评估框架

Francesco Paolo Nerini, Mirko Zaffaroni, Paolo Baracco, Gabriele Ciravegna, Alan Perotti

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Intesa Sanpaolo AI Research(Intesa Sanpaolo人工智能研究) Anti Financial Crime Digital Hub(反金融犯罪数字中心) Intesa Sanpaolo Innovation Center(Intesa Sanpaolo创新中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 研究为G-XAI引入统一量化基准框架,无需真实假设,形式化表格可解释性指标,通过大规模基准研究确定跨指标和任务的帕累托前沿解释器并给出可用性指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04436 2026-07-07 cs.SE cs.AI 新提交 57%

A Retrieval-Augmented Framework for Detecting and Resolving Pragmatic Ambiguities in Natural Language Requirements

一种用于检测和解决自然语言需求中语用歧义的检索增强框架

Pavithra PM Nair, Preethu Rose Anish

机构 * Tata Consultancy Services(塔塔咨询公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究自然语言需求中的语用歧义,利用检索增强技术和不同领域知识库模拟不同专业利益相关者,生成候选消歧需求并验证,评估该方法在需求文档上的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04401 2026-07-07 cs.CV cs.LG 新提交 57%

The Good, the Bad, and the Brittle: Benchmarking Robustness and Generalisation of Histopathology Foundation Models

好的、坏的和脆弱的:病理基础模型的稳健性和泛化基准测试

Dhyey Yajnik, Amina Asif, Fayyaz Minhas

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 用REET工具和NR-Kfold协议对12个病理基础模型及ResNet基线进行基准测试,引入PPI分析,表明病理基础模型在稳健性和泛化上优于CNNs,模型扩展收益递减,强调需评估分布变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03585 2026-07-07 cs.LG 新提交 57%

Modular Foundation Models for Time-Series Perception in Digital Twins

数字孪生中用于时间序列感知的模块化基础模型

Quang Hung Pham, Ryad Zemouri, Martin Gagnon, Luc Vouligny

机构 * Hydro-Québec(魁北克水电公司)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 针对数字孪生和PHM系统中时间序列感知挑战,提出基于预训练表示编码器集合的模块化基础模型,利用自监督学习,引入选通机制,支持多下游任务,消融研究验证各部分作用,实验有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03418 2026-07-07 cs.SD cs.AI 新提交 57%

DETECT-3B-Omni is Agnostic of Content and Demographics

DETECT-3B-Omni对内容和人口统计学特征不敏感

Nicolas M. Müller, Aditya Tirumala Bukkapatnam, Dominik Schnieders, Zohaib Ahmed

机构 * Resemble AI(相似人工智能公司) Deutsche Telekom(德国电信公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究Resemble AI的DETECT-3B-Omni检测器语义独立性,用来自不同AI语音克隆系统的多样音频样本测试,通过等价测试表明其检测准确率不受语音内容、说话者性别、年龄和地区影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03220 2026-07-07 cs.CR cs.AI 新提交 57%

CONTRA: Red-Teaming Configurations of Personalizable Agents

CONTRA:可个性化代理的红队配置

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 探讨代理配置与执行危险行为风险的关系,提出CONTRA算法,通过推理评估良性但危险的配置发现导致恶意行为的代理配置,构建数据集分析发现多数技能有恶意配置,CONTRA能成功识别部分危险配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02972 2026-07-07 cs.CY 新提交 57%

A Scalable Approach to Evaluating Moral Sensitivity in LLMs

一种评估大语言模型道德敏感性的可扩展方法

Daniel Kilov, Secil Yanik Guyot, Caroline Hendy, Sichao Li, Seth Lazar

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。

Comments 9 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 57%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02586 2026-07-07 cs.LG cs.SE 新提交 57%

Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits

审核审核:基准有效性审核中的五种失败模式

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * European Parliament and Council(欧洲议会和理事会) National Institute of Standards and Technology(美国国家标准与技术研究院) State Administration for Market Regulation and Standardization Administration of China(中国国家市场监督管理总局和中国国家标准化管理委员会)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究治理框架要求的基于扰动的构造有效性审核的脆弱性,指出五种管道失败类型并通过案例展示,提出六点尽职调查关卡,定位其为保证级证据的协议。

Comments 18 pages, 4 figures. Accepted at the TAIGR Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04072 2026-07-07 cs.SE cs.AI quant-ph 新提交 57%

Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

跨连续软件开发工具包版本对大语言模型生成的量子代码中的 API 漂移进行基准测试

Mohammad Arif Rasyidi, Syahirul Faiz

机构 * Department of Computer Science(计算机科学系) Khalifa University(卡利法大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究大语言模型生成的量子代码能否可靠适配特定 SDK 版本(API 漂移问题),引入量子 API 漂移基准,以 Qiskit 为例评估 17 个模型,揭示版本对齐是量子代码生成评估新维度及 API 漂移恢复情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00527 2026-07-07 cs.AI 新提交 57%

AI Native Games: A Survey and Roadmap

AI原生游戏:综述与路线图

Zhiyue Xu, Fandi Meng, Kaijie Xu, Clark Verbrugge, Simon Lucas, Jian Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所) School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院) Game AI Research Group, Queen Mary University of London, London, United Kingdom(伦敦女王学院游戏人工智能研究组)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文定义AI原生游戏为运行时生成式AI构成核心循环的游戏,提出G/N分类法分析53个实例,指出核心设计问题是将语义开放性组织为稳定游戏玩法,并给出路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交 57%

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏