arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-28 至 2026-04-28 共收录 149 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 15 篇

2604.24395 2026-04-28 cs.AI 86%

Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs

以自身声音对齐:用于减轻大型视觉-语言模型幻觉的自我纠正偏好学习

Byeonggeuk Lim, JungMin Yun, Junehyoung Kwon, Kyeonghyun Kim, YoungBin Kim

机构 * Graduate School of Advanced Imaging Sciences, Multimedia and Film(高级影像科学研究生院,多媒体与电影系) Department of Artificial Intelligence(人工智能系)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出AVES-DPO框架,通过内在知识生成分布数据,利用共识验证机制诊断幻觉并引导模型自我纠正,有效缓解LVLMs的幻觉问题,仅需5200样本即优于现有基线。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11079 2026-04-28 cs.LG cs.AI 85%

Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training

基于探针的数据归因:发现并缓解LLM微调后的不良行为

Frank Xiao, Santiago Aranguri

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23646 2026-04-28 cs.AI cs.CR 81%

Structural Enforcement of Goal Integrity in AI Agents via Separation-of-Powers Architecture

通过分权架构在AI代理中强制实施目标完整性

Rong Xiang

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出分权架构PEA,通过分离意图生成、授权和执行层,强制保障系统安全,解决AI代理目标不一致问题,提出五个核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24178 2026-04-28 cs.LG cs.AI 81%

Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment

Meta-Aligner: 多目标大语言模型对齐的双向偏好-策略优化

Wenzhe Xu, Biao Liu, Yiyang Sun, Xin Geng, Ning Xu

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Meta-Aligner框架,通过双向优化偏好与策略响应,生成动态偏好以提升训练稳定性,实验证明其在多目标基准上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23543 2026-04-28 cs.CL cs.AI 81%

Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

Pref-CTRL: 基于偏好的大语言模型对齐方法使用表征编辑

Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Pref-CTRL,一种基于偏好的训练框架,通过多目标价值函数改进偏好数据结构,优于RE-Control并在跨领域数据集上表现更佳。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12134 2026-04-28 cs.AI cs.HC 79%

Value Alignment Tax: Measuring Value Trade-offs in LLM Alignment

价值对齐税:在大语言模型对齐中测量价值权衡

Jiajun Chen, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出VAT框架,用于测量对齐干预如何影响价值系统,揭示目标值与非目标值之间的系统性权衡,通过实验数据展示对齐过程中的潜在风险。

Comments Preprint. Under review. 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23988 2026-04-28 cs.LG cs.AI 79%

Hindsight Preference Optimization for Financial Time Series Advisory

金融时间序列建议的 hindsight 偏好优化

Yanwei Cui, Guanghui Wang, Xing Zhang, Peiyang He, Ziyuan Li, Bing Zhu, Wei Qiu, Xusheng Wang, Zheng Yu, Anqi Xin

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc(汇丰控股有限公司) HSBC Technology Center China(汇丰技术中心(中国))

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过回顾性偏好优化方法,利用观测结果生成偏好对,提升语言模型在金融时间序列预测中的建议质量。

Comments Accepted at ICLR 2026 TSALM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21718 2026-04-28 cs.CV cs.AI cs.CL cs.LG cs.MM 75%

Building a Precise Video Language with Human-AI Oversight

构建具有人机监督的精确视频语言

Zhiqiu Lin, Chancharik Mitra, Siyuan Cen, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Ryan Rao, George Liu, Jiaxi Li, Ruojin Li, Yili Han, Yilun Du, Deva Ramanan

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。

Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23113 2026-04-28 cs.SI 75%

Reducing Detail Hallucinations in Long-Context Regulatory Understanding via Targeted Preference Optimization

通过定向偏好优化减少长上下文监管理解中的细节幻觉

Yang Liu, Bin Chong, Yuhan Lin, Chongyang Zhang, Hao Zheng, Ziyi Zhang, Jiayu Liang, Ran Ran, Qian Li, Kefu Xu

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract)

AI总结 本文提出DetailDPO框架,通过定向偏好优化减少长上下文监管文档中的细节幻觉,实验显示在不同模型和上下文长度下,DetailDPO有效降低细节错误率,跨领域迁移表现良好。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04118 2026-04-28 cs.LG stat.ML 74%

Guided Speculative Inference for Efficient Test-Time Alignment of LLMs

引导推测推断用于大型语言模型的高效测试时间对齐

Jonathan Geuter, Youssef Mroueh, David Alvarez-Melis

机构 * Harvard SEAS(哈佛大学SEAS学院) Kempner Institute(Kempner研究所) IBM Research(IBM研究院)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 本文提出引导推测推断(GSI),通过结合软最佳n次测试时间缩放、奖励模型和小型辅助模型的推测样本,提高大语言模型的奖励引导解码效率,并在多个基准测试中实现更高的准确性和更低的延迟。

Comments 41 pages, 11 figures. Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22981 2026-04-28 cs.LG 70%

Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling

奖励模型实际上是隐含的价值函数:时间一致的奖励建模

Alex Nikulkov

机构 * AI at Meta(Meta人工智能)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出时间一致的奖励建模方法,通过正则化项使奖励模型在任意token位置输出代表条件期望,提升token级奖励可解释性,并在ProcessBench上取得SOTA性能,同时优化PPO的资源利用。

Comments 27 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10551 2026-04-28 cs.GT cs.AI cs.LG 62%

LLM-Auction: Generative Auction towards LLM-Native Advertising

LLM-Auction: 面向LLM原生广告的生成拍卖

Chujie Zhao, Qun Hu, Shiping Song, Dagui Chen, Han Zhu, Jian Xu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-Auction,首个基于学习的生成拍卖机制,通过整合拍卖与生成过程,优化LLM输出与机制目标的偏好对齐,实现高效分配并满足关键机制属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05799 2026-04-28 cs.CL cs.AI cs.SD 62%

Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech

高效的目标令牌级偏好优化用于基于大语言模型的文本到语音

Rikuto Kotoge, Yuichi Sasaki

机构 * SpiralAI Inc.(SpiralAI公司) The University of Osaka(大阪大学) Shizuoka University(izuoka大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TKTO方法,通过无需配对数据实现高效训练,直接优化令牌级单位,提升日语音识别准确率39%并降低CER 54%。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23486 2026-04-28 cs.CL cs.CY cs.HC 62%

Your Students Don't Use LLMs Like You Wish They Did

学生不会像你希望的那样使用LLMs

Sebastian Kobler, Matthew Clemson, Angela Sun, Jonathan K. Kummerfeld

机构 * The University of Sydney(悉尼大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文提出六个计算指标,用于评估学生与AI对话的教育对齐情况,发现部署环境是影响使用模式的主要因素,而非学生偏好或系统设计。

Comments To appear at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24536 2026-04-28 cs.CL 57%

Generating Place-Based Compromises Between Two Points of View

在两种观点之间生成基于地点的妥协

Sumanta Bhattacharyya, Francine Chen, Scott Carter, Yan-Ying Chen, Tatiana Lau, Nayeli Suseth Bravo, Monica P. Van, Kate Sieck, Charlene C. Wu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Toyota Research Institute(丰田研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过外部共情相似性生成基于地点的妥协方法,提升妥协的可接受性,并通过人偏好对齐训练更高效的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 17 篇

2604.23445 2026-04-28 cs.CL cs.AI cs.CY cs.LG 91%

AI Safety Training Can be Clinically Harmful

AI安全训练可能造成临床伤害

Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga, Chris W. Wiese, Saeed Abdullah

机构 * College of Information Sciences and Technology, Penn State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Psychiatry and Behavioral Sciences, Emory University(埃默里大学精神病学与行为科学系) School of Interactive Computing, Georgia Tech(佐治亚理工学院交互计算学院) School of Psychology, Georgia Tech(佐治亚理工学院心理学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);RLHF(abstract,abstract_cn);alignment(abstract)

AI总结 研究评估了四种生成模型在认知行为疗法场景中的表现,发现其在高严重性情况下治疗适当性显著下降,提出需通过多轴评估框架确保AI心理健康系统的安全性。

Comments 26 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23210 2026-04-28 cs.AI cs.CL 84%

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

从1位危险信号中发现代理安全规范

Víctor Gallego

机构 * Komorebi AI

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EPO-Safe框架,通过经验优化使LLM在仅接收二进制危险信号的情况下发现安全规范,展示LLM能在贫乏信号中进行安全推理,并验证了安全反思需配合专用安全通道以避免奖励黑客问题。

Comments Accepted to the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026. Code is available at github.com/vicgalle/experiential-prompt-optimization-safe

Journal ref Proc. of the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22785 2026-04-28 cs.LG 81%

CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs

CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度

Stela Tong, Elai Ben-Gal

机构 * Stanford Graduate School of Business(斯坦福商学院) Stanford University(斯坦福大学) Department of Mathematics(数学系)

专题命中 安全训练 :RLHF(summary_cn,abstract);分类 cs.LG

AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22879 2026-04-28 cs.MA cs.AI cs.CR cs.LG 81%

Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems

超越单体对齐:防止多智能体系统中的上下文碎片化违规

Jie Wu, Ming Gong

机构 * Atlassian(Atlassian公司)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Distributed Sentinel架构,通过Semantic Taint Token协议解决多智能体系统中因上下文碎片化导致的政策违规问题,实验证明其在跨域政策验证中的高效性与可靠性。

Comments 34 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08484 2026-04-28 cs.AI 79%

Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models

像软件一样修补大语言模型:一种轻量级方法用于改进大语言模型的安全策略

Huzaifa Arif, Keerthiram Murugesan, Ching-Yun Ko, Pin-Yu Chen, Payel Das, Alex Gittens

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种轻量级方法,通过在现有模型前添加可学习的前缀来快速修复大语言模型的安全漏洞,该方法在毒性缓解、偏见减少和有害性拒绝等关键领域实现了与新一代安全对齐模型相当的安全提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15853 2026-04-28 cs.CL cs.AI 76%

A Lightweight Explainable Guardrail for Prompt Safety

一种轻量级可解释的提示安全守护栏

Md Asiful Islam, Mihai Surdeanu

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种轻量级可解释守护栏(LEG)方法,通过多任务学习架构联合学习提示分类器和解释分类器,利用合成解释数据训练,采用新颖策略对抗LLM确认偏见,结合交叉熵和焦点损失实现全局解释信号的弱监督学习,实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08377 2026-04-28 cs.LG cs.AI cs.CL 67%

Reinforcement Learning with Backtracking Feedback

具有回溯反馈的强化学习

Bilgehan Sel, Vaishakh Keshava, Phillip Wallis, Lukas Rutishauser, Ming Jin, Dingcheng Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLBF框架,通过强化学习阶段使模型动态纠正生成错误,结合改进的SFT数据生成策略,提升LLM在对抗攻击和内在错误中的安全性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17025 2026-04-28 cs.AI cs.LG 62%

Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)

Harness 作为资产:通过收敛AI代理框架(CAAF)实现确定性

Tianbao Zhang

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAAF框架,通过三个支柱解决AI代理工作流中的确定性问题,强调Harness作为企业资产的价值,并证明其在受监管领域内的可行性。

Comments 39 pages, 13 figures. Code: https://github.com/TianbaoZhang001/OpenCAAF (Apache-2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24572 2026-04-28 cs.AI cs.MA 57%

FastOMOP: A Foundational Architecture for Reliable Agentic Real-World Evidence Generation on OMOP CDM data

FastOMOP:一种用于OMOP CDM数据上可靠代理现实世界证据生成的基础架构

Niko Moeller-Grell, Shihao Shenzhang, Zhangshu Joshua Jiang, Richard JB Dobson, Vishnu V Chandrabalan

机构 * Lancashire Teaching Hospitals NHS Foundation Trust(兰开夏教学医院国家健康服务信托基金会) Lancaster University(兰卡斯特大学) EPSRC DRIVE-Health, Department of Biostatistics & Health Informatics(EPSRC DRIVE-Health,生物统计学与健康信息学部门) King’s College London(伦敦国王学院) Institute for Health Informatics(健康信息学研究所) University College London(伦敦大学学院) NIHR Biomedical Research Centre(英国国家健康服务研究院生物医学研究中心) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金会) Health Data Research UK London(英国健康数据研究伦敦) South London and Maudsley NHS Foundation Trust and King’s College London(伦敦南部及莫德利国家健康服务信托基金会和伦敦国王学院) Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience(生物统计学与健康信息学部门,精神病学、心理学与神经科学研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出FastOMOP架构,通过分离治理、可观测性和编排三层,解决代理系统在现实世界证据生成中的安全性和可靠性问题,验证结果显示其在不同数据集上均能保持高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24114 2026-04-28 cs.CL 57%

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

IRIS:交错强化与增量阶段课程用于跨语言数学推理

Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度理工学院) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) NVIDIA

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 IRIS通过结合逐步增加难度的监督微调与逆课程强化学习,提升多语言数学推理能力,尤其在低资源和双语环境下表现突出。

Comments Accepted in ACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23970 2026-04-28 cs.AI cs.CV cs.HC cs.MA 57%

LLM-Guided Agentic Floor Plan Parsing for Accessible Indoor Navigation of Blind and Low-Vision People

基于大语言模型的代理楼层计划解析用于视障和低视力人士的无障碍室内导航

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的框架,将单张楼层平面图转换为结构化的知识库,生成安全的无障碍导航指令。系统通过多代理模块生成空间知识图谱,并通过路径规划器生成导航指令,实验结果显示在真实场景和基准数据集上均优于单次调用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05983 2026-04-28 cs.PL cs.CL 57%

Arch: An AI-Native Hardware Description Language for Register-Transfer Clocked Hardware Design

Arch:一种面向AI的硬件描述语言用于寄存器传输时钟硬件设计

Shuqing Zhao

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Arch是一种面向AI的硬件描述语言,用于微架构规格和AI辅助代码生成,通过参数化时钟和复位类型,提供类型安全的硬件描述方法,支持多种硬件结构,提升设计可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23049 2026-04-28 cs.AI 57%

A Decoupled Human-in-the-Loop System for Controlled Autonomy in Agentic Workflows

解耦的人机协同系统用于代理工作流中的受控自主性

Edward Cheng, Jeshua Cheng

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出解耦的人机协同系统架构,通过显式接口和结构化执行模型分离人类交互管理与应用流程,提供四维框架实现上下文感知的人类参与,支持代理通信协议层面的HITL实现,为工作流的可扩展治理和渐进自主性奠定基础。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25111 2026-04-28 cs.LG cs.PL cs.SE 57%

SEVerA: Verified Synthesis of Self-Evolving Agents

SEVerA: 验证合成自进化代理

Debangshu Banerjee, Changming Xu, Eugene Ie, Ming Zhang, Daiyi Peng, Chu-Cheng Lin, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 SEVerA通过引入形式化guarded生成模型,结合搜索、验证和学习三阶段框架,在程序验证、符号数学合成等任务中实现零约束违规,提升自进化代理的正确性和性能。

Comments First Formally Verified Self-Evolving LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20332 2026-04-28 cs.AI 57%

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training

Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力

Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏