arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-09 至 2026-06-09 共收录 156 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 17 篇

2606.09735 2026-06-09 cs.CL 新提交 92%

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构

Wendy K. Tam

机构 * Vanderbilt University(范德堡大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications(国家超级计算应用中心)

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(title,abstract);分类 cs.CL

AI总结 研究RLHF对Llama 3.1 8B党派倾向的影响,发现RLHF仅压缩党派信号方差以实现中性输出,而非移除党派结构,且特征级操控可绕过对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07535 2026-06-09 cs.CL 新提交 90%

Multilingual Refusal Alignment for Safer Large Language Models

多语言拒绝对齐:构建更安全的大型语言模型

Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

机构 * NASK National Research Institute(国家研究 institute) University College London(伦敦大学学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本研究系统探究多语言对齐动态,通过引入覆盖12种欧洲语言的RefusEU数据集和DPO实验,发现仅用英语对齐不足以保障跨语言安全,而多语言训练可在不降低通用性能的前提下提升安全性。

Comments Accepted to Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08940 2026-06-09 cs.CL 新提交 86%

Multilingual Sentiment Aware Text Summarization A Reinforcement Learning Approach for Consistency Maintenance

多语言情感感知文本摘要:一种用于一致性维护的强化学习方法

Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova, Grigori Sidorov

机构 * Instituto Politécnico Nacional (IPN), Centro de Investigación en Computación (CIC)(国立理工学院(IPN),计算研究中心(CIC))

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究RLHF摘要中的情感漂移现象,提出基于策略归因框架的情感感知KL正则化方法,在保持摘要质量的同时缓解情感中性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01060 2026-06-09 cs.CL cs.AI cs.LG 版本更新 85%

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量

Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') IIIT Delhi, India(德里印度理工学院) Amazon, USA(美国亚马逊) Meta, USA(美国Meta) Apple, USA(美国苹果)

专题命中 偏好对齐 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02572 2026-06-09 cs.LG cs.AI 版本更新 81%

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

奖励塑形用于(推理时)对齐:一个Stackelberg博弈视角

Haichuan Wang, Tao Lin, Lingkai Kong, Ce Li, Hezi Jiang, Milind Tambe

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 针对KL正则化导致LLM继承基策略偏见的问题,提出将奖励模型优化形式化为Stackelberg博弈,并通过简单奖励塑形方案近似最优奖励模型,在推理时对齐中持续提升平均奖励并达到超过66%的胜率。

Comments Accepted to ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08131 2026-06-09 cs.HC cs.AI 新提交 79%

LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

LCAM:诊断对话式AI中交互对齐失败的框架

Manuele Reani, Hongyu Tian

机构 * School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区管理学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 提出分层认知对齐模型(LCAM),通过五层对齐和两种失调极性诊断对话式AI的交互失败,应用于LLM咨询案例揭示潜在危害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07877 2026-06-09 cs.CL 新提交 79%

Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models

谁的规范?解开大语言模型中的文化与个人对齐

Angana Borah, Isabelle Augenstein, Rada Mihalcea

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 提出PACT框架评估大语言模型在文化规范与个人偏好间的权衡,发现模型受国家背景影响大于年龄和性别,且人类对齐未能捕捉文化多元性。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23286 2026-06-09 cs.CV cs.AI cs.LG 版本更新 79%

VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation

VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成

Hongyang Du, Junjie Ye, Xiaoyan Cong, Runhao Li, Jingcheng Ni, Aman Agarwal, Zeqi Zhou, Zekun Li, Randall Balestriero, Yue Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。

Comments 8 pages, 5 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21854 2026-06-09 cs.CV cs.AI 版本更新 77%

CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models

CrossVLA: 跨范式后训练和推理优化用于视觉-语言-动作模型

Zhi Liu

机构 * Tianjin University(天津大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言-动作(VLA)模型的跨范式后训练方法,提出了CrossVLA框架,通过改进的连续动作流匹配估计器、对比LoRA和DoRA参数高效层的性能,并揭示了推理过程中去噪循环对延迟的影响,最终实现了在LIBERO数据集上的显著提升。

Comments Workshop draft, 14 pages, 4 figures. Code, ckpts, data: https://github.com/lz-googlefycy/vla-lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09525 2026-06-09 cs.CL cs.AI 新提交 73%

Emergence of Context Characteristics Sensitivity in Large Language Models

大型语言模型中上下文特征敏感性的涌现

Nadya Yuki Wangsajaya, Haeun Yu, Isabelle Augenstein

机构 * Nanyang Technological University(南洋理工大学) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过测量监督微调、直接偏好优化和可验证奖励强化学习三个阶段,发现大型语言模型对上下文特征的敏感性在指令微调过程中动态变化,其中监督微调使模型倾向于使用易理解的上下文,而后续阶段可能强化或改变这一偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20978 2026-06-09 eess.AS cs.AI cs.LG 版本更新 73%

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model

GenTSE: 通过粗到细的生成语言模型增强目标说话人提取

Haoyang Li, Xuyi Zhuang, Azmat Adnan, Ye Ni, Wei Rao, Shreyas Gopal, Eng Siong Chng, Boon Siew Han, Yuanjin Zheng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Southeast University, China(东南大学,中国) Schaeffler Hub for Advanced REsearch (SHARE) at Nanyang Technological University, Singapore(南洋理工大学Schaeffler先进研究 hub(SHARE),新加坡)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出GenTSE,一种两阶段解码器仅生成语言模型,先预测粗语义标记再生成细声学标记,结合冻结语言模型条件训练和直接偏好优化,在Libri2Mix上超越先前基于语言模型的系统。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 70%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07629 2026-06-09 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 70%

Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

大型语言模型应学习个性化而非聚合的人类偏好

Cristina Garbacea

机构 * University of Chicago, Data Science Institute(芝加哥大学数据科学学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文主张大型语言模型应学习个性化偏好而非聚合偏好,分析聚合偏好的理论局限与实证问题,提出通过有界个性化框架兼顾个体自主与集体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09470 2026-06-09 cs.CL cs.AI 新提交 62%

A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

一种用于联合多粒度L2评估和自然语言解释的微调SpeechLLM

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

机构 * Centre for Language Studies, Radboud University(语言研究中心,拉德堡德大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于评分准则的SpeechLLM,通过混合训练目标联合预测句子级和词/音素级标签并生成自然语言解释,在SpeechOcean762上达到或超越单粒度模型。

Comments Accepted to Interspeech 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07705 2026-06-09 cs.LG cs.AI 新提交 62%

SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

SAW: 面向大语言模型多目标强化学习的阶段感知动态加权

Yuchen He, Baolong Bi, Shenghua Liu, Huaming Liao, Yuyao Ge, Bolin Wan, Siqian Tong, Juan Chen, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Electronic Science and Technology of China(电子科技大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对多目标强化学习中奖励学习异步性问题,提出轻量级动态加权机制SAW,利用变异系数实时调整各目标贡献,在GRPO和GDPO框架下提升训练效率和最终性能。

Comments 17 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06114 2026-06-09 cs.AI 版本更新 57%

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

走向健康进化:探索人机交互在自我进化系统中的作用与机制

Dianxing Shi, Bowen Wang, Junqi He, Junhao Chen, Yuta Nakashima

机构 * The University of Osaka(大阪大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 提出ANCHOR框架,通过模拟人类监督的反馈机制,在自我进化系统中缓解能力退化与安全漂移,实验表明有限监督可显著提升安全性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01357 2026-06-09 cs.LG 版本更新 57%

Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning

你的自对弈算法其实是一个对抗性模仿者:通过模仿学习的视角理解LLM自对弈

Shangzhe Li, Xuchao Zhang, Chetan Bansal, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文通过将自对弈微调建模为模型与自身参数化的正则化隐式奖励玩家之间的极小极大博弈,统一了自对弈模仿与偏好对齐,并提出了基于χ²散度的新算法,在多种语言模型微调任务上优于现有方法。

Comments 26 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 18 篇

2603.07445 2026-06-09 cs.CL cs.LG 版本更新 88%

Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning

少令牌,大杠杆:在微调期间通过约束安全令牌保持安全对齐

Guoli Wang, Haonan Shi, Tu Ouyang, An Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.LG

AI总结 提出PACT框架,通过约束安全相关令牌的置信度来防止微调导致的安全对齐漂移,同时保持下游任务性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09227 2026-06-09 cs.CR cs.AI cs.CE cs.CY cs.HC cs.SI 新提交 81%

Trustworthy Smart Fabs via Professional Proxies: Scaling Safe and Sustainable by Design (SSbD) through Industrial Data Spaces

通过专业代理实现可信智能晶圆厂:通过工业数据空间扩展安全与可持续设计(SSbD)

Han-Teng Liao, Chang-Yi Kao, Karen Ang

机构 * Independent Researcher Dept. Computer Science and Independent Researcher Information Management(独立研究员计算机科学系及独立研究员信息管理)

专题命中 安全训练 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 针对欧盟SSbD等法规带来的治理瓶颈,提出基于零信任的社会技术编排框架,通过硬件隔离信任区中的专业代理工作流,在工业数据空间中实现自主治理,解决数据主权悖论。

Comments This work was accepted for presentation at the 32nd IEEE ICE/ITMC Conference, Porto, Portugal, 2026 but was subsequently withdrawn prior to publication due to submission volume limits. It is currently under consideration for publication elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09749 2026-06-09 cs.RO cs.LG 新提交 79%

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

你的模型已经知道:面向视觉-语言-动作模型的注意力引导安全过滤器

Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文发现VLA模型中的少数注意力头能可靠定位目标物体,利用这一特性提出无需训练的安全框架,结合控制障碍函数和实时目标跟踪器,实现动态障碍物下的碰撞避免,在动态场景中性能提升43%。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09038 2026-06-09 cs.AI 新提交 79%

Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs

个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施

Yanyan Luo, Xue Han, Ruiqiao Bai, Xin Huang, Yitong Wang, Qian Hu, Qing Wang, Chunxu Zhao, Jie Liu, Cong Geng, Lehao Xing, Pengwei Hu, Junlan Feng

机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) Chinese Academy of Sciences(中国科学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08497 2026-06-09 cs.AI cs.CL 新提交 73%

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

解释黑盒语言模型:学习优化语言结构化的单词子集

Minyoung Hwang, Seokhyun Lee, Changhee Lee

机构 * Korea University(高丽大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对黑盒语言模型解释的三个关键需求(推理效率、黑盒兼容性、语言结构可解释性),提出一种通过强化学习选择信息性单词子集的方法,实现高效、无梯度且语言连贯的解释。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09388 2026-06-09 cs.LG 新提交 70%

Distilling Safe LLM Systems via Soft Prompts for On Device Settings

通过软提示蒸馏安全的设备端LLM系统

Motasem Alfarra, Cristina Pinneri, Dana Kianfar, Mohammed Almousa, Christos Louizos

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 针对资源受限设备上部署安全大语言模型(LLM)的挑战,提出基于软提示与蒸馏训练的安全对齐方法,在最小化额外计算开销的同时实现优越的安全-有用性权衡。

Comments Accepted to UAI 2026

Journal ref 42nd Conference on Uncertainty in Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08919 2026-06-09 cs.AI cs.CR cs.LG 新提交 62%

Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human

监督具有容量:将智能体守卫校准到主观且易疲劳的人类

Emre Turan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体动作审批中人类评审者主观且易疲劳的问题,提出将守卫建模为成本敏感的选择性分类,并引入负载感知策略,发现过度监督反而降低安全性,形成倒U型曲线。

Comments 12 pages, 4 figures. Code and interactive demo: https://github.com/turangenesis/headroom

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08512 2026-06-09 cs.CY cs.CL 新提交 62%

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

朋友还是敌人?俄罗斯虚假信息压力下开放权重大语言模型中的语言意识形态开关

Anna Małgorzata Kamińska, Tetiana Klynina

机构 * Institute of Culture Studies, University of Silesia in Katowice(文化研究学院,卡托维察大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) National Aviation University(国家航空大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文通过控制实验发现,针对不同语言社区微调的大语言模型在俄罗斯虚假信息压力下,其抵抗能力与预期文化对齐方向相反,揭示了微调悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08021 2026-06-09 cs.LG cs.AI cs.MA 新提交 62%

Semantic Quorum Assurance: Collective Certification for Non-Deterministic AI Infrastructure

语义法定数保证:面向非确定性AI基础设施的集体认证

Jun He, Deying Yu

机构 * OpenKedge.io

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出语义法定数保证(SQA),一种通过多样化验证者群体和风险自适应法定数谓词,将非确定性LLM代理的不安全操作批准率从18.5%降至0.3%的控制平面原语。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09751 2026-06-09 cs.AI cs.CL cs.LO 版本更新 62%

Sound and Complete Neurosymbolic Reasoning with LLM-Grounded Interpretations

基于LLM解释的完备且可靠的神经常识推理

Bradley P. Allen, Prateek Chhikara, Thomas Macaulay Ferguson, Filip Ilievski, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) University of Southern California(南加州大学) Rensselaer Polytechnic Institute(拉特格斯理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出将LLM直接集成到次协调逻辑的语义解释函数中,实现可靠且完备的神经常识推理,在GPQA和SimpleQA基准上宏F1提升约6个百分点,并成功检测药物安全知识库中的矛盾。

Comments 43 pages, 14 tables, 4 figures. Accepted to the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025); to appear Neurosymbolic Artifical Intelligence Special Issue on NeSy 2025 Extended Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09371 2026-06-09 cs.AI 新提交 57%

Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs

面向工具增强型大语言模型的能力对齐分层学习

Haotong Yang, Ting Long, Yi Chang

机构 * Jilin University(吉林大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出CAHL方法,利用RLVR联合优化高层规划器与低层执行器,解决分层工具学习中的规划-执行对齐问题,在多个基准上验证有效性。

Comments 14 pages, 5 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08875 2026-06-09 cs.AI 新提交 57%

Can the Environment Speak for Itself? $T^{2}$-GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents

环境能否为自己发声?$T^{2}$-GRPO:一种面向护理智能体的转向-轨迹组相对策略优化

Yutong Song, Jiang Wu, Pengfei Zhang, Wenjun Huang, Honghui Xu, Nikil Dutt, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Independent Researcher(独立研究员) Kennesaw State University(肯尼索州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出T²-GRPO框架,通过解耦护理强化学习为两个归一化奖励视界,并利用二元硬否决确保安全,从环境状态转换中提取密集转向级奖励,结合轨迹级评估,有效处理即时患者反馈、长期护理结果和安全约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08800 2026-06-09 cs.AI 新提交 57%

Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution

通过自进化桥接专家知识与自动化特征工程

Varun Khurana, Vijval Ekbote, Vashu Chauhan, Yaman Kumar Singla, Rajiv Ratn Shah, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) IIIT-Delhi(德里印度理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏