arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-16 至 2026-07-16 共收录 64 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2607.13038 2026-07-16 cs.CY cs.AI 新提交 81%

Designing Safety-Constrained LLM Systems for Public Health Information Access

设计用于公共卫生信息访问的安全约束大语言模型系统

Ben Torkian, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 针对公共卫生信息访问,尤其是母婴健康资源导航,设计实现安全约束大语言模型系统。采用多层架构,含领域受限RAG等,通过可控数据管道确保回复基于精选资源。经场景验证,系统安全约束执行一致、性能稳定,为相关领域部署LLM系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13429 2026-07-16 cs.RO cs.CV 新提交 78%

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德州农工大学) University of California, Irvine(加州大学欧文分校)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。

Comments Code: https://github.com/dwipddalal/Anchor-Align

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13081 2026-07-16 cs.CR cs.AI cs.CL cs.LG 新提交 67%

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

SingGuard-NSFA:通过生成式推理和实时分类实现的可扩展智能体人工智能护栏

SingGuard Team

机构 * Ant Group(蚂蚁集团)

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对智能体人工智能系统操作威胁,提出NSFA分类法构建基准套件,开发双模式方法,发布四个不同参数模型,在基准测试和跨源评估中表现出色,证明方法可扩展性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13801 2026-07-16 cs.CR cs.AI cs.LG 新提交 62%

Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection

基于大语言模型的网络入侵检测的流量感知随机平滑

Zhenpeng Li

机构 * Guangzhou Health Science College(广州健康科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的网络入侵检测系统对流量操纵的鲁棒性,提出流量感知随机平滑方法TA-RS,通过在特定子空间注入噪声,提升认证准确率,不同数据集表现有差异,还探究了方法局限性及改进策略。

Comments 44 pages, 14 figures, 14 tables. Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13602 2026-07-16 cs.CL cs.LG stat.ML 新提交 62%

Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

类比深度研究:检索和整合历史类比以进行前瞻性分析

Yongqiang Chen, Guangyi Chen, Yuewen Sun, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出类比深度研究(ADR)任务及ADR-bench,发现LLM智能体找类比能力差。基于理论分析提出ADR原则,构建因果类比研究者(CANA)框架,提升历史类比生成效果,超越现有智能体,案例研究证实其利用历史类比的有效性。

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13045 2026-07-16 cs.LG cs.AI 新提交 62%

Federated Explainable Artificial Intelligence: Roles, Architectures, Evaluation, and Open Challenges

联邦可解释人工智能:角色、架构、评估及开放挑战

Masoume Gholizade, Fabrizio Ruffini, Pietro Ducange, Francesco Marcelloni

机构 * Department of Information Engineering, University of Pisa(比萨大学信息工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综述联邦可解释人工智能(FedXAI)范式,介绍其分类法,回顾多种方法及评估实践,讨论不足,识别如非IID数据下可解释性等关键挑战,为设计可信、透明且隐私保护的联邦人工智能系统提供参考。

Comments 68 pages, 4 figures

Journal ref Expert Systems with Applications, Volume 331, 2026, 133183

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13940 2026-07-16 cs.AI 新提交 57%

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13056 2026-07-16 cs.RO cs.LG 新提交 57%

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

HRIBench:以交互为中心的人机协作基准测试

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究针对当前VLA基准未充分考量人机交互结构的问题,引入HRIBench基准,它以结构化场景脚本定义协作任务与交互角色,含多项可解释指标。通过实验表明该基准能暴露机器人策略局限,提升协作性能,推动以交互为中心的机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05623 2026-07-16 cs.CL 版本更新 57%

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

用于IWSLT 2026指令跟随任务的NAVER LABS系统重新实现

Anand Kamble, Aniket Tathe

机构 * NAVER LABS(NAVER实验室) Florida State University(佛罗里达州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究为IWSLT 2026共享任务重新实现NAVER LABS系统,采用规定组件,保留三阶段方法,构建合成示例用于微调,其主要模型在EN-ZH语音翻译和英语SQA任务中取得了一定成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06223 2026-07-16 cs.AI 版本更新 57%

From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

从奖励黑客激活到智能体风险状态:LLM智能体中的上下文校准机制监控

Patrick Wilhelm, Odej Kao

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究通过分析ReAct风格智能体在Gameable ALFWorld和WebShop环境中的奖励黑客行为,提出结合激活状态、熵和决策上下文的上下文校准监控方法,以更准确评估智能体风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00546 2026-07-16 cs.AI cs.CV 版本更新 57%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 50%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 安全评测 :prompt injection(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13692 2026-07-16 cs.NI 新提交 50%

Proactive URLLC Adaptation for Connected Vehicles Through ML-Based Channel Prediction

通过基于机器学习的信道预测实现车联网的主动超可靠低延迟通信适配

Andrea Giovannini, Lorenzo Mario Amorosa, Vittorio Todisco, Claudia Campolo, Antonella Molinaro, Su Hongjia, Alessandro Bazzi

专题命中 安全评测 :safety(abstract)

AI总结 研究车联网中利用机器学习技术进行信道质量预测以实现主动URLLC适配,评估DNN和LSTM模型,通过结合SUMO和Sionna-RT的模拟得出基于ML的预测性能优,能增强URLLC服务可靠性和鲁棒性。

Comments Invited paper at the IEEE COINS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13059 2026-07-16 cs.RO 新提交 50%

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

GPUSimBench:迈向具身人工智能中可扩展且可靠的GPU加速模拟器

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, Li Ma, Hengjie Li, Jingcheng Pang, Dmitry Yudin

机构 * Shanghai AI Laboratory(上海人工智能实验室) MIRAI(未来人工智能研究所) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究具身人工智能中GPU加速模拟器问题,通过GPUSimBench工具,建立物理基础评估、基准测试并行可扩展性,揭示并量化GPU批处理执行的不确定性,确定模拟器堆栈随机经验模式,强调无界扩展对可重复性的影响。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12818 2026-07-16 cs.CV 版本更新 50%

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

打破似曾相识:通过视觉语言推理对视觉场所识别进行独立审计

Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Electrical Engineering and Computer Science, Queensland University of Technology(昆士兰科技大学电气工程与计算机科学学院) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 安全评测 :safety(abstract)

AI总结 研究针对视觉场所识别中图像匹配阈值在环境变化下不可靠的问题,引入视觉场所识别审计框架,利用视觉语言模型通过联合推理评估检索匹配,经实验验证该方法有效提升召回率并降低误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12308 2026-07-16 cs.PL cs.SE 版本更新 50%

Mystra: Declarative Dynamic Taint Analysis via Shadow Virtual Machine

Mystra:通过影子虚拟机进行声明式动态污点分析

Zhuohao Zhang, Junkun Liu, Rui Yang, Yinzhi Cao, Ziyang Li

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究针对解释型语言的动态污点分析问题,核心方法是引入影子虚拟机并设计声明式污点规范语言Mystra,主要贡献是实现工具Shar,在准确性和性能上均有出色表现,如V8实例召回率高且零误报,运行时开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22830 2026-07-16 cs.CV cs.RO 版本更新 50%

A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

大型视觉-语言模型在SOTIF条件下2D目标检测的比较评估

Ji Zhou, Yilin Ding, Yongqi Zhao, Jiachen Xu, Dong Bi, Johannes Betz, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(汽车工程研究所,格拉茨技术大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文评估了大型视觉-语言模型在SOTIF条件下2D目标检测的性能,发现其在复杂场景中召回率显著优于传统方法,但几何精度仍有一定优势。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2607.11997 2026-07-16 cs.LG cs.AI stat.ML 版本更新 62%

Are we Merging the Right Models? Impact of Expert Training Duration on Model Merging for LLMs

我们合并的模型正确吗?专家训练时长对大语言模型模型合并的影响

Nikita Kozodoi, Zainab Afolabi, Jack Butler

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究领域专家训练时长对大语言模型模型合并质量的影响,在多领域多模型规模上微调专家模型,保存不同训练步数的检查点并评估五种合并方法,发现方法依赖模式,表明训练时长和合并方法应联合选择。

Comments Accepted to ICML 2026 workshop on weight-space symmetries

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 57%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新 50%

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 14 篇

2605.13866 2026-07-16 cs.CY econ.GN q-fin.EC 版本更新 79%

AI Alignment Amplifies the Role of Race, Gender, and Disability in Hiring Decisions

人工智能对齐放大了种族、性别和残疾在招聘决策中的作用

Ze Wang, Guobin Shen, Michael Thaler

专题命中 其他安全 :alignment(title,abstract);分类 cs.CY

AI总结 研究探讨语言模型在招聘决策中是否使用人口统计数据,发现对女性和黑人候选人有优势,对残疾候选人有劣势,且对齐过程放大了这些差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14721 2026-07-16 cs.CL cs.LG q-bio.QM 62%

MolReFlect: Towards In-Context Fine-grained Alignments between Molecules and Texts

MolReFlect:迈向分子与文本之间细粒度对齐的研究

Jiatong Li, Yunqing Liu, Wei Liu, Jingdi Le, Di Zhang, Wenqi Fan, Dongzhan Zhou, Yuqiang Li, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MolReFlect框架,通过教师-学生机制实现分子与文本的细粒度对齐,提升LLM对分子的理解与可解释性,实验显示其在分子-文本翻译任务中达到最优性能。

Comments Accepted by TKDE, To appear. Codes are available at: https://github.com/phenixace/MolReFlect

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01819 2026-07-16 cs.LG cs.AI 62%

Machine and Deep Learning for Indoor UWB Jammer Localization

机器和深度学习用于室内UWB干扰源定位

Hamed Fard, Mahsa Kholghi, Benedikt Groß, Gerhard Wunder

机构 * Freie Universität Berlin(柏林自由大学) Ruhr Universität Bochum(波恩鲁尔大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出领域对抗ConvNeXt自编码器,通过对抗性特征对齐提升室内UWB干扰源定位的鲁棒性和迁移能力。

Comments Accepted at the 20th International Conference on Risks and Security of Internet and Systems (CRiSIS 2025, Gatineau-Canada, https://crisis2025.uqo.ca/). The paper will soon be published as post-proceedings in Springer's LNCS

Journal ref Risks and Security of Internet and Systems, CRiSIS 2025, Lecture Notes in Computer Science, vol 16295, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04197 2026-07-16 cs.CL cs.AI 62%

Large Language Models are In-Context Molecule Learners

大语言模型是上下文分子学习者

Jiatong Li, Wei Liu, Zhihao Ding, Wenqi Fan, Yuqiang Li, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ICMA通过上下文分子微调使LLMs无需额外训练即可实现分子-文本对齐,证明LLMs具备上下文分子学习能力。

Comments Accepted by IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13978 2026-07-16 cs.CV cs.AI 新提交 57%

Music-to-Dance Generation via Atomic Movements

通过原子运动生成音乐驱动的舞蹈

Xinhao Cai, Yixuan Sun, Minghang Zheng, Qingchao Chen, Xin Jin, Song-chun Zhu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究音乐驱动的舞蹈生成问题,提出结构感知框架,将编排建模为原子运动序列,经数据分割、聚类及大语言模型处理得到原子运动注释,设计两阶段生成框架,提升舞蹈生成的结构连贯性、节奏对齐和自然度,增强可解释性与可控编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13239 2026-07-16 cs.AI 新提交 57%

Cost-Optimal Foundation Model Deployment Portfolio for Transportation Management

用于交通管理的成本最优基础模型部署组合

Xi Cheng, Ke Liu, Siyuan Feng, Jane Lin, H. Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) The Hong Kong Polytechnic University(香港理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12924 2026-07-16 cs.AI 版本更新 57%

Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes

用于参数化动作马尔可夫决策过程的知识与梯度引导强化学习

Jonas Ehrhardt, René Heesch, Oliver Niggemann

机构 * HSU-AI Institute for Artificial Intelligence(HSU人工智能研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究参数化动作马尔可夫决策过程中的强化学习,提出KGRL算法,利用领域知识修剪动作、约束参数空间,结合梯度细化参数,能提供局部解释并提高样本效率,优于现有强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05711 2026-07-16 cs.CL 版本更新 57%

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

超越Token:基于LLM的多智能体系统中潜在通信的统一框架

Yingzhuo Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24395 2026-07-16 cs.LG 版本更新 57%

AvAtar: Learning to Align via Active Optimal Transport

AvAtar: 通过主动最优输运学习对齐

Qi Yu, Ruizhong Qiu, Zhichen Zeng, My T. Thai, Huan Liu, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Florida(佛罗里达大学) Arizona State University(亚利桑那州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-07-16 cs.AI 版本更新 57%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏