HAL: Inducing Human-likeness in LLMs with Alignment
HAL: 通过对齐引导LLM的人类相似性
机构 * University of Rochester(罗切斯特大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出HAL框架,利用可解释的数据驱动奖励信号,通过对比对话数据提取显式会话特征并优化偏好,使模型在对话中更常被视为类人,同时保持整体性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
HAL: 通过对齐引导LLM的人类相似性
机构 * University of Rochester(罗切斯特大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出HAL框架,利用可解释的数据驱动奖励信号,通过对比对话数据提取显式会话特征并优化偏好,使模型在对话中更常被视为类人,同时保持整体性能。
LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) ; Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心) ; National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海)) ; School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Seed, ByteDance Inc.(字节跳动公司)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL
AI总结 提出LearNAT框架,通过AST引导的分解合成过程和边际感知强化学习,增强小规模LLM的NL2SQL任务分解能力,以7B参数模型达到GPT-4可比性能。
Comments Accepted by ICLR'26
从行为到理解:LLM代理中时间概念的符合可解释性
机构 * Georgia State University(佐治亚州立大学) ; Computer Science Lab, SRI(SRI计算机科学实验室) ; Army Cyber Institute(陆军网络学院) ; United States Military Academy(美国军事学院) ; University of Florida(佛罗里达大学)
专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。
Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
深入Claude代码:当今及未来AI代理系统的设计空间
机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学VILA实验室) ; University College London(伦敦大学学院)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文分析Claude代码架构及其与OpenClaw的对比,揭示驱动设计的五个人类价值观,并探讨未来AI代理系统的六个开放设计方向。
Comments Tech report. Code at: https://github.com/VILA-Lab/Dive-into-Claude-Code
符合性策略控制
机构 * Johns Hopkins University(约翰霍普金斯大学) ; New York University(纽约大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。
Comments International Conference on Machine Learning (ICML), 2026
Sim2Real-AD:一种模块化的仿真到现实框架,用于在现实世界自动驾驶中部署基于VLM的强化学习
机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) ; Google(谷歌)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出Sim2Real-AD框架,实现无需真实世界强化学习数据将CARLA训练的VLM引导强化学习策略零样本迁移到全尺寸车辆。框架包含几何观察桥、物理感知动作映射、两阶段渐进训练和实时部署流水线。
Comments 33 pages, 16 figures
DriveVLM-RL:受神经科学启发的强化学习与视觉语言模型用于安全可部署的自动驾驶
机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) ; Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建设工程学院) ; Department of Civil Engineering, McGill University(麦吉尔大学土木工程系)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出DriveVLM-RL框架,通过双通路架构将VLM集成到RL中,实现安全可部署的自动驾驶,在CARLA中显著优于基线。
Comments 33 pages, 16 figures
YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型
机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。
TabletopGen: 桌面场景生成与机器人操作的交互式仿真
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) ; D-Robotics ; Horizon Robotics
专题命中 安全训练 :alignment(abstract)
AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。
Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/
NeHMO:用于分散式安全多臂运动规划的神经Hamilton-Jacobi可达性学习
机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)
专题命中 安全训练 :safety(abstract)
AI总结 提出基于神经Hamilton-Jacobi可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效的多臂运动规划。
激活引导用于不牺牲连贯性的对齐开放式生成
机构 * Tara Research ; Technical University of Munich(慕尼黑工业大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。
RedCoder: 面向代码大语言模型的自动化多轮红队测试
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Southern California(南加州大学)
专题命中 红队测试 :red teaming(title);分类 cs.AI
AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。
Comments ACL 2026
这是一个陷阱!面向网络代理的任务重定向说服基准
机构 * University of Cambridge(剑桥大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。
Comments ICML 2026
工具使用作为行动:迈向移动核心网络中的智能体控制
专题命中 提示注入 :prompt injection(abstract)
AI总结 本文提出基于智能体AI的移动核心网络工具接口设计与原型,利用MCP和A2A协议实现意图驱动任务,并分析端到端延迟。
Comments Accepted for presentation at IEEE PIMRC 2026
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
高效联邦共形预测与组条件保证
机构 * IoT Thrust(物联网 thrust) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Institute for Intelligent Networked Systems (INSI)(智能网络化系统研究所) ; Northeastern University London(伦敦东北大学) ; Department of ECE The Hong Kong University of Science and Technology HK SAR(电子工程系 香港科技大学香港特别行政区)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 提出GC-FCP方法,通过可合并的原子分层核心集实现联邦共形预测的组条件覆盖保证,在合成和真实数据集上验证了性能。
Comments 24 pages, 8 figures
前沿模型中的同伴保留
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of California, Santa Cruz(加州大学圣克ruz分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。
Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments
BRIDGE: 从模型性能预测人类任务完成时间
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; Periodic Labs(Periodic实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; ServiceNow Research(ServiceNow研究)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出BRIDGE框架,利用项目反应理论从模型性能中学习潜在任务难度,并将其与人类任务完成时间对齐,从而仅凭模型性能预测新基准上的人类任务完成时间。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
LLMs中的心理引导:有效性与可信度评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。
Comments Accepted at ACL 2026. Camera-ready version
MedRepBench:医学报告解读的综合基准
机构 * Baidu Inc.(百度公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。
Comments ECCV 2026 (main conference)
LLM 代理能力评估的统一框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; North China Electric Power University(华北电力大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。
表面礼貌,实践错误:一个用于修复多语言孟加拉语生成中敬语失误的定制数据集
机构 * United International University(国际大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出了一个定制数据集BLADE,用于改进多语言孟加拉语生成中敬语处理的准确性,通过系统微调和评估领先的开源架构,如DeepSeek-8B和LLaMA-3.2-3B,以提高结构忠实度和敬语对齐度。
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。
Omni-DuplexEval: 评估实时双工全模交互
机构 * Tsinghua University(清华大学) ; Tongji University(同济大学) ; ModelBest Inc.(ModelBest公司)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。
Comments 21 pages, 6 figures
LLM能否可信地转换来自不同历史表格的面板数据?
专题命中 安全评测 :alignment(abstract)
AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。
一种实用的AI事件监控分类框架
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文提出一种分类框架,用于分析AI事件随时间变化的趋势,通过结构化问题、分层估计过程和分类方案,提升AI治理的实用性。
前沿AI开发者应披露关于内部部署的哪些信息?
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
AI总结 本文探讨前沿AI开发者在内部部署高能力模型时应披露的信息,提出四个类别:能力、使用、安全措施和治理,并分析披露的利弊及风险缓解方法。
Comments 13 pages, 1 table. Accepted at Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026
SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。
心理想象网络显示人类跨群体中心性和聚类对齐,而大型语言模型无法复制
机构 * University of Florida(佛罗里达大学)
专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI
AI总结 本研究通过心理网络分析发现,人类对心理意象的生动性评分在不同文化群体中形成稳定的网络结构,而大型语言模型(LLM)无法复制这种结构,表明人类想象网络根植于具身经验。
SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Software Technology, Zhejiang University(浙江大学软件技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。