Adaptive Focus Memory for Language Models
自适应聚焦记忆用于语言模型
机构 * Purdue University(普渡大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 自适应聚焦记忆通过动态分配保真度级别,实现多轮对话中有效约束保持,无需修改模型权重或外部检索系统。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
自适应聚焦记忆用于语言模型
机构 * Purdue University(普渡大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 自适应聚焦记忆通过动态分配保真度级别,实现多轮对话中有效约束保持,无需修改模型权重或外部检索系统。
超越训练:通过MOBIMEM实现智能体的自我进化
机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 MOBIMEM通过引入内存原语和操作系统启发的服务,实现了无需模型重训练的智能体自我进化,显著提升了任务成功率和效率。
用于机器人应用的测压识别合成数据集
机构 * University of São Paulo(圣保罗大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种混合数据合成方法,通过结合过程渲染和AI驱动视频生成,提升机器人应用中测压识别的训练效果和可靠性。
Journal ref 2025 Latin American Robotics Symposium (LARS)
通过策略执行实现能力:CAPE
机构 * Superficial Labs(超浅实验室)
专题命中 安全训练 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 CAPE通过策略执行实现能力,系统性地将要求转化为可执行规范并训练模型默认满足,减少违规率81%,提升能力评估效率。
Comments 32 pages, 3 figures
STACHE:强化学习策略的局部黑盒解释
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 STACHE提出一种用于生成强化学习策略局部黑盒解释的框架,通过鲁棒区域和最小反事实分析,揭示策略行为的演变过程。
基于知识引导的大型语言模型用于自动解析儿童牙科记录并安全推荐抗生素
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出基于知识引导的大型语言模型,通过整合知识图谱、检索增强生成和多阶段安全验证,提升儿童牙科记录解析与安全抗生素推荐的准确性。
学习何时提问:为心理健康诊断训练的仿真 humanoid
机构 * Macquarie University(麦考瑞大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于仿真的方法,通过训练人形机器人以更有效地进行心理健康诊断,利用反事实回放和安全学习循环提升对话节奏和关系建立。
人格的几何学:从推理中分离人格特征于大型语言模型
机构 * Precision and Intelligence Medical Imaging Lab, Beijing Friendship Hospital, Capital Medical University(首都医科大学北京友谊医院精准与智能医学影像实验室)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Soul Engine框架,通过解耦人格特质于LLM推理,实现安全可控的人格个性化。
Comments 10 pages, 3 figures, 1 table. Code and dataset available at https://huggingface.co/Zx93/Soul-Engine-Qwen2.5-0.5B
InfiGUI-G1: 通过自适应探索策略优化推进GUI接地
机构 * Amazon(亚马逊)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。
Comments Accepted to AAAI 2026 (Oral Presentation)
深度强化学习需要深度行为分析:通过无模型智能体在开放性环境中探索隐式规划
机构 * Department of Neurobiology, Harvard Medical School(哈佛医学院神经生物学系) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Department of Mathematics, NTNU(NTNU数学系) ; School of Computer Science, McGill University & Mila(麦吉尔大学计算机科学学院及Mila) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Biophysics Graduate Program, Harvard University(哈佛大学生物物理学研究生项目)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文通过ForageWorld环境研究DRL智能体的行为,发现无模型智能体可通过涌现动态展现规划行为,提出通用分析框架用于研究复杂智能体的学习动态。
Comments Published at NeurIPS 2025
AED: 利用大语言模型自动发现自主驾驶策略的有效且多样的漏洞
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 AED 利用大语言模型自动发现自动驾驶策略的有效且多样的漏洞,提升漏洞发现的多样性和有效性。
迈向自动安全驾驶指令:一种大规模视觉语言模型方法
机构 * Nara Institute of Science and Technology(奈良科学技术研究所) ; Teatis inc.(Teatis公司) ; Queensland university of technology(昆士兰理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种大规模视觉语言模型方法,用于生成安全驾驶指令,通过构建数据集并评估模型性能,展示了微调模型在自动驾驶安全中的应用与挑战。
Comments Accepted to MMLoSo 2025
APRIL:利用LLM可靠推断进行策略评估的标注
机构 * Stanford University(斯坦福大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 APRIL利用大语言模型生成医疗领域的反事实注释,以提高离线策略评估的准确性与可扩展性。
基于提示的价值引导大型语言模型
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种基于提示的价值引导方法,通过评估提示候选者对生成文本的价值引导能力,展示在不修改模型的情况下实现价值对齐的可行性。
Comments 9 pages, 1 figure, 4 tables. Presented at the 3rd International Workshop on Value Engineering in AI (VALE 2025), 28th European Conference on AI. To appear in Springer LNCS
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments 18 pages, Accepted at AAAI 2026
机构 * Alibaba.com US E-Commerce(阿里巴巴美国电子商务) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
机构 * Tokyo Women’s Medical University(东京女子医科大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY
Comments 14 pages, 2 tables, 1 figure
机构 * Department of Civil and Environmental Engineering, University of Michigan, Ann Arbor, United States(美国密歇根大学土木与环境工程系) ; Department of Electrical Engineering and Computer Science, University of Michigan, Ann Arbor, United States(美国密歇根大学电气工程与计算机科学系) ; College of Civil Engineering and Architecture, Zhejiang University, Hangzhou, China(浙江大学建筑工程学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
Comments 32 pages, 6 figures, 7 tables
机构 * School of Computer Science and Engineering, Pusan National University, Busan, Korea(计算机科学与工程学院,釜山国立大学,韩国釜山)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments 12 pages, 8 figures, submitted to ECAI 2025
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
机构 * Edison Academy Magnet School New Jersey, USA(新泽西州埃迪森磁校) ; Department of Computer Science(计算机科学系) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments 12 pages, 6 figures
机构 * Rutgers University(罗格斯大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY
Comments 21 pages, 12 figures, 14 tables
机构 * Oracle AI
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2025
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; MiroMind
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
机构 * Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) ; Zuoyebang Education Technology(佐业邦教育科技) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
Comments Accepted by NeurIPS 2025
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
机构 * EPFL(苏黎世联邦理工学院) ; Idiap(日内瓦智能感知研究院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
Comments Extended version of ICMLw25 Oral
机构 * Mercedes-Benz AG, Research & Development(梅赛德斯-奔驰集团,研发部) ; Karlsruhe Institute of Technology, ITIV(卡尔斯鲁厄理工学院,ITIV) ; University of Tübingen(图宾根大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Accepted to IEEE ITSC 2025
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
Comments 15 pages, 4 figures
机构 * Imperial College(帝国学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG