MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment
MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐
专题命中 偏好对齐 :alignment(title);分类 cs.AI
AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐
专题命中 偏好对齐 :alignment(title);分类 cs.AI
AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。
大规模高效探索
机构 * Google(谷歌) ; DeepMind(深度思维)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。
FINER:MLLMs在细粒度负查询下产生幻觉
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) ; Google(谷歌) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI
AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。
Comments CVPR 2026
一个创意代理值得一个64-token模板
机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(1 南京大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(2 教育部新一代人工智能技术及其跨学科应用关键实验室(东南大学))
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出CAT框架,通过创意令牌化提升文本到图像生成的创造力,实现3.7倍速度提升和4.8倍计算成本降低,生成图像更受人类偏好。
原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型
机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 偏好对齐 :RLHF(abstract)
AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。
Comments 25 pages, 10 figures,
通过对比对齐损失实现安全性的PTQ
机构 * Seoul National University(首尔国立大学) ; LG Electronics(LG电子)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 本文提出CAQ方法,通过引入对比对齐损失解决PTQ中安全对齐不足的问题,实现更稳健的4位量化,提升模型安全性而不牺牲通用能力。
Comments 9 pages, 4 figures. Includes 8 pages of supplementary material
可证明安全的模型更新
机构 * Department of Computing(计算系) ; Imperial College London(帝国理工学院伦敦分校) ; School of Computer and Comm. Sciences (IC)(计算机与通信科学系) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文提出可证明安全的模型更新框架,通过计算最大局部不变域来确保模型更新的安全性,有效避免遗忘并提供形式化安全保证。
Comments 12 pages, 9 figures. This work has been accepted for publication at SaTML 2026. The final version will be available on IEEE Xplore
citecheck: 一种MCP服务器,用于学术手稿中的自动文献验证与修复
专题命中 安全训练 :safety(abstract)
AI总结 citecheck通过自动化验证和修复学术手稿中的文献错误,包括识别错误、元数据不完整、作者归属错误及预印本与发表版本不一致等问题,提供结构化修复建议和安全诊断。
Comments 6 pages, 1 figure. Software paper on bibliography verification and repair for scholarly manuscripts; includes MCP server implementation and evaluation on repository-backed tests
WPT: 通过在线世界模型蒸馏实现世界到策略的迁移
机构 * University of Science and Technology of China(科学技术大学) ; CUHK-SZ(香港中文大学(深圳)) ; HKUST(香港理工大学) ; Huawei Foundation Model Department(华为基金会模型部)
专题命中 安全训练 :safety(abstract)
AI总结 本文提出WPT方法,通过在线世界模型蒸馏实现策略迁移,提升规划性能并保持实时部署能力,实验表明其在开放环和闭合环基准上表现优异。
Comments CVPR2026 Accepted
通过与劫持相关的表示转移理解并防御VLM劫持
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文研究VLM在视觉模态整合后安全对齐减弱的问题,发现劫持样本在表示空间中形成独特状态,提出通过移除劫持相关转移提升安全性。
大型语言模型的安全性评估与缓解策略:一种全面的防御框架
机构 * School of Computing University of North Florida(北弗罗里达大学计算学院)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 本文评估了大型语言模型在关键基础设施中的安全风险,提出了一种标准化的评估框架和多层次防御系统,通过测试五种主流模型对1万多个对抗性提示的响应,揭示了安全差异,并开发了高准确率的防御框架。
P$^{3}$Nav: 端到端感知、预测与规划用于视觉-语言导航
机构 * HKUST(GZ)(香港科技大学(广州))
专题命中 越狱攻击 :alignment(abstract)
AI总结 P$^{3}$Nav提出端到端框架,整合感知、预测与规划,提升视觉-语言导航agent的场景理解与导航成功率,实验显示在REVERIE、R2R-CE和RxR-CE基准上取得新状态-of-the-art性能。
将代理笼中:面向医疗AI自主系统的零信任安全架构
机构 * VP of Trust, Commure(Commure 职务负责人) ; Founder & CEO, nFactor Technologies(nFactor Technologies 创始人及首席执行官)
专题命中 红队测试 :prompt injection(abstract,comments);red teaming(abstract);分类 cs.AI
AI总结 本文提出零信任安全架构,用于医疗AI自主代理,通过多层防御机制解决代理在医疗环境中存在的关键安全漏洞,包括凭证泄露、执行能力滥用等,并开源相关配置和工具。
Comments Keywords: agentic AI security, autonomous agents, healthcare cybersecurity, zero trust, prompt injection, HIPAA, Kubernetes security, OpenClaw
VeriGrey:灰盒代理验证
机构 * National University of Singapore(新加坡国立大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。
基于评分标准的语音大模型多维度多评分者二语阅读语音评估
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于评分标准的语音大模型微调方法,通过多维度评分标准和不确定性校准,提升二语阅读语音评估的可靠性与可解释性。
Comments Accepted to LREC 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)
潜在后验因子的理论基础:多证据推理的正式保证
机构 * Epalea
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种理论框架,通过变分自编码器将多异质证据转换为高斯潜在后验,并利用Sum-Product网络或神经聚合器进行聚合,提供多证据推理的正式保证。
Comments 30 pages, 8 figures, 10 tables. Theoretical characterization of the Latent Posterior Factors (LPF) framework for multi-evidence probabilistic reasoning, with formal guarantees and empirical validation
TxSum: 基于微粒语义锚定的用户导向以太坊交易理解
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Wuhan University(武汉大学) ; University of North Texas(北卡罗来纳州立大学) ; Fudan University(复旦大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。
在不确定性下的分层决策:一种混合MDP和机会约束MPC方法
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本文提出一种混合MDP和机会约束MPC的分层决策框架,用于自动驾驶中处理不确定性,通过多模态预测与安全约束实现 maneuver 选择与动态可行性的统一,验证了其在高速公路和城市环境中的安全性和效率。
Comments 14 pages, 10 figures
迈向基于CT的肺部疾病筛查的临床实践:一种高效且可靠的框架
机构 * Zhejiang University(浙江大学) ; Shaoxing Tangtang Technology Co., Ltd.(绍兴唐唐科技有限公司) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 本文提出一种高效可靠的框架,通过簇基于采样和模糊性感知不确定性量化方法,在减少计算成本的同时保持诊断性能,实现快速准确的肺部疾病筛查。
美国女性使用生成式AI寻求性与生殖健康信息的隐私和安全经验与担忧
机构 * King's College London London United Kingdom ; VRAIN, Universitat Politècnica de València \& University of Cambridge Valencia Spain Cambridge United Kingdom ; King's College London ; VRAIN, Universitat Politècnica de València \& University of Cambridge
专题命中 隐私与版权 :safety(title,abstract);分类 cs.AI
AI总结 研究探讨了美国女性使用生成式AI获取性与生殖健康信息时的隐私和安全问题,发现用户面临数据收集、政府监控等风险,提出针对性设计和政策建议。
Comments 21 pages, 2 tables, CHI conference on Human Factors in Computing Systems
Bodhi VLM:通过自上而下和自下而上的特征搜索实现视觉主干和VLM编码器中层次视觉表示的隐私对齐建模
机构 * Auckland University of Technology(奥克兰技术大学) ; Resideo Technologies, Inc.(Resideo技术公司) ; Guilin University of Electronic Technology(桂林电子科技大学) ; Universidad de Chile(智利大学)
专题命中 隐私与版权 :alignment(title,abstract)
AI总结 本文提出Bodhi VLM框架,通过NCP和MDAV聚类将敏感概念与分层神经表示的层间分组关联,并利用自上而下和自下而上的策略定位敏感特征区域,结合EMPA模块生成可解释的隐私预算对齐信号,验证了在目标检测和VLM视觉编码器中的有效性。
稳定遗忘:基础模型中的有界参数高效反遗忘
机构 * Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究院)
专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出稳定反遗忘方法,通过限制MLP适配器的权重动态,解决基础模型中反遗忘的不稳定问题,并在多个基准测试中验证其有效性。
Comments In Submission
联邦多智能体深度学习与神经网络用于无线网络中的高级分布式传感
机构 * Faculty of Information Technology and Electrical Engineering, University of Oulu(信息科技与电气工程学院,奥卢大学)
专题命中 隐私与版权 :safety(abstract);分类 cs.LG
AI总结 本文综述了多智能体深度学习在分布式传感和无线通信中的应用,涵盖学习框架、神经网络架构、高级技术及应用领域,分析了算法、训练拓扑及系统级权衡,并指出未来6G中的开放问题和研究方向。
通过多智能体辩论实现高效的LLM安全评估
机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; Beijing Key Laboratory of Safe AI and Super Alignment(北京安全人工智能与超对齐重点实验室) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; CSE, The Chinese University of Hong Kong(香港中文大学电子工程系) ; University of Chinese Academy of Sciences(中国科学院大学) ; Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) ; Long-term AI(长期人工智能)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出多智能体辩论框架,利用HAJailBench基准测试,提升LLM安全评估的可靠性与经济性,验证了少量辩论轮次即可获得显著效果。
Comments 15 pages, 5 figures, 10 tables. Updated abstract to fix an incconsistency issue with the main paper: HAJailBench size (12,000 -> 11,100)
SafeTutors: 评估AI辅导系统中的教学安全性
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; Indian Institute of Technology Kharagpur(印度理工学院Khargpur分校) ; Cisco Research(思科研究) ; Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) ; National Technical University of Ukraine(乌克兰国家技术大学) ; New York University(纽约大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 本文提出SafeTutors基准,评估AI辅导系统在数学、物理和化学中的教学有效性与安全性,发现模型在多轮对话中教学失败率显著上升,且学科差异影响安全措施效果。
面向部分的开放词汇3D功能接地 via 语义和几何对齐
机构 * ShanghaiTech University(上海科技大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。
FoMo X:用于异常检测基础模型的模块化可解释性信号
机构 * TU Dortmund University, Dortmund, Germany(图卢兹大学(德累斯顿)) ; Research Center Trustworthy Data Science and Security, University Alliance Ruhr, Dortmund, Germany(可信数据科学与安全研究中心,鲁尔大学联盟,德累斯顿,德国)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 FoMo-X通过模块化框架为异常检测基础模型提供内在轻量级诊断能力,利用预训练PFN背骨的冻结嵌入编码丰富关系信息,通过附加诊断头实现高效可解释性,实验证明其在合成和真实世界基准上具有高保真度和低推理开销。
Comments 24 pages, 9 figures
沉默的偏见:LLMs所学习到的拒绝的黑暗面
专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL
AI总结 本文提出Silenced Bias Benchmark,通过激活引导减少问答中的拒绝,揭示模型潜在的公平性问题,挑战传统公平评估方法。
Comments Accepted to The 40th Annual AAAI Conference on Artificial Intelligence - AI Alignment Track (Oral)
基于理解的智能体经济:面向AI经济代理的鲁棒性优先架构
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出Comprehension-Gated Agent Economy架构,通过对抗鲁棒性审计生成验证函数,实现经济权限的鲁棒性约束,确保经济安全与竞争力。
Comments v2: updated correspondence email
文本到舞台:从长篇叙述中生成空间布局
机构 * Rice University(里士大学) ; Meta FAIR ; Meta Reality Labs Research(Meta现实实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究如何通过语言模型从无结构文本推断戏剧舞台布局,提出确定性评估体系和结合拒绝SFT与RL的训练方法,在多个指标上优于基线模型。