Enhancing Online Support Group Formation Using Topic Modeling Techniques
利用主题建模技术增强在线支持小组的形成
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 本文提出两种新模型,通过整合用户生成内容、人口统计数据和网络数据,实现自动化个性化支持小组形成,提升语义连贯性和内部一致性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
利用主题建模技术增强在线支持小组的形成
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 本文提出两种新模型,通过整合用户生成内容、人口统计数据和网络数据,实现自动化个性化支持小组形成,提升语义连贯性和内部一致性。
对齐的打砖块:微调激活大型语言模型对版权书籍的原文回忆
机构 * Stony Brook University(石溪大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia Law School(哥伦比亚法学院)
专题命中 隐私与版权 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究显示微调可绕过安全对齐策略,使GPT-4o等模型能回忆85-90%的版权书籍,揭示模型权重存储版权作品的漏洞。
Comments Preprint Under Review
双空间平滑性用于鲁棒且平衡的LLM反学习
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)
专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PRISM框架,通过双空间平滑性提升LLM反学习的鲁棒性和平衡性,有效对抗重学和劫持攻击。
Comments Accepted by ICLR 2026
迈向多模态大语言模型联邦预训练的一小步
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; Pengcheng Laboratory(鹏城实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院)
专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Fed-MA任务,通过冻结视觉编码器和LLM,协同训练跨模态投影器,解决参数干扰和梯度震荡问题,提出Fed-CMP框架在联邦预训练中取得显著优势。
菲律宾学生使用AI进行心理健康支持的意愿:行为、情感和情境因素的路径分析
专题命中 隐私与版权 :safety(abstract);分类 cs.CY
AI总结 研究探讨了行为、情感和情境因素如何影响菲律宾学生使用AI进行心理健康支持的意愿,发现习惯对意愿影响最大,后续为舒适度、情感益处等因素,强调情感安全与常规使用对提升意愿的重要性。
Comments 24 pages, 5 figures, 1 table, book chapter
Journal ref Implications for Students' Mental Health in the Digital Age: AI and Cyber Behavior (2026) 381-404
评估人机安全:衡量有害能力提升的框架
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本文提出通过测量前沿模型带来的有害能力提升,推动人中心的AI安全评估,提供系统性测量方法和行动步骤。
通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; Peking University(北京大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。
Comments Accepted by CVPR 2026 main conference
CREST:通过聚类引导的跨语言迁移实现通用安全性防护
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出CREST模型,通过跨语言迁移有效提升低资源语言的安全性防护,展示其在六个安全基准上的优越表现。
Comments 9 Pages, 5 Figures, Accepted at LREC 2026
挤压与释放:通过使其显现为安全信号来暴露隐藏的幻觉
专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Squish and Release框架,通过激活空间修补技术揭示模型在对话压力下隐藏的幻觉问题,通过实验验证了检测模块和核心架构的有效性。
你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架
机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。
模仿对齐与ASPECT:AI推断个人资料的评估
机构 * University of Washington(华盛顿大学) ; Microsoft Research(微软研究院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出ASPECT方法,通过验证的沟通量表和职场数据评估LLM沟通特征,生成的个人资料在自评上表现良好,并在多个场景中优于通用和自述基线。
Comments 20 pages (including appendix), 5 figures, 5 tables
奖励黑客行为作为有限评估下的均衡
专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.AI
AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。
Comments 16 pages
LITTA:晚期交互与测试时对齐用于视觉接地多模态检索
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。
用于对齐大语言模型的控制屏障函数
机构 * Keio University(庆应义塾大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于控制的框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器干预生成文本,无需微调基模型。
Comments This work is an extenede version of arXiv:2408.15625 and has been submitted to the IEEE for possible publication
Journal ref IEEE Transactions on Control Systems Technology 2026
揭示微妙的刻板印象:一种多语言、辩论导向的现代大语言模型评估
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; University of Waterloo(滑铁卢大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY
AI总结 本文提出多语言辩论基准测试,揭示生成模型中叙事偏见。通过8400个跨语言辩论提示,评估模型对敏感领域刻板印象的再现,发现所有模型均存在偏见,且低资源语言中偏见更严重。
为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; University of Georgia(佐治亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全评测 :safety(title)
AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。
大语言模型时代下的模型合并:方法、应用与未来方向
机构 * Tencent, China(腾讯(中国))
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文探讨了大语言模型时代模型合并的方法、应用及未来方向,通过FUSE分类体系系统回顾了算法空间、下游应用及支持生态系统,识别了关键挑战与未来研究方向。
算法保险
机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) ; Saïd Business School, Oxford University(牛津大学赛德商学院)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG
AI总结 研究算法保险在AI致损中的风险定价与责任框架,提出基于CVaR的分类阈值优化方法,通过乳腺癌案例验证降低尾部风险并提升保险收益。
PubMed Reasoner: 基于动态推理的证据导向生物医学问答检索
机构 * PayPal ; Worcester Polytechnic Institute(伍斯特理工学院)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL
AI总结 PubMed Reasoner通过动态推理机制提升生物医学问答的准确性与证据可靠性,采用三阶段框架优化检索过程并生成有据可查的回答。
Comments 20 pages; under review
通过概念解释CLIP零样本预测
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) ; Orbital ; DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) ; Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) ; Technical University of Munich (TUM)(慕尼黑工业大学) ; Helmholtz Munich(亥姆霍兹慕尼黑中心) ; MCML ; MDSI ; Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。
Comments Accepted to CVPR 2026
ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估
机构 * Tongji University(同济大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; Fudan University(复旦大学) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。
ParsCN:一种针对网络仇恨言论的Persian数据集用于生成反叙事以对抗在线仇恨言论
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 本文提出ParsCN数据集,用于生成对抗网络仇恨言论的反叙事,通过结合文化导向的人工标注与少样本LLM增强生成,提升低资源语言的反叙事质量。
Comments Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2026); Paper Information: 16 pages, 3 Figures, 10 Tables
从预测到诊断:面向光伏缺陷检测的推理感知AI
机构 * Illinois Institute of Technology(伊利诺伊理工学院) ; Argonne National Laboratory(阿贡国家实验室) ; Commonwealth Edison(联邦爱迪生公司) ; Drexel University(德雷塞尔大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本文提出REVL-PV框架,通过融合电致发光、热成像和可见光图像,实现光伏缺陷的结构化诊断报告,提升检测准确性和可解释性。
Comments 34 pages, 5 figures
实时瑜伽体态检测与纠正的智能框架
机构 * Independent Researcher(独立研究员) ; NovaTech Innovative Solutions(NovaTech创新解决方案)
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 本文提出一种混合边缘AI框架,用于实时瑜伽姿势检测与体态纠正,结合轻量级人体姿态估计模型与生物力学特征提取,通过CNN-LSTM时序学习架构分析运动动态,并利用量化和剪枝技术提升边缘设备性能。
评估LLMs在初级编程课程中回答学生问题的能力
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文研究了LLMs在初级编程课程中协助教师回答学生问题的能力,通过构建基准数据集和定制评估指标,证明了LLMs能超越传统教师回答质量,并提出'教师在环'策略以降低风险。
嵌入物理的特征学习用于医学影像中的AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出PhysNet,通过将肿瘤生长动力学嵌入卷积神经网络的特征学习过程,提升医学影像AI的可解释性和鲁棒性,实验表明其在脑部MRI数据集上优于多种现有模型。
Comments 7 pages, 5 figures
词化与乌拉尔语NLP中的形态保真度:跨语言评估
机构 * University of Eastern Finland(东芬兰大学) ; AI-Bio Convergence Research Institute(人工智能-生物融合研究所) ; Soongsil University(崇实大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文通过比较三种子词方法在六个乌拉尔语中的表现,发现OBPE在形态对齐和标注准确性上优于传统方法,尤其在拉丁字母语中表现突出。
Journal ref Proceedings of the Second Workshop on Language Models for Low-Resource Languages (LoResLM 2026)
基于大语言模型的急救分级基准:连接医院丰富与MCI类现场模拟
机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出一个开放的急救分级基准,通过大语言模型辅助构建,解决现有基准不可用的问题,涵盖医院环境和MCI模拟两种场景,提升临床AI数据集的可重复性和可访问性。
Comments Submitted to GenAI4Health@NeurIPS 2025. This was the first version of the LLM-assisted emergency triage benchmark dataset and baseline models. A related but separate benchmark-focused study on emergency triage under constrained sensing has been accepted at the IEEE International Conference on Healthcare Informatics (ICHI) 2026 (see arXiv:2602.20168)
OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割
机构 * National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。
Comments Accepted by ICME 2026
大语言模型能否超越行为模仿模拟人类认知?
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文通过217位AI研究者纵向研究轨迹构建基准,评估LLM是否能模拟人类认知,提出多维认知对齐指标,系统评估最新LLM及增强技术,探讨其模拟人类认知的能力及提升空间。