Model Hypnosis: Strong control of AI via additive subliminal effects
模型催眠:通过叠加阈下效应对AI进行强控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。
高校专区
模型催眠:通过叠加阈下效应对AI进行强控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。
CytoFormer:用于组织病理学细胞分类的分子监督细胞基础模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Germantown Friends School(日耳曼敦贵格会学校)
AI总结 CytoFormer利用配对H&E染色与空间转录组学数据训练细胞基础模型,在细胞分类、迁移学习及主动学习中表现优异,为常规组织学的细胞分析提供高效可复用表示。
Comments 20 pages, 5 figures, 2 extended data figures
面向圆柱腔体检修的观测约束关节空间视点优化
机构 * ShanghaiTech University(上海科技大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文提出一种机器人关节空间中观测约束圆柱腔体检修的自主优化方法,通过多起点无导数搜索优化关节构型,在 Isaac Sim 实验中表现优于基准方法,完成 92%目标构型且平均底部可见度达 91.65%。
基于视觉引导的4自由度机械臂的桌面钢笔操作
机构 * Dougherty Valley High School(多切蒂谷高中) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 该研究利用感知与运动规划,让无腕部旋转关节的4自由度Waveshare RoArm-M2-S机械臂,通过YOLO11n-OBB等算法,实现了桌面书写工具的检测、校正与颜色分类,补偿了缺失的自由度。
Comments 19 pages, 8 figures
你的注意力指标回答的是哪个问题?注意力行作为组成数据
机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) ; Yale University(耶鲁大学)
AI总结 该研究指出注意力指标的汇点处理选择会反转结论,提出将注意力行视为组成数据分离汇点与内容项,明确训练中熵崩溃的原因,确定约定安全场景并发布复现代码。
Comments Preprint under submission
MathGen:通过文本到图像生成揭示数学能力的幻觉
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Michigan(密歇根大学) ; The Ohio State University(俄亥俄州立大学) ; USTC(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; University of Wisconsin(威斯康星大学) ; UCSB(加州大学圣塔芭芭拉分校) ; University of Hong Kong(香港大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 MathGen通过900道跨七个核心领域的数学问题,评估生成模型在视觉化数学解答中的准确性,发现现有模型在数学 fidelity 上存在显著瓶颈。
视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?
机构 * Drexel University(德雷塞尔大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。
Score Attack:最优差分隐私学习的下界技术
机构 * Department of Statistics and Data Science, The Wharton School, University of Pennsylvania(统计与数据科学系,沃顿商学院,宾夕法尼亚大学) ; Rutgers University(罗格斯大学)
AI总结 该研究提出score attack方法,基于追踪攻击概念为差分隐私约束的参数估计极小极大风险提供下界,经多类模型验证其有效性与最优性。