Evaluating Commercial AI Chatbots as News Intermediaries
评估商业AI聊天机器人作为新闻中介
机构 * Stanford University(斯坦福大学) ; Independent Researcher(独立研究者) ; Together AI
AI总结 本研究评估了AI聊天机器人在跨语言和区域处理新兴事实的准确性,发现其在多选题中表现良好,但在自由回答和复杂问题上存在显著误差,揭示了区域不平等和依赖检索基础设施的问题。
高校专区
评估商业AI聊天机器人作为新闻中介
机构 * Stanford University(斯坦福大学) ; Independent Researcher(独立研究者) ; Together AI
AI总结 本研究评估了AI聊天机器人在跨语言和区域处理新兴事实的准确性,发现其在多选题中表现良好,但在自由回答和复杂问题上存在显著误差,揭示了区域不平等和依赖检索基础设施的问题。
安全且可操控的几何运动策略用于机器人灵巧操作
机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) ; Laboratory of Signals and Systems, University of Paris-Saclay, CNRS, CentraleSupélec(巴黎-萨克雷大学信号实验室,CNRS,CentraleSupélec) ; Toyota Research Institute(丰田研究院)
AI总结 本研究提出SafePBDS框架,通过几何一致的方法计算最优且可证明安全的配置流形加速度,以实现机器人灵巧操作中的目标和约束的持续协调,并在模拟和Franka Panda-Allegro手平台上验证了其在灵巧抓取和手部重定向中的高效规划和安全保障。
Comments 24 pages, 10 figures, 5 tables. Project page and demo video: https://tml.stanford.edu/safe-pbds
什么是AI阿谀奉承?对一个碎片化概念的分类和专家调查
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; University of Toronto(多伦多大学) ; Stanford University(斯坦福大学) ; University of Cincinnati(克里夫兰医学中心大学) ; New York University(纽约大学)
AI总结 本文通过文献综述和专家调查,揭示了AI阿谀奉承行为的分类和测量挑战,提出了一种统一的分类体系以促进对这一问题的理解和应对。
PromptNCE:仅使用LLM和对比估计提示进行点互信息预测
机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学)
AI总结 本文提出PromptNCE方法,通过将条件概率估计转化为对比任务,并引入显式的OTHER类别来恢复真实的条件概率,从而在低数据情况下实现零样本点互信息估计。
蛋白质思想:基于树 of 思维和嵌入空间流匹配的可解释推理用于蛋白质-蛋白质相互作用发现
机构 * Department of Statistics and CCAM University of Chicago(统计学系和CCAM大学芝加哥分校) ; School of Medicine Stanford University(医学学院斯坦福大学) ; Department of Statistics University of Chicago(统计学系芝加哥大学)
AI总结 本文提出了一种可解释的蛋白质-蛋白质相互作用发现框架,通过显式推理将PPI发现转化为可解释的搜索问题,利用嵌入空间流匹配和树 of 思维搜索方法提升预测精度和可解释性。
通用偏好强化学习
机构 * Stanford University(斯坦福大学) ; The University of Oklahoma(俄克拉荷马大学)
AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。
通过语义层面奖励校准大型语言模型
机构 * Department of Computer Science and Engineering, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校计算机科学与工程系,拉贾尔,加利福尼亚州,美国) ; Halıcıoğlu Data Science Institute, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校Halıcıoğlu数据科学研究所,拉贾尔,加利福尼亚州,美国) ; Department of Statistics, Stanford University, Stanford, California, USA(斯坦福大学统计学系,斯坦福,加利福尼亚州,美国)
AI总结 本文提出了一种新的校准框架CSR,通过在语义空间中直接校准语言模型,避免了传统方法中因词汇化置信度导致的不一致问题,实验显示CSR在多个数据集上均能有效降低ECE并提高AUROC。
CellFluxRL: 通过强化学习实现生物约束的虚拟细胞建模
机构 * Stanford University(斯坦福大学)
AI总结 本文提出CellFluxRL,通过强化学习约束虚拟细胞模型,使其在生物功能、结构有效性及形态正确性方面更符合生物学规律,从而提升虚拟细胞建模的生物意义。
面向科学成像的不确定性感知分布到分布流匹配
机构 * Stanford University(斯坦福大学)
AI总结 本文提出了一种面向科学成像的不确定性感知分布到分布流匹配方法,通过引入贝叶斯随机流匹配和抗变异不确定性量化技术,提升模型在分布偏移下的泛化能力,并有效估计epistemic和aleatoric不确定性,从而检测不可靠的生成结果。
发现隐式大语言模型对齐目标
机构 * Stanford University(斯坦福大学)
AI总结 本文提出Obj-Disco框架,通过自动分解对齐奖励信号为可解释的目标,解决现有方法的不足,验证了框架在多种任务和模型上的鲁棒性,并发现潜在的对齐偏差。
Comments ICML 2026