QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
QED-Nano:用小型模型证明难题定理
机构 * CMU(卡内基梅隆大学) ; Hugging Face ; ETH Zurich(苏黎世联邦理工学院) ; Project Numina
AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。
高校专区
QED-Nano:用小型模型证明难题定理
机构 * CMU(卡内基梅隆大学) ; Hugging Face ; ETH Zurich(苏黎世联邦理工学院) ; Project Numina
AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。
强化学习中决策相关概念的选择
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学)
AI总结 本文提出决策相关选择算法,通过状态抽象视角自动选择决策相关的概念,提升强化学习策略的可解释性和性能。
Comments 16 pages, 13 figures
IDIOLEX:统一且连续的语用与风格变异表示
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Notre Dame(圣母大学) ; George Mason University(乔治梅森大学) ; University of Washington(华盛顿大学) ; Archimedes Research Unit(阿基米德研究单元)
AI总结 本文提出IDIOLEX框架,通过结合句子来源信息与语言特征,学习连续的风格和方言表示,用于分析和分类,并用于对齐语言模型的风格。
从好奇心到谨慎:通过悲观主义缓解最佳-N中的奖励黑客
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出一种基于悲观主义的缓解方法,通过降低不典型响应的奖励估计来避免奖励黑客,证明其在最佳-N采样中有效。
Comments 29 pages, 8 figures
AgentSocialBench: 评估人类中心代理社交网络中的隐私风险
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究探讨了人类中心代理社交网络中的隐私挑战,提出AgentSocialBench基准,揭示代理协作中隐私保护的复杂性及现有LLM在隐私保护上的不足。
Comments 43 pages, 9 figures
双足机器人的等比定律
机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文研究双足机器人腿部长度与质量、速度等参数的等比关系,发现机器人质量与腿部长度平方成正比,与生物等比定律不同。
Sandpiper:大规模教育对话中的协同AI标注
机构 * National Tutoring Observatory(国家辅导观察站) ; FreshCognate ; Cornell University(康奈尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 Sandpiper通过结合交互式研究仪表板与大语言模型,实现高体积对话数据与人类定性专家的协同分析,提升研究效率和可靠性。
IV共科学家:多智能体LLM框架用于因果工具变量发现
机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Jinesis AI Lab(Jinesis AI实验室) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; EuroSafeAI ; Carnegie Mellon University(卡内基梅隆大学) ; Amazon(亚马逊)
AI总结 本文探讨LLM在发现因果工具变量中的作用,提出IV共科学家多智能体系统,通过测试和评估LLM恢复已知工具及避免无效工具的能力,展示LLM在大规模观测数据中发现有效工具的潜力。
Comments Paper accepted at CleaR 2026
通过交错多模态推理的视觉-反图形代理
机构 * University of California, Berkeley(加州大学伯克利分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Impossible, Inc.(Impossible公司)
AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。
Comments Project page: https://fugtemypt123.github.io/VIGA-website/
PIMMUR 原则:确保 LLM 社会集体行为的有效性
机构 * Chinese University of Hong Kong(香港中文大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Fudan University(复旦大学) ; Stanford University(斯坦福大学) ; Renmin University of China(中国人民大学)
AI总结 本文通过审计39项研究,识别出六个普遍缺陷,指出89.7%的研究违反至少一个原则,导致模拟有效性受损。通过复现实验发现,当遵循PIMMUR原则时,报告的集体现象往往消失或反转,表明许多'涌现'行为可能是方法学伪影而非真实社会动态。
Comments 13 pages, 9 figures, 3 tables; add more papers in our systematic audit (39 in total)
ZINA:多模态细粒度幻觉检测与编辑
机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) ; Keio University(庆应义塾大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。
Comments CVPR 2026 Main Conference
因果k均值聚类
机构 * Department of Statistics, Korea University(高丽大学统计系) ; Department of Statistics, Seoul National University(首尔大学统计系) ; Department of Statistics and Data Science, Carnegie Mellon University(卡内基梅隆大学统计与数据科学系)
AI总结 本文提出因果k均值聚类方法,用于识别未知的子群体结构,通过非参数效率理论和双机器学习开发偏倚校正估计器,实现快速根n收敛和渐近正态性,适用于多治疗水平的现代结果研究。
Journal ref J. R. Stat. Soc. Ser. B, 2026
MisEdu-RAG:一种面向初学者数学教师的误解意识双超图RAG
机构 * The University of Hong Kong(香港大学) ; Xi'an Jiaotong University(西安交通大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Monash University(莫纳什大学)
AI总结 针对初学者数学教师难以诊断和纠正学生错误的问题,提出基于双超图的RAG框架,通过组织教学知识和学生错误案例,提升响应质量。
SKILLFOUNDRY:从异构科学资源构建自演化智能体技能库
机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院Ray and Stephanie Lane计算生物学系) ; Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)
AI总结 SKILLFOUNDRY通过自演化框架将异构资源转化为验证过的智能体技能包,提升科学代理在基准和领域任务中的性能,扩展覆盖范围,为更强大的科学代理提供基础。
CGHair: 基于卡聚类的紧凑高斯发丝重建
机构 * Carnegie Mellon University(卡内基梅隆大学) ; ShanghaiTech University(上海科技大学)
AI总结 本文提出一种紧凑的高保真发丝重建方法,通过卡聚类减少存储和渲染成本,同时保持视觉质量。
Comments Accepted to CVPR 2026. This arXiv version is not the final published version
缓解结构过拟合:一种分布感知的缺失特征填补框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Shanghai University of Finance and Economics(上海财经大学)
AI总结 本文提出DART框架,通过全局结构增强和语义校正机制,解决图学习中缺失特征填补的结构过拟合问题,并在六个公开数据集和Sailing数据集上验证了其有效性。
Comments Accepted by SIGIR2026
WhisperRT -- 将Whisper转化为因果流式模型
机构 * Andrew and Erna Viterbi Faculty of Electrical and Computer Engineering, Technion–Israel Institute of Technology(以色列理工学院安德鲁与厄娜·维特比电气与计算机工程学院) ; Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院语言技术研究所)
AI总结 本文提出将Whisper模型转化为低延迟流式模型的方法,通过使编码器因果化并生成与可用时间上下文对齐的token,实现更高效的流式语音识别。
Comments 14 pages, 7 Figures, This work has been submitted to the IEEE for possible publication