AI-Assisted Systematization for Evaluating GenAI Systems
AI辅助的系统化方法用于评估生成式AI系统
机构 * Cornell University(康奈尔大学) ; Microsoft Research(微软研究院)
AI总结 针对生成式AI评估中概念模糊的问题,提出AI辅助系统化方法,通过概念规范和验证工作表生成可衡量的概念规范,并评估其内容效度和信息可恢复性。
高校专区
AI辅助的系统化方法用于评估生成式AI系统
机构 * Cornell University(康奈尔大学) ; Microsoft Research(微软研究院)
AI总结 针对生成式AI评估中概念模糊的问题,提出AI辅助系统化方法,通过概念规范和验证工作表生成可衡量的概念规范,并评估其内容效度和信息可恢复性。
相对可修复性:一种基于校准的高稀疏度剪枝后分配诊断方法
机构 * Marquette University(马凯特大学) ; Tongji University(同济大学) ; Cornell University(康奈尔大学) ; UT Austin(得克萨斯大学奥斯汀分校)
AI总结 提出相对可修复性(RR)指标,通过校准数据比较层剪枝引起的原始激活失真与通道方差匹配修复后的残余失真,用于诊断高稀疏度下剪枝损伤的可修复性,实验表明其在架构依赖的可恢复性转变区域优于现有分配规则。
知道但不展示:LLMs 识别歧义但很少提出澄清问题
机构 * Cornell University(康奈尔大学)
AI总结 研究大型语言模型在识别用户查询歧义与主动提出澄清问题之间的行为差距,发现模型虽能识别歧义但默认直接回答,检索上下文会进一步减少澄清行为。
从片段偏好反馈中学习基于核的MDP
机构 * Cornell University(康奈尔大学) ; MediaTek Research(联发科研究)
AI总结 本文研究片段核MDP中的偏好学习,提出基于偏好比较的价值估计和置信集方法,并证明亚线性遗憾界。
澄清不够:澄清后的回答仍是多轮问答中的瓶颈
机构 * Cornell University(康奈尔大学) ; Adobe Research(Adobe研究)
AI总结 本文通过分解多轮问答为澄清策略和澄清后回答两个组件,利用PACIFIC基准实验发现监督微调能快速提升澄清策略,但最终答案准确率仍显著偏低,表明理解并正确解释用户回应是关键瓶颈。
Courant:一种具有局部支持和可解释场分解的状态自适应感知器神经代理模型
机构 * Pasteur Labs(Pasteur实验室) ; Cornell University(康奈尔大学) ; Institute for Simulation Intelligence(模拟智能研究所)
AI总结 提出基于感知器的编码-处理-解码代理模型Courant,通过状态自适应潜在查询和轻量解码器实现类似自适应hp细化的局部支持与可解释场分解,在稳态/瞬态模拟基准上取得竞争性精度。
重新审视预传播图神经网络:鲁棒扩散算子与隐状态再传播
机构 * School of Electrical and Computer Engineering, Cornell University, Ithaca, New York, USA(电气与计算机工程系,康奈尔大学,纽约州伊萨卡市)
AI总结 提出鲁棒图扩散算子和少量隐状态再传播方案,使预传播图神经网络在保持训练效率的同时匹配消息传递图神经网络的精度。
费米-狄拉克机作为神经元的量子化
机构 * Department of Physics, Cornell University(康奈尔大学物理系) ; Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) ; School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) ; Ministry of Education Key Laboratory in Scientific and Engineering Computing, Shanghai Jiao Tong University(上海交通大学教育部科学与工程计算重点实验室) ; Global College, Shanghai Jiao Tong University(上海交通大学全球学院) ; School of Electrical and Computer Engineering, Cornell University(康奈尔大学电气与计算机工程学院)
AI总结 本文将费米-狄拉克机重新解释为经典神经元的正则量子化,通过用算子替换经典变量,开发了高效混合量子-经典算法来评估和训练量子化神经元,并证明了基于费米-狄拉克神经元的计算决策问题是BQP完全的。
Comments 87 pages, 12 figures, 2 tables
ViViD-5K:用于田间浆果检测与分割以及葡萄串闭合度估计的葡萄园视觉数据集
机构 * Horticulture Section, School of Integrative Plant Science, Cornell University(康奈尔大学整合植物科学学院园艺系) ; School of Electrical and Computer Engineering, Cornell University(康奈尔大学电气与计算机工程学院)
AI总结 提出ViViD-5K大规模葡萄园图像数据集和GrapeSAM两阶段视觉流水线,实现葡萄串闭合度的自动、客观估计。
音乐转录:几乎无需监督
机构 * Cornell University(康奈尔大学)
AI总结 采用循环一致性翻译框架,利用少量配对数据作为锚点,充分挖掘未配对音频和乐谱数据,实现高质量音乐转录。
大规模人机协作科学:一项全球大规模随机现场实验
机构 * Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) ; Center for Science of Science and Innovation, Northwestern University(西北大学科学与创新中心) ; Northwestern Institute on Complex Systems, Northwestern University(西北大学复杂系统研究所) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Goizueta Business School, Emory University(埃默里大学戈伊兹特亚商学院) ; Department of Information Science, Cornell University(康奈尔大学信息科学系)
AI总结 通过全球大规模随机现场实验,研究大型语言模型(LLMs)生成的定制化反馈能否提升科研人员的修订率并促进AI工具使用,尤其惠及资源受限的研究者。
利用包含气溶胶信息的扩散模型改进集合CAPE预报
机构 * Cornell University, Department of Statistics and Data Science(康奈尔大学统计与数据科学系) ; Washington University in St. Louis, Department of Statistics and Data Science(圣路易斯华盛顿大学统计与数据科学系) ; Cornell University, Department of Earth and Atmospheric Sciences(康奈尔大学地球与大气科学系)
AI总结 针对GFS/GEFS系统夏季CAPE低估偏差,提出两阶段训练的AI扩散模型,通过输入GFS预报并输出集合,显著提升RMSE、CRPS和Brier评分,并引入气溶胶光学厚度作为额外特征以改善预报。
arXiv 上可访问数学的规模化:HTML 转换与 MathML 4
机构 * arXiv, Cornell Tech, New York NY, USA(arXiv,康奈尔科技,纽约NY,美国) ; National Institute of Standards and Technology, Gaithersburg MD, USA(国家标准与技术研究院,加ithersburg MD,美国)
AI总结 本文报告 arXiv HTML 论文服务的持续开发,重点介绍 2025 年至 2026 年初的社区驱动改进、语料级转换、MathML 4 意图注释以及 LaTeXML 的 Rust 移植,旨在提升 HTML 保真度、可访问性和计算效率。
Comments 6 pages, ICMS 2026