SUDP: Secret-Use Delegation Protocol for Agentic Systems
SUDP: 面向智能体系统的秘密使用委托协议
机构 * Imperial College London(伦敦帝国学院) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
AI总结 针对智能体系统中用户秘密被滥用的问题,提出秘密使用委托协议(SUDP),通过授权、委托和兑现机制实现一次性秘密使用,满足七项安全属性。
高校专区
SUDP: 面向智能体系统的秘密使用委托协议
机构 * Imperial College London(伦敦帝国学院) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
AI总结 针对智能体系统中用户秘密被滥用的问题,提出秘密使用委托协议(SUDP),通过授权、委托和兑现机制实现一次性秘密使用,满足七项安全属性。
未知截断下的线性回归:超越高斯特征
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; Stanford University(斯坦福大学) ; Yale University(耶鲁大学)
AI总结 针对未知生存集的截断线性回归问题,提出首个多项式时间算法,仅要求特征向量为次高斯分布。
EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Tencent(腾讯) ; Tsinghua University(清华大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Film Academy(北京电影学院) ; Stanford University(斯坦福大学) ; The Chinese University of Hong Kong(香港中文大学) ; Singapore Institute of Technology(新加坡理工学院)
AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。
知识工作的设计与报告基准
机构 * Harvard University(哈佛大学) ; University of Technology Sydney(悉尼科技大学) ; Stanford University(斯坦福大学) ; Raycaster AI
AI总结 针对当前知识工作评估基准与真实部署脱节的问题,提出三步法(定义工作活动、指定测试设置、评分工作产品)来明确基准任务与工作主张的对应关系,并通过三个案例分析展示设计选择如何影响可支持的工作主张。
单GPU上的对齐与偏好学习的凸优化
机构 * Department of Electrical Engineering, Stanford University, California, United States(斯坦福大学电气工程系,加州,美国)
AI总结 提出COALA算法,利用凸优化重表述消除参考模型,在单GPU上高效训练,性能与DPO相当但计算量仅为其17.6%。
语音识别中的凸低资源口音鲁棒语言检测
机构 * Department of Electrical Engineering(电气工程系) ; Department of Computer Science, Stanford University, California, United States(计算机科学系,斯坦福大学,加利福尼亚,美国)
AI总结 提出凸语言检测(CLD)框架,利用凸优化和ADMM算法,在低资源条件下实现高精度、鲁棒的口音语言检测。
AutoResearch AI:迈向人工智能驱动的科研自动化以实现科学发现
机构 * Huazhong University of Science and Technology(华中科技大学) ; Lehigh University(莱斯大学) ; Tsinghua University(清华大学) ; Wuhan University(武汉大学) ; Salesforce Research(Salesforce研究) ; Squirrel AI Learning(Squirrel AI学习) ; Northwestern University(西北大学) ; Independent(独立) ; Shanghai Jiao Tong University(上海交通大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Chinese University of Hong Kong(香港中文大学) ; University of Illinois Chicago(伊利诺伊大学香槟分校) ; Stanford University(斯坦福大学) ; Google Cloud AI Research(谷歌云AI研究) ; Recursive Superintelligence(递归超级智能) ; Microsoft Research(微软研究院)
AI总结 本文综述了AI驱动的科研工作流自动化(AutoResearch)的发展,分析了从任务级AI到工作流级研究自动化的转变,并提出了五个评估维度(新颖性、有效性、影响力、可靠性和溯源),指出自主性受领域条件限制。
Comments 49 pages, 12 figures, 10 tables
结构主题模型与BERTopic在简短开放式调查回答中的比较评估
机构 * Stanford Center on Early Childhood, Stanford University(斯坦福大学早期儿童研究中心)
AI总结 本文比较了概率词袋模型(STM)与嵌入模型(BERTopic)在简短开放式调查回答上的表现,发现BERTopic在主题连贯性上更优,而STM在协变量推断分析上更强。
WildTableBench:在真实场景中评估多模态基础模型的表格理解能力
机构 * The University of Queensland(昆士兰大学) ; Stanford University(斯坦福大学) ; The Australian National University(澳大利亚国立大学) ; Zhejiang University(浙江大学) ; Murdoch University(莫纳什大学) ; The University of Adelaide(阿德莱德大学)
AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。
AI评估应要求标准化的项目级数据发布
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research Asia(微软亚洲研究院) ; Stanford University(斯坦福大学) ; North Carolina State University(北卡罗来纳州立大学) ; Tsinghua University(清华大学)
AI总结 本文主张AI评估应标准化发布项目级数据,以解决当前评估中项目选择不明确、构造错位和泛化能力差的问题,并通过OpenEval项目展示其可行性和价值。
CRONOS: 利用可扩展的GPU加速凸神经网络增强深度学习
机构 * Stanford University(斯坦福大学)
AI总结 提出CRONOS算法用于两层神经网络的凸优化,并扩展为CRONOS-AM以训练任意架构的多层网络,在ImageNet等大规模数据集上实现与主流深度学习优化器相当或更优的验证精度。
Journal ref Advances in Neural Information Processing Systems 37 (NeurIPS 2024)