Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration
主特质分析:面向人机协作中“技能”的推导
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。
高校专区
主特质分析:面向人机协作中“技能”的推导
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。
不值得再增加一个Token:面向高效深度研究智能体的边际价值估计
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Adobe Research(奥多比研究院)
AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。
探究预训练检测Transformer的三维物体级理解能力
机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) ; SRI International(SRI国际公司)
AI总结 本文探究预训练二维检测Transformer对物体三维属性的理解,发现无三维监督预训练的二维DETR模型,能通过线性和非线性探针从物体级嵌入中恢复物体深度、三维位置等三维属性信息,具备强的三维物体级理解能力。
理论上可认证,实践中却被破解:密码学模型认证中的假设差距
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Vector Institute & University of Toronto(向量研究所及多伦多大学) ; Carnegie Mellon University(卡内基梅隆大学) ; J.P.Morgan AI Research & AlgoCRYPT CoE(摩根大通人工智能研究及AlgoCRYPT中心) ; University of Toronto(多伦多大学)
AI总结 研究密码学模型认证中现有安全定义与实际应用的差距,通过精心设计训练数据可攻击相关认证方案。为此形式化严格安全概念,引入通用协议模板,为设计安全隐私保护的机器学习审计协议提供指导。
GS-Agent:通过生成式模拟创建4D物理世界
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Genesis AI(创世纪人工智能公司)
AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。
AutoIndex:学习用于检索的表示程序
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Databricks Mosaic Research(Databricks Mosaic研究)
AI总结 AutoIndex框架通过搜索对文档进行多种操作的程序来优化文档表示,在CRUMB基准上评估,相比BM25基线显著提升召回率,证明文档表示应作为优化目标,而非固定预处理选择。
出于什么原因?解释模型对因果关系和对立关系的编码
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of South Florida(南佛罗里达大学)
AI总结 研究指令微调的Transformer模型对英语话语关系的编码,聚焦因果和对立关系。通过下一个token预测任务及可解释性技术,发现早期层在序列中间做预测,中层接近末尾确定决策,部分层有答案偏好,揭示话语推理的不对称表示。
大型图像集中可扩展的模型辅助多目标估计
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 研究大型图像集多目标估计问题,借鉴调查抽样策略,在五个检测和分割数据集上评估,发现重要性采样、带控制变量的均匀采样及基于子集的比率估计器各有优势,有效结合模型预测与人类标签进行科学测量。
Comments Accepted at the 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)
硬规则,软偏好:为个性化行李清单生成搭建推理、学习和优化的桥梁
机构 * Tech LLC(529科技有限责任公司) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Virginia(弗吉尼亚大学)
AI总结 针对航空旅行打包易出错问题,提出含符号引擎、偏好学习器和CP - SAT优化器的推理引导学习框架,能生成个性化、合规行李清单,在实验中表现良好,在应用中提升了清单完成量并减少了时间。
从可行性到合意性:用于个性化设备端行程生成的计划、学习、适应(PLA)框架
机构 * Tech LLC(529科技有限责任公司) ; University of Virginia(弗吉尼亚大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 研究针对个性化设备端行程生成问题,提出PLA框架,分计划、学习、适应三阶段,通过构建规划器集合、拟合奖励模型及进行局部优化来生成行程,实验表明该框架在可行性和胜率上表现出色,还提升了生产部署中的行程完成率并降低延迟。
深度残差架构的尖锐稳定性阈值与认证
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; SRI International(SRI国际公司)
AI总结 该研究为深度残差架构提出次线性增长原理,通过经典ODE理论和最优控制分析确定\(q \leq 1\)为稳定训练充要条件,阐明架构布局与稳定关系,构建函数空间并给出认证算法,实验证实相关变体训练稳定。
用于短暂协作感知的基于视觉基础模型的通信高效相对位姿估计
机构 * North Carolina State University(北卡罗来纳州立大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 针对现实中机器人短交互窗口及有限通信带宽下的相对位姿估计难题,提出通信高效相对位姿估计框架CERPE,利用固定大小描述符减少原始观测交换,通过自身运动传播相对位姿,提升了短暂协作感知中的6自由度相对位姿估计。
Comments 8 pages, 6 figures
在无穷小非组合草图中学习
机构 * Adobe Research(Adobe研究院) ; University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
AI总结 研究如何通过LINCS框架修复机器学习中非组合性问题,将问题指定为草图,利用切提升和INC自函子,把机器学习表述为寻找余代数不动点,证明特定条件下最终INC余代数存在,正进行多场景实验评估。
从新手到专家:众包感知中用于提升工人绩效的成本感知策略
机构 * University of Florida(佛罗里达大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 研究众包感知中预算受限的在线工人招募问题,工人绩效随经验变化,成本未知。提出成本感知在线学习框架,建模为结构化策略模型,能联合学习奖励轨迹与成本,检测性能饱和,分配预算最大化感知效用,实验验证优于基线方法。
Comments 14 pages, 10 figures, 3 tables, submitted for possible journal publication
当评分标准改变时:批判性思维作文评分的跨评分标准泛化
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Minnesota(明尼苏达大学) ; Brighter Research(更光明研究公司) ; Adelaide University(阿德莱德大学)
AI总结 研究跨评分标准泛化问题,采用含评分标准无关中间表示和目标作文监督的大语言模型微调框架,在增强数据集上实验,结果表明基于特征的中间结构和受控监督可提升对未见过评分标准的泛化能力。
Comments Published in AI for Education Day at SIGKDD 2026
通过聚类截断提高自回归文本到图像生成中的样本多样性
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Thoughtworks(Thoughtworks公司)
AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。
GRASP:用于智能检索增强生成的粒度感知搜索策略
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Adobe Research(Adobe 研究院)
AI总结 研究智能体检索增强生成中模型决策难题,提出GRASP强化学习框架,训练智能体协调互补检索工具,实验表明其提升检索召回率和问答性能,还展现出可解释行为,凸显协调检索信号和上下文粒度对智能体推理的关键作用。
李代数胚上的智能体技能优化
机构 * Adobe Research(Adobe研究院) ; University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
AI总结 研究智能体技能优化问题,提出LASKO框架,将技能建模为李代数胚截面,利用李括号筛选测试替代昂贵验证,在自然语言任务因果提取中实现近15倍加速,提升技能优化速度。
Comments 20 pages
Video2Reaction:将视频映射到自然环境中的观众反应分布
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Dolby Laboratories(杜比实验室)
AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。
通过拉格朗日奖励增强实现安全推理时对齐
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Independent Researcher(独立研究者)
AI总结 研究提出拉格朗日奖励增强框架,从含奖励与成本模型的约束目标出发,经对偶化将问题转化为一维凸问题,校准对偶变量获增强奖励,提升推理时对齐的有益性与无害性权衡。
通过验证器与生成器对齐改进大语言模型
机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) ; Departments of Linguistics and Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学与计算机科学系) ; Department of Computer Science & Center for Data Science, New York University(纽约大学计算机科学系及数据科学中心)
AI总结 研究大语言模型不一致问题,提出基于话语频率的生成器-验证器一致性新公式,介绍\FCPA方法,实验表明该方法能提升生成器性能及两者一致性,且保持验证器质量。
Janus:用户参与的智能体权限管理实验平台
机构 * University of Washington(华盛顿大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Georgetown University(乔治城大学)
AI总结 提出Janus系统,通过模块化框架和自动化评估工具,研究用户参与AI智能体权限管理的设计空间,发现用户输入可增强隐私安全,AI辅助可降低认知负担,但需考虑权限疲劳等现实行为。
Comments Code and data released on GitHub: https://github.com/GraceBrigham/Janus
PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; Google(谷歌) ; Snowflake
AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。
Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
LLawCo: 学习合作法则以建模具身多智能体行为
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Mitsubishi Electric Research Laboratories(三菱电机研究实验室)
AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。
Comments Accepted to ICML 2026
Odyssey: 构建可验证的局部保真基础模型
机构 * Adobe Research(Adobe 研究院) ; University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
AI总结 提出一种名为ODYSSEY的范畴论框架,通过组合“foundries”构建可验证的局部保真基础模型,并引入Universal Foundry Learning和Foundry SQL实现形式化构造与查询。
Comments 34 pages
多重中介者的诅咒:激活补丁中的隐藏交互效应
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Adobe Research(Adobe研究院) ; Boston University(波士顿大学)
AI总结 本文从因果中介分析重新推导激活补丁估计量,发现自然间接效应包含交互效应,导致组件因果重要性评估偏差,并提出交互效应作为可解释性诊断工具。
AI告密者出故障:走向规避智能体监控
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。
Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/
AI辅助计算可复现性在FABRIC试验台上的研究
机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) ; University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校)
AI总结 利用FABRIC试验台和LLM编码助手LoomAI,通过三个跨领域案例研究,展示了AI辅助工作流将复现实验的工作量减少约4-6倍,但在分析阶段仍需人工指导。
评估意识并非单一能力:来自开放语言模型的证据
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) ; Microsoft Corp.(微软公司)
AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。
潜在个人记忆:将个人记忆表示为动态软提示
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Samsung Research America(三星美国研究院)
AI总结 提出潜在个人记忆(LPM)框架,通过可解释的潜在槽矩阵和交叉注意力网络生成动态软提示,在冻结大语言模型上高效编码用户历史,在PersonaMem v1和LoCoMO基准上优于LoRA和提示调优,并大幅降低KV缓存使用。
Comments 17 pages, 3 figures