arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

共收录 39
2608.11460 2026-08-13 cs.CL 新提交

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08389 2026-08-11 cs.AI cs.IR cs.MA 新提交

Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

不值得再增加一个Token:面向高效深度研究智能体的边际价值估计

Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(奥多比研究院)

AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01495 2026-08-04 cs.CV 新提交

Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers

探究预训练检测Transformer的三维物体级理解能力

Robin Kim, Colin Samplawski, Benjamin M. Marlin

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) SRI International(SRI国际公司)

AI总结 本文探究预训练二维检测Transformer对物体三维属性的理解,发现无三维监督预训练的二维DETR模型,能通过线性和非线性探针从物体级嵌入中恢复物体深度、三维位置等三维属性信息,具备强的三维物体级理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21839 2026-07-27 cs.CR cs.LG 新提交

Certified in Theory, Broken in Practice: Assumption Gaps in Cryptographic Model Certification

理论上可认证,实践中却被破解:密码学模型认证中的假设差距

Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova, Akira Takahashi, Antigoni Polychroniadou, Nicolas Papernot

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Vector Institute & University of Toronto(向量研究所及多伦多大学) Carnegie Mellon University(卡内基梅隆大学) J.P.Morgan AI Research & AlgoCRYPT CoE(摩根大通人工智能研究及AlgoCRYPT中心) University of Toronto(多伦多大学)

AI总结 研究密码学模型认证中现有安全定义与实际应用的差距,通过精心设计训练数据可攻击相关认证方案。为此形式化严格安全概念,引入通用协议模板,为设计安全隐私保护的机器学习审计协议提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18603 2026-07-22 cs.IR cs.AI cs.CL 新提交

AutoIndex: Learning Representation Programs for Retrieval

AutoIndex:学习用于检索的表示程序

Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy, Hanna Jiang, Shreyas Chaudhari, Andrew Drozdov

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Databricks Mosaic Research(Databricks Mosaic研究)

AI总结 AutoIndex框架通过搜索对文档进行多种操作的程序来优化文档表示,在CRUMB基准上评估,相比BM25基线显著提升召回率,证明文档表示应作为优化目标,而非固定预处理选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18570 2026-07-22 cs.CL cs.AI 新提交

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

出于什么原因?解释模型对因果关系和对立关系的编码

Abhidip Bhattacharyya, Shira Wein

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of South Florida(南佛罗里达大学)

AI总结 研究指令微调的Transformer模型对英语话语关系的编码,聚焦因果和对立关系。通过下一个token预测任务及可解释性技术,发现早期层在序列中间做预测,中层接近末尾确定决策,部分层有答案偏好,揭示话语推理的不对称表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17581 2026-07-21 cs.CV 新提交

Scalable Model-Assisted Multi-Target Estimation in Large Image Collections

大型图像集中可扩展的模型辅助多目标估计

Max Hamilton, Jinlin Lai, Daniel Sheldon, Subhransu Maji

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 研究大型图像集多目标估计问题,借鉴调查抽样策略,在五个检测和分割数据集上评估,发现重要性采样、带控制变量的均匀采样及基于子集的比率估计器各有优势,有效结合模型预测与人类标签进行科学测量。

Comments Accepted at the 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15562 2026-07-20 cs.LG cs.AI 新提交

Hard Rules, Soft Preferences: Bridging Reasoning, Learning, and Optimization for Personalized Packing Checklist Generation

硬规则,软偏好:为个性化行李清单生成搭建推理、学习和优化的桥梁

Himel Dev, Madhusudan Basak, Tanmoy Sen, Paromita Shome, Bashima Islam

机构 * Tech LLC(529科技有限责任公司) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Virginia(弗吉尼亚大学)

AI总结 针对航空旅行打包易出错问题,提出含符号引擎、偏好学习器和CP - SAT优化器的推理引导学习框架,能生成个性化、合规行李清单,在实验中表现良好,在应用中提升了清单完成量并减少了时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15552 2026-07-20 cs.LG cs.AI 新提交

From Feasibility to Desirability: Plan, Learn, Adapt (PLA) Framework for Personalized On-Device Itinerary Generation

从可行性到合意性:用于个性化设备端行程生成的计划、学习、适应(PLA)框架

Himel Dev, Tanmoy Sen, Madhusudan Basak, Bashima Islam

机构 * Tech LLC(529科技有限责任公司) University of Virginia(弗吉尼亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 研究针对个性化设备端行程生成问题,提出PLA框架,分计划、学习、适应三阶段,通过构建规划器集合、拟合奖励模型及进行局部优化来生成行程,实验表明该框架在可行性和胜率上表现出色,还提升了生产部署中的行程完成率并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14576 2026-07-17 cs.LG stat.ML 新提交

Sharp Stability Threshold and Certification for Designing Stable Residual Architectures

深度残差架构的尖锐稳定性阈值与认证

Hyemin Gu, Michael Tyrrell, Tuhin Sahai, Markos A. Katsoulakis

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) SRI International(SRI国际公司)

AI总结 该研究为深度残差架构提出次线性增长原理,通过经典ODE理论和最优控制分析确定\(q \leq 1\)为稳定训练充要条件,阐明架构布局与稳定关系,构建函数空间并给出认证算法,实验证实相关变体训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14539 2026-07-17 cs.RO 新提交

Communication-Efficient Relative Pose Estimation with Vision Foundation Models for Ephemeral Collaborative Perception

用于短暂协作感知的基于视觉基础模型的通信高效相对位姿估计

Qihang Li, Jo-Hao Huang, Jiewen Liu, Suyoung Kang, Hao Zhang, Peng Gao

机构 * North Carolina State University(北卡罗来纳州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 针对现实中机器人短交互窗口及有限通信带宽下的相对位姿估计难题,提出通信高效相对位姿估计框架CERPE,利用固定大小描述符减少原始观测交换,通过自身运动传播相对位姿,提升了短暂协作感知中的6自由度相对位姿估计。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15107 2026-07-17 cs.LG math.CT 新提交

Learning in Infinitesimal Non-Compositional Sketches

在无穷小非组合草图中学习

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

AI总结 研究如何通过LINCS框架修复机器学习中非组合性问题,将问题指定为草图,利用切提升和INC自函子,把机器学习表述为寻找余代数不动点,证明特定条件下最终INC余代数存在,正进行多场景实验评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13546 2026-07-16 cs.LG 新提交

From Novice to Expert: Cost-Aware Bandits for Evolving Worker Performance in Crowdsensing

从新手到专家:众包感知中用于提升工人绩效的成本感知策略

Yin Huang, Qingsong Liu, Jie Xu

机构 * University of Florida(佛罗里达大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 研究众包感知中预算受限的在线工人招募问题,工人绩效随经验变化,成本未知。提出成本感知在线学习框架,建模为结构化策略模型,能联合学习奖励轨迹与成本,检测性能饱和,分配预算最大化感知效用,实验验证优于基线方法。

Comments 14 pages, 10 figures, 3 tables, submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13433 2026-07-16 cs.CL cs.CY 新提交

When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

当评分标准改变时:批判性思维作文评分的跨评分标准泛化

Nischal Ashok Kumar, Payu Wittawatolarn, Sana Kang, Marisa C. Peczuh, Blair Lehman, Ryan Baker, Caitlin Mills, Sherry Lachman, Ruochen Sun, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Minnesota(明尼苏达大学) Brighter Research(更光明研究公司) Adelaide University(阿德莱德大学)

AI总结 研究跨评分标准泛化问题,采用含评分标准无关中间表示和目标作文监督的大语言模型微调框架,在增强数据集上实验,结果表明基于特征的中间结构和受控监督可提升对未见过评分标准的泛化能力。

Comments Published in AI for Education Day at SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10535 2026-07-14 cs.CV 新提交

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

通过聚类截断提高自回归文本到图像生成中的样本多样性

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Thoughtworks(Thoughtworks公司)

AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10463 2026-07-14 cs.AI cs.IR 新提交

GRASP: GRanularity-Aware Search Policy for Agentic RAG

GRASP:用于智能检索增强生成的粒度感知搜索策略

Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe 研究院)

AI总结 研究智能体检索增强生成中模型决策难题,提出GRASP强化学习框架,训练智能体协调互补检索工具,实验表明其提升检索召回率和问答性能,还展现出可解释行为,凸显协调检索信号和上下文粒度对智能体推理的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11493 2026-07-14 cs.LG cs.AI math.CT 新提交

Agentic Skill Optimization over Lie Algebroids

李代数胚上的智能体技能优化

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

AI总结 研究智能体技能优化问题,提出LASKO框架,将技能建模为李代数胚截面,利用李括号筛选测试替代昂贵验证,在自然语言任务因果提取中实现近15倍加速,提升技能优化速度。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06875 2026-07-09 cs.CV cs.LG 新提交

Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild

Video2Reaction:将视频映射到自然环境中的观众反应分布

Trang Nguyen, Sidong Zhang, Shiv Shankar, Gauri Jagatap, Deepak Chandran, Andrea Fanelli, Madalina Fiterau

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02781 2026-07-07 cs.LG cs.AI cs.CL 新提交

Safe Inference-Time Alignment via Lagrangian Reward Augmentation

通过拉格朗日奖励增强实现安全推理时对齐

Yaswanth Chittepu, Ativ Joshi, Sohini Chintala, Scott Niekum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Independent Researcher(独立研究者)

AI总结 研究提出拉格朗日奖励增强框架,从含奖励与成本模型的约束目标出发,经对偶化将问题转化为一维凸问题,校准对偶变量获增强奖励,提升推理时对齐的有益性与无害性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02668 2026-07-07 cs.CL 新提交

Improving LLMs via Validator-to-Generator Alignment

通过验证器与生成器对齐改进大语言模型

Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Departments of Linguistics and Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学与计算机科学系) Department of Computer Science & Center for Data Science, New York University(纽约大学计算机科学系及数据科学中心)

AI总结 研究大语言模型不一致问题,提出基于话语频率的生成器-验证器一致性新公式,介绍\FCPA方法,实验表明该方法能提升生成器性能及两者一致性,且保持验证器质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01510 2026-07-03 cs.AI cs.CR 新提交

Janus: a Playground for User-Involved Agentic Permission Management

Janus:用户参与的智能体权限管理实验平台

Natalie Grace Brigham, Eugene Bagdasarian, Tadayoshi Kohno, Franziska Roesner

机构 * University of Washington(华盛顿大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgetown University(乔治城大学)

AI总结 提出Janus系统,通过模块化框架和自动化评估工具,研究用户参与AI智能体权限管理的设计空间,发现用户输入可增强隐私安全,AI辅助可降低认知负担,但需考虑权限疲劳等现实行为。

Comments Code and data released on GitHub: https://github.com/GraceBrigham/Janus

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31154 2026-07-01 cs.LG cs.AI 新提交

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) UMass Amherst(马萨诸塞大学阿默斯特分校) Google(谷歌) Snowflake

AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28182 2026-06-29 cs.LG cs.AI cs.CV cs.RO 新提交

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

LLawCo: 学习合作法则以建模具身多智能体行为

Qinhong Zhou, Chuang Gan, Anoop Cherian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27593 2026-06-29 cs.AI cs.LG 新提交

Odyssey: Constructing Verifiable Local Truth-Preserving Foundation Models

Odyssey: 构建可验证的局部保真基础模型

Sridhar Mahadevan

机构 * Adobe Research(Adobe 研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

AI总结 提出一种名为ODYSSEY的范畴论框架,通过组合“foundries”构建可验证的局部保真基础模型,并引入Universal Foundry Learning和Foundry SQL实现形式化构造与查询。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27510 2026-06-29 cs.LG cs.CL 新提交

The Curse of Multiple Mediators: Hidden Interaction Effects in Activation Patching

多重中介者的诅咒:激活补丁中的隐藏交互效应

Sankaran Vaidyanathan, David Arbour, Aaron Mueller, Scott Niekum, David Jensen

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究院) Boston University(波士顿大学)

AI总结 本文从因果中介分析重新推导激活补丁估计量,发现自然间接效应包含交互效应,导致组件因果重要性评估偏差,并提出交互效应作为可解释性诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25836 2026-06-29 cs.AI 新提交

AI Snitches Get Glitches: Towards Evading Agentic Surveillance

AI告密者出故障:走向规避智能体监控

Hyejun Jeong, Dzung Pham, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。

Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25879 2026-06-25 cs.DC cs.AI 新提交

AI-Assisted Computational Reproducibility on the FABRIC Testbed

AI辅助计算可复现性在FABRIC试验台上的研究

Komal Thareja, Paul Ruth, Berent Aldikacti, Michael Zink

机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校)

AI总结 利用FABRIC试验台和LLM编码助手LoomAI,通过三个跨领域案例研究,展示了AI辅助工作流将复现实验的工作量减少约4-6倍,但在分析阶段仍需人工指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23583 2026-06-23 cs.CL 新提交

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

评估意识并非单一能力:来自开放语言模型的证据

Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal, Shivani Anilkumar, Sankaran Vaidyanathan, David A. Nader Palacio, Reshmi Ghosh, Soundararajan Srinivasan

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corp.(微软公司)

AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20911 2026-06-23 cs.CL cs.AI 新提交

Latent Personal Memory: Represent personal memory as dynamic soft prompts

潜在个人记忆:将个人记忆表示为动态软提示

Debrup Das, Avinash Amballa, Yashas Malur Saidutta, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Samsung Research America(三星美国研究院)

AI总结 提出潜在个人记忆(LPM)框架,通过可解释的潜在槽矩阵和交叉注意力网络生成动态软提示,在冻结大语言模型上高效编码用户历史,在PersonaMem v1和LoCoMO基准上优于LoRA和提示调优,并大幅降低KV缓存使用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏