arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

2026-05-19 至 2026-05-19 共收录 17
2605.18749 2026-05-19 cs.SD cs.CV

WavFlow: Audio Generation in Waveform Space

WavFlow:在波形空间中进行音频生成

Feiyan Zhou, Luyuan Wang, Shoufa Chen, Zhe Wang, Zhiheng Liu, Yuren Cong, Xiaohui Zhang, Fanny Yang, Belinda Zeng

机构 * Meta AI Northeastern University(东北大学)

AI总结 本文提出WavFlow框架,直接在原始波形空间生成高保真的音频,无需中间表示,通过波形分块和振幅提升实现稳定优化,通过自动化数据管道生成高质量视频-文本-音频三元组,实验结果显示在视频到音频和文本到音频基准测试中表现优异,证明了无需中间压缩即可实现高质量合成。

Comments Code: https://github.com/facebookresearch/WavFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18554 2026-05-19 cs.LG stat.ML

Federated Martingale Posterior Samping

联邦马尔可夫后验采样

Boning Zhang, Matteo Zecchin, Mingzhao Guo, Dongzhu Liu, Osvaldo Simeone

机构 * School of Computing, University of Glasgow(格拉斯哥大学计算学院) Communication Systems Department, EURECOM(EURECOM通信系统部门) Institute for Intelligent Networked Systems, Northeastern University London(伦敦东北大学智能网络系统研究所)

AI总结 本文提出联邦马尔可夫后验采样方法,通过在不共享本地数据集的情况下,利用预测分布恢复参数不确定性,从而在联邦学习中提升模型校准性能。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06933 2026-05-19 cs.LG cs.CR cs.MA

MAGIQ: A Post-Quantum Multi-Agentic AI Governance System with Provable Security

MAGIQ: 一种具有可证明安全性的多智能体AI治理系统

Sepideh Avizheh, Tushin Mallick, Alina Oprea, Cristina Nita-Rotaru, Reihaneh Safavi-Naini

机构 * University of Calgary(卡尔加里大学) Northeastern University(东北大学)

AI总结 本文提出MAGIQ,一种利用新型高效抗量子加密协议进行多智能体AI系统策略定义和执行的框架,旨在解决智能体通信和访问控制策略的安全性问题,并提供可追溯的问责机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17749 2026-05-19 cs.LG stat.ML

Testable and Actionable Calibration for Full Swap Regret

可检验且可操作的全面交换懊悔校准

Konstantina Bairaktari, Lunjia Hu, Huy L. Nguyen, Jonathan Ullman

机构 * Department of Computer Science, Aarhus University(阿arhus大学计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) Northeastern University(东北大学)

AI总结 本文提出了一种新的校准度量标准SCDL,该度量标准在不削弱任何要求的前提下,既可操作又可检验,同时具备连续性和一致性等理想特性,并通过实验验证了其在实际中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17558 2026-05-19 cs.SE cs.CL

Firefly: Illuminating Large-Scale Verified Tool-Call Data Generation from Real APIs

Firefly:从真实API生成大规模验证工具调用数据

Yuxuan Lu, Ziyi Wang, Yingzhou Lu, Yisi Sang, Jiri Gesi, Xianfeng Tang, Yimeng Zhang, Zhenwei Dai, Hui Liu, Hanqing Lu, Chen Luo, Qi He, Benoit Dumoulin, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究者)

AI总结 本文提出FireFly框架,通过反向合成方法生成具有验证标签的工具调用数据,利用强LLM探索真实API并构建工具图,以提高大规模工具空间下的训练效率和结果准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23672 2026-05-19 cs.RO cs.CV

Bio-Inspired Event-Based Visual Servoing for Ground Robots

生物启发的基于事件的视觉伺服控制用于地面机器人

Maral Mordad, Kian Behzad, Debojyoti Biswas, Noah J. Cowan, Milad Siami

机构 * Department of Electrical & Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室) Department of Mechanical Engineering, Johns Hopkins University(约翰霍普金斯大学机械工程系)

AI总结 本文提出了一种基于生物启发的1D事件视觉伺服框架,用于在结构化环境中运行的地面机器人,通过动态视觉传感器和多模式刺激直接合成非线性状态反馈项,实现了高效低延迟的控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23231 2026-05-19 cs.AI

PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments

PERMA:通过事件驱动的偏好和现实任务环境评估个性化记忆代理

Shuochen Liu, Junyi Zhu, Long Shu, Junda Lin, Yuhao Chen, Haotian Zhang, Chao Zhang, Derong Xu, Jia Li, Bo Tang, Zhiyu Li, Feiyu Xiong, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Northeastern University(东北大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

AI总结 本文提出PERMA基准,通过事件驱动的偏好和现实任务环境评估个性化记忆代理的长期一致性,引入文本变异和语言对齐以模拟真实数据中的不规则用户输入和个体语言风格,实验表明先进记忆系统能精准提取偏好并减少token消耗,但仍需更稳健的个性化记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16252 2026-05-19 cs.LG cs.CL

WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale

WEBSERV: 一个全栈且适合强化学习的网页环境,用于大规模训练网页代理

Yuxuan Lu, Ziyi Wang, Jing Huang, Hui Liu, Jiri Gesi, Yan Han, Shihan Fu, Tianqi Zheng, Xianfeng Tang, Chen Luo, Yisi Sang, Jin Lai, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon(亚马逊)

AI总结 本文提出WebServ,一个全栈且适合强化学习的网页环境,用于大规模训练网页代理。该环境在服务器端使用Incus容器减少启动延迟和存储需求,浏览器端提供自动化的观察和动作接口,以及可靠的执行后端。实验表明,WebServ在WebArena-Lite上实现了最先进的单提示结果,并在强化学习训练中超越了现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13068 2026-05-19 cs.LG cs.AI cs.HC

NeuroRVQ: Multi-Scale Biosignal Tokenization for Generative Foundation Models

NeuroRVQ:多尺度生物信号分词用于生成式基础模型

Konstantinos Barmpas, Na Lee, Dimitrios Chalatsis, William Raftery, Yannis Panagakis, Dimitrios A. Adamos, Nikolaos Laskaris, Alexandros Koliousis, Dario Farina, Stefanos Zafeiriou

机构 * Imperial College London(帝国理工学院伦敦分校) Cogitat National and Kapodistrian University of Athens(国家与资本主义大学雅典分校) Archimedes Research Unit(阿基米德研究单位) Aristotle University of Thessaloniki(亚里士多德大学塞萨洛尼基分校) Northeastern University London(东北大学伦敦分校)

AI总结 本文提出NeuroRVQ,一种多尺度生物信号分词方法,通过多尺度时序卷积分解生物信号并结合相位感知损失,实现高保真信号重建,验证了高质量分词对下游性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06388 2026-05-19 cs.LG cs.DS stat.ML

Truthful Calibration Errors for Multi-Class Prediction

多类预测中的诚实校准误差

Yuxuan Lu, Yifan Wu, Jason Hartline, Lunjia Hu

机构 * Peking University(北京大学) Northwestern University(西北大学) Microsoft Research, New England(微软研究院(新英格兰)) Northeastern University(东北大学) Khoury College of Computer Sciences(计算机科学学院)

AI总结 本文研究了多类预测中诚实校准误差的实用作用,提出了完美诚实校准误差以处理标签分布的多维线性属性,并分析了这些诚实误差在决策理论上的影响,从而解释并缓解了分箱校准误差的排名鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05606 2026-05-19 cs.CL cs.HC

OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation

OPeRA: 一个用于评估LLM在模拟人类在线购物行为上的表现的观察、人设、推理和行动数据集

Ziyi Wang, Yuxuan Lu, Wenbo Li, Amirali Amini, Bo Sun, Yakov Bart, Weimin Lyu, Jiri Gesi, Tian Wang, Jing Huang, Yu Su, Upol Ehsan, Malihe Alikhani, Toby Jia-Jun Li, Lydia Chilton, Dakuo Wang

机构 * Northeastern University(东北大学) University of Southern California(南加州大学) Stony Brook University(石溪大学) Independent Researcher(独立研究者) Ohio State University(俄亥俄州立大学) University of Notre Dame(Notre Dame 大学) Columbia University(哥伦比亚大学)

AI总结 本文提出OPeRA数据集,用于评估LLM在模拟人类在线购物行为上的能力,通过收集真实用户在在线购物会话中的观察、人设、推理和行动,建立首个评估LLM预测特定用户下一步行动和推理的基准。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17244 2026-05-19 cs.LG cs.AI

Drift Flow Matching

漂移流匹配

Chenrui Ma, Xi Xiao, Lin Zhao, Tianyang Wang, Ferdinando Fioretto, Yanning Shen

机构 * University of California, Irvine(加州大学伊万斯堡分校) University of Virginia(弗吉尼亚大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Northeastern University(东北大学)

AI总结 本文提出Drift Flow Matching框架,结合漂移生成模型与基于流的迭代生成方法,实现高效生成与多步细化,提升生成质量与效率适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16895 2026-05-19 cs.CE cs.AI cs.CL

The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence

阿尔法幻觉:LLM交易代理报告的阿尔法不应被视为部署证据

Yuxuan Ye, Jun Han, Ao Hu, Juncheng Bu, Yiyi Chen, Liangjian Wen, Danilo Mandic, Danny Dongning Sun, Xu Yinghui, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Southwest University of Finance and Economics(西南财经大学) Northeastern University(东北大学) Imperial College London(伦敦帝国理工学院) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文指出,LLM交易代理报告的阿尔法不应被当作部署的证据,因为这些阿尔法需要通过结构有效性测试来验证其时间完整性、现实摩擦、反事实稳健性、预测校准、数值执行和多代理分解等关键指标,当前的公开证据无法区分稳健的预测能力与时间污染、未建模的摩擦、短窗口夏普不确定性、叙事拟合和参数先验等因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12766 2026-05-19 cs.CL

NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation

NaviRAG:迈向检索增强生成的主动知识导航

Jihao Dai, Dingjun Wu, Yuxuan Chen, Zheni Zeng, Yukun Yan, Zhenghao Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Northeastern University(东北大学)

AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16947 2026-05-19 cs.CV cs.AI

LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs

LightZeroNav: 基于轻量级VLMs的连续环境中零样本视觉语言导航

Kun Luo, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou

机构 * Foshan Graduate School of Innovation, Northeastern University(创新研究生院,东北大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北航) QingniaoAI, China(清北AI,中国)

AI总结 本文提出LightZeroNav,通过轻量级VLMs解决连续环境中零样本视觉语言导航的三大瓶颈,无需特定训练或图搜索,在RGB观测和轻量级Qwen3-VL-8B模型下实现与GPT-4o相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16612 2026-05-19 cs.AI cond-mat.mtrl-sci

PRISMat: Policy-Driven, Permutation-Invariant Autoregressive Material Generation

PRISMat:基于策略的、排列不变的自回归材料生成

Claire Schlesinger, Circe Hsu, Peter Schindler, Robin Walters

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院) Northeastern University(东北大学) College of Engineering(工程学院)

AI总结 PRISMat通过高效生成晶体片层,提升了材料发现的准确性,其在切开能和工作函数任务中的均绝对误差显著降低。

Comments 10 pages, 8 figures, Under Review at Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16359 2026-05-19 cs.CV cs.AI

How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

多模态语言模型需要多少视觉标记?通过F^3A进行视觉标记剪枝的扩展

YiJie Huang, Yiqun Zhang, Zhuoyue Jia, Xiaocui Yang, Junzhao Huang, Zihan Wang, Shi Feng, Daling Wang, Yifei Zhang, Yongkang Liu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)

AI总结 本文提出F^3A方法,通过任务条件证据搜索优化视觉标记分配,在不训练模型的情况下实现高效的视觉标记剪枝,保留原始多模态提示和解码流程。

详情

展开后加载摘要…

URL PDF HTML 收藏