arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2605.12788 2026-05-14 cs.LG cs.CY

From Heuristics to Analytics: Forecasting Effort and Progress in Online Learning

从启发式到分析:在线学习中的努力和进度预测

Eric S. Qiu, Danielle R. Thomas, Boyuan Guo, Vincent Aleven, Conrad Borchers

机构 * Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过ITS日志数据,利用监督学习方法预测学生每周练习时间和掌握新技能情况,展示基于特征的模型在降低MAE方面优于启发式基线,同时分析了预测特征的重要性,为 tutor-learner 目标设定提供支持。

Comments Accepted as full paper to the 19th International Conference on Educational Data Mining (EDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12745 2026-05-14 cs.HC cs.AI

What Do You Think I Think? Accounting for Human Beliefs Using Second-Order Theory of Mind

我思考什么?利用二级理论 of mind 账户人类信念

Patrick Callaghan, Reid Simmons, Henny Admoni

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出一种二级理论 of mind 框架,使智能体能检测并反馈人类错误信念及认知偏差,从而提升交互信息量。

Comments To appear in the proceedings of The 2026 Cognitive Science Society Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12733 2026-05-14 cs.LG cs.AI stat.ML

From Generalist to Specialist Representation

从通用到专业表征

Yujia Zheng, Fan Feng, Yuke Li, Shaoan Xie, Kevin Murphy, Kun Zhang

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学香槟分校) UCSD(加州大学圣地亚哥分校) MBZUAI(穆斯林人工智能研究所) UMD(马里兰大学) UBC(不列颠哥伦比亚大学)

AI总结 研究在非参数设置下如何通过非监督方式识别时间步间任务结构,并利用稀疏正则化分离任务相关潜在表征,为从通用到专业模型的理论保障提供新思路。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12684 2026-05-14 cs.CV cs.AI cs.HC

Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?

视觉审美基准:前沿模型能评判美吗?

Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue Huang, Hang Hua, Zhengqing Yuan, Kaiyuan Zheng, Luyao Niu, Bhaskar Ramasubramanian, Basel Alomair, Xiangliang Zhang, Misha Sra, Zichen Chen, Radha Poovendran, Zhangchen Xu

机构 * Bake AI University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Stanford University(斯坦福大学) University of Notre Dame(诺丁汉大学) Carnegie Mellon University(卡内基梅隆大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Western Washington University(西雅图华盛顿大学) King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城)

AI总结 本文提出视觉审美基准(VAB),通过比较选择评估审美,发现前沿模型在判断最佳和最差图像时表现逊于人类专家,表明需进一步改进。

Comments Project page: https://vab.bakelab.ai. Code: https://github.com/BakeLab/Visual-Aesthetic-Benchmark. Dataset: https://huggingface.co/datasets/BakeLab/Visual-Aesthetic-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10906 2026-05-14 cs.LG cs.AI

DataMaster: Data-Centric Autonomous AI Research

DataMaster: 以数据为中心的自主AI研究

Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 DataMaster通过自主数据工程优化数据侧,提升下游性能,无需改变学习算法。其包含数据树、共享数据池和全局记忆三大组件,有效解决开放搜索空间和延迟验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22474 2026-05-14 cs.RO cs.LG

When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering

何时行动、提问或学习:不确定性感知的策略引导

Jessie Yuan, Yilin Wu, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出不确定性感知策略引导框架,通过联合推理任务语义不确定性和低层动作可行性,选择执行高置信度动作、通过自然语言查询澄清任务歧义或请求动作干预修正低层策略,提升机器人部署性能。

Comments To appear in Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11202 2026-05-14 cs.LO cs.AI

interwhen: A Generalizable Framework for Steering Reasoning Models with Test-time Verification

interwhen:一种可泛化的引导推理模型进行测试时验证的框架

Vishak K Bhat, Prateek Chanda, Vijval Ekbote, Ashmit Khandelwal, Maitreyi Swaroop, Vineeth N. Balasubramanian, Subbarao Kambhampati, Nagarajan Natarajan, Amit Sharma

机构 * Microsoft Research(微软研究院) IIT Bombay(印度理工学院班加罗尔分校) Carnegie Mellon University(卡内基梅隆大学) Arizona State University(亚利桑那州立大学)

AI总结 interwhen提出一种单轨迹验证框架,通过反馈中间推理轨迹引导模型行为,解决验证状态获取和 verifier 缺乏的问题,提升推理代理的任务完成和政策合规性。

Comments 56 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22792 2026-05-14 eess.AS cs.CL cs.SD

CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR

CALM:多说话人ASR的联合上下文语音-语言建模

Muhammad Shakeel, Yosuke Fukumoto, Chikara Maeda, Chyi-Jiunn Lin, Shinji Watanabe

机构 * Honda Research Institute Japan Co., Ltd.(本田研究院日本株式会社) Carnegie Mellon University(卡内基梅隆大学)

AI总结 CALM通过端到端框架整合目标说话人条件和上下文偏差,降低多说话人语音识别的词错误率和字符错误率,验证了跨语言的联合语音-语言建模有效性。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20474 2026-05-14 eess.AS cs.CL cs.SD

Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder

统一语音识别、分离和ASR的多说话人编码器

Muhammad Shakeel, Yui Sudo, Yifan Peng, Chyi-Jiunn Lin, Shinji Watanabe

机构 * Honda Research Institute Japan, Japan(本田研究院日本) Carnegie Mellon University, USA(卡内基梅隆大学)

AI总结 本文提出统一多说话人编码器(UME),通过共享语音基础编码器联合学习说话人识别、语音分离和多说话人ASR任务的表示,提升重叠语音数据性能。

Comments Accepted to IEEE ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11556 2026-05-14 cs.CL cs.AI cs.MA

Systematic Failures in Collective Reasoning under Distributed Information in Multi-Agent LLMs

多智能体大语言模型中分布式信息下的集体推理系统性失效

Yuxuan Li, Aoi Naito, Hirokazu Shirado

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学学院,卡内基梅隆大学,匹兹堡,美国) School of Environment and Society, Institute of Science Tokyo, Tokyo, Japan(环境与社会学院,东京科学研究所,东京,日本)

AI总结 研究发现多智能体大语言模型在分布式信息下仅能获得30.1%的准确率,而单智能体在完整信息下可达80.7%。系统性失效源于智能体无法识别和应对潜在的信息不对称,导致关键分布式事实未被探索。通过轻量级结构化通信协议可显著提升集体推理能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12491 2026-05-13 cs.CV cs.LG

Elastic Attention Cores for Scalable Vision Transformers

弹性注意力核心用于可扩展的视觉变换器

Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Hong Kong(香港大学) Columbia University(哥伦比亚大学)

AI总结 本文提出VECA架构,通过弹性核心-外围注意力机制实现线性复杂度,避免二次缩放,提升高分辨率视觉任务性能。

Comments Project repository here: https://github.com/alansong1322/VECA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11928 2026-05-13 cs.AI

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02406 2026-05-13 stat.ML cs.LG

Provably Data-driven Multiple Hyper-parameter Tuning with Structured Loss Function

可证明的数据驱动多超参数调优与结构化损失函数

Tung Quoc Le, Anh Tuan Nguyen, Viet Anh Nguyen

机构 * Université Grenoble Alpes, LJK, CNRS, Grenoble INP(格拉诺布尔大学,LJK,CNRS,格拉诺布尔INP) Carnegie Mellon University, Machine Learning Department(卡内基梅隆大学,机器学习系) Chinese University of Hong Kong, Department of Systems Engineering and Engineering Management(香港中文大学,系统工程与工程管理系)

AI总结 本文提出首个通用框架,为数据驱动环境下多维超参数调优提供泛化保证,结合实代数几何工具,改进了半代数函数类的泛化保证,并扩展至验证损失下的超参数调优,推导出更优的界。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00297 2026-05-13 cs.LG

From Observations to States: Latent Time Series Forecasting

从观测到状态:潜在时间序列预测

Jie Yang, Yifan Hu, Yuante Li, Kexin Zhang, Kaize Ding, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学)

AI总结 本文提出LatentTSF方法,通过将时间序列预测从观测回归转向潜在状态预测,解决潜在混沌问题,提升预测准确性和表示质量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13898 2026-05-13 cs.HC cs.AI

Social Human Robot Embodied Conversation (SHREC) Dataset: Benchmarking Foundational Models' Social Reasoning

社交人机具身对话(SHREC)数据集:评估基础模型的社会推理能力

Dong Won Lee, Yubin Kim, Denison Guvenoz, Sooyeon Jeong, Parker Malachowsky, Louis-Philippe Morency, Cynthia Breazeal, Hae Won Park

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出SHREC数据集,包含400个真实人机交互视频和10000多个标注,用于评估基础模型在社会推理中的能力,揭示社会机器人在情绪理解、意图跟踪等方面的社会挑战。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12326 2026-05-13 cs.CL cs.AI cs.LG

Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis

利用大语言模型从临床病例报告中重建脓毒症轨迹:脓毒症的文本时间序列语料库

Shahriar Noroozizadeh, Jeremy C. Weiss

机构 * Machine Learning Department and Heinz College Carnegie Mellon University(卡内基梅隆大学机器学习系和海恩兹学院) National Library of Medicine National Institutes of Health(美国国家医学图书馆)

AI总结 本文提出利用大语言模型构建脓毒症文本时间序列语料库,通过提取病例报告中的时间局部发现,验证了LLM在时间局部化方面的有效性,并指出多模态整合的改进方向。

Comments Conference on Health, Inference, and Learning (CHIL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13050 2026-05-13 cs.LG cs.AI cs.CL cs.CV cs.SD eess.AS

Modality-Inconsistent Continual Learning of Multimodal Large Language Models

多模态大语言模型的模态不一致持续学习

Weiguo Pian, Shijian Deng, Shentong Mo, Mingrui Liu, Yunhui Guo, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Carnegie Mellon University(卡内基梅隆大学) George Mason University(乔治·梅森大学)

AI总结 本文提出MICL,一种针对多模态大语言模型的持续学习场景,涉及不一致的模态和变化的任务类型。通过伪目标生成模块和基于指令的知识蒸馏,解决任务类型转移导致的遗忘问题,实验验证了方法的有效性。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11746 2026-05-13 cs.AI

When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

当推理痕迹成为行为性:基于步骤级的证据显示链式思维是不完美的疏忽通道

Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

AI总结 研究通过步骤级检测-分类-比较框架,发现链式思维痕迹与计算过程不一致,揭示其作为答案形成报告的不可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11564 2026-05-13 cs.RO

RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning

RIO:灵活的实时机器人输入输出用于跨躯体机器人学习

Pablo Ortega-Kral, Eliot Xing, Arthur Bucker, Vernon Luk, Junseo Kim, Owen Kwon, Angchen Xie, Nikhil Sobanbabu, Yifu Yuan, Megan Lee, Deepam Ameria, Bhaswanth Ayapilla, Jaycie Bussell, Guanya Shi, Jonathan Francis, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学) TU Delft(代尔夫特理工大学) Lavoro AI Bosch Center for AI(博世人工智能中心)

AI总结 RIO框架提供灵活的机器人控制和部署组件,支持多种硬件平台和形态,通过开放源代码加速真实机器人学习。

Comments 14 pages, 12 figures, 5 tables. Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11501 2026-05-13 cs.SE cs.AI cs.CR

Decaf: Improving Neural Decompilation with Automatic Feedback and Search

Decaf:通过自动反馈和搜索改进神经反编译

Alexander Shypula, Osbert Bastani, Edward Schwartz

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Decaf通过自动反馈和搜索显著提升神经反编译的语义正确性,将反编译率从26.0%提升至83.9%。

Comments 15 pages, 6 figures. Preprint; under review. Code and models available at https://github.com/AlexShypula/decaf

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11477 2026-05-13 cs.CV

LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

LDDR:基于线性DPP的动态分辨率帧采样用于视频MLLMs

Jingfeng Chen, Jiawen Qian, Wendi Deng, Yinuo Guo, Jiaqi Yu, Sicong Leng, Raghuveer Thirukovalluru, Bhuwan Dhingra

机构 * Carnegie Mellon University(卡内基梅隆大学) Individual Researcher(个人研究员) National University Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Duke University(杜克大学)

AI总结 本文提出LDDR框架,通过任务条件特征空间中查询感知的DPP帧选择,在有限视觉token预算下提升视频理解,实现3倍速度提升,并通过组DPP重要性度量动态分配分辨率,优于现有基线方法。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11330 2026-05-13 cs.AI

Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights

重新思考LLM幻觉检测的评估:一种需求清单,一个新的基于RAG的基准,新的见解

Wenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种基于RAG的新型基准T RIVIA+,填补了现有基准在长上下文和噪声标签方面的空白,并通过实验揭示了当前检测器在RAG基准上的改进空间。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11209 2026-05-13 cs.LG

Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks

测量五九可靠性:在饱和基准上的样本高效LLM评估

Eungyeup Kim, Chenchen Gu, Vashisth Tiwari, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出通过交叉熵方法学习失败倾向输入分布,显著减少LLM评估所需推理次数,揭示模型在标准基准上表现相近但可靠性差异显著的问题。

Comments Project page: https://five-nines-reliability.notion.site/Measuring-Five-Nines-Reliability-Sample-Efficient-LLM-Evaluation-in-Saturated-Benchmarks-312b998d4f39802d88c0e9886db1b9cd

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11119 2026-05-13 cs.RO

ASIP-Planner: Adaptive Planning for UAV Surface Inspection in Partially Known Indoor Environments

ASIP-Planner: 面向部分已知室内结构的自适应规划

Hanyu Jin, Zhefan Xu, Haoyu Shen, Xinming Han, Kanlong Ye, Kenji Shimada

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

AI总结 本文提出ASIP-Planner框架,通过全局覆盖规划与局部视角调整模块,提升无人机在部分已知室内环境中的表面检测效率与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10974 2026-05-13 cs.LG cs.AI

Vertex-Softmax: Tight Transformer Verification via Exact Softmax Optimization

顶点softmax:通过精确softmax优化实现严格的transformer验证

Navid Rezazadeh, Arash Gholami Davoodi

机构 * University of California, Irvine(加州大学尔湾分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出顶点softmax方法,通过精确优化softmax函数,实现transformer注意力的严格验证,提升了认证率并收紧了下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12923 2026-05-13 cs.CV

Pi-HOC: Pairwise 3D Human-Object Contact Estimation

Pi-HOC:成对3D人体-物体接触估计

Sravan Chittupalli, Ayush Jain, Dong Huang

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) National Robotics Engineering Center(国家机器人工程中心)

AI总结 本文提出Pi-HOC,一种单次传递的实例感知框架,用于密集预测所有人体-物体对的3D语义接触。该方法通过实例检测、创建专用的人-物体令牌并利用交互形式进行细化,结合基于SAM的解码器预测接触,提升了准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02549 2026-05-13 cs.CV cs.CL

DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding

DemaFormer: 带能量建模的阻尼指数移动平均变换器用于时序语言定位

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出DemaFormer,通过阻尼指数移动平均机制改进时序语言定位任务中的注意力机制,有效分离目标视频片段与其余片段。

Comments Accepted at EMNLP 2023 (Findings). Code is available at https://github.com/nguyentthong/demaformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12678 2026-05-13 cs.CL

Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction

基于列表式上下文模型的梯度提升决策树在多模态评论有用性预测中的应用

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Anh Tuan Luu, Cong-Duy Nguyen, Zhen Hai, Lidong Bing

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) DAMO Academy(达摩院)

AI总结 本文提出列表式注意力网络和梯度提升决策树,用于多模态评论有用性预测,以提升模型泛化能力与排名准确性。

Comments Published in ACL 2023 (Findings). Code is available at https://github.com/nguyentthong/gbdt_listwise_mrhp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08617 2026-05-12 cs.LG

ERIS: Enhancing Privacy and Scalability in Federated Learning via Federated Shard Aggregation

ERIS:通过联邦分片聚合增强联邦学习的隐私性和可扩展性

Dario Fenoglio, Pasquale Polverino, Jacopo Quizi, Martin Gjoreski, Akash Dhasade, Marc Langheinrich

机构 * Università della Svizzera italiana(瑞士意大利大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ERIS通过联邦分片聚合机制解决联邦学习中的隐私、可扩展性和模型效用之间的平衡问题,减少通信瓶颈并提升对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏