PAI-Bench: A Comprehensive Benchmark For Physical AI
PAI-Bench: 一个全面的物理AI基准
机构 * Georgia Tech(佐治亚理工学院) ; CMU(卡内基梅隆大学)
AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。
高校专区
PAI-Bench: 一个全面的物理AI基准
机构 * Georgia Tech(佐治亚理工学院) ; CMU(卡内基梅隆大学)
AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。
KV Pareto: 系统层面优化KV缓存与模型压缩以实现长上下文推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Advanced Micro Devices (AMD)(先进微器件(AMD))
AI总结 KV Pareto通过系统层面优化KV缓存与模型压缩,实现长上下文推理中的内存效率与准确率的平衡。
高维均场博弈的粒子流匹配方法
机构 * Department of Mathematics, Duke University(杜克大学数学系) ; H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程学院)
AI总结 本文提出基于粒子的深度流匹配方法,用于解决高维均场博弈问题,通过流神经网络实现无模拟的速度匹配,并在理论和实验上证明了其收敛性和有效性。
神经变量名修复:学习为可读性重命名标识符
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出神经变量名修复方法,通过微调和重排技术提升代码可读性,实验显示其在精确匹配和部分相似度评分上显著优于基线模型。
通过惊喜识别提升世界模型鲁棒性
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能
开发公平性感知的任务分解以提高脊柱融合术后并发症预测的公平性
机构 * Georgia Institute of Technology(佐治亚理工学院) ; UT Southwestern Medical Center(西南医学中心) ; Shriners Children’s Hospital(儿童烧伤医院)
AI总结 FAIR-MTL通过公平性感知的多任务学习框架,提升脊柱融合术后并发症预测的公平性和可解释性。
DLRREC: 通过深度融合多模态知识在深度推荐系统中进行潜在表示去噪
机构 * Georgia Institute of Technology(佐治亚理工学院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 DLRREC通过深度融合多模态和协同知识,提升深度推荐系统中潜在表示的去噪能力,从而实现更精确的推荐性能。
COMPASS:基于上下文调节的PID注意力转向系统用于减少幻觉
机构 * Algoverse ; Georgia Institute of Technology(佐治亚理工学院) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 COMPASS通过上下文调节PID注意力转向系统减少大型语言模型的幻觉,通过可解释的反馈回路提升生成的准确性与可解释性。
Comments 9 pages, 6 figures including algorithmns, 2 tables
通过在线学习的自适应四肢运动控制
机构 * Department of Aerospace Engineering, University of Michigan(密歇根大学航空航天工程系) ; Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(佐治亚理工学院机器人与智能机器研究所)
AI总结 该研究提出了一种通过在线学习和模型预测控制实现自适应四肢运动的算法,能够处理未知负载和不规则地形下的复杂任务。
Comments IEEE Robotics and Automation Letters
可微优化用于深度学习增强的交流最优功率流近似
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出基于深度学习的可微优化框架,用于增强直流最优功率流近似,以更准确地模拟交流最优功率流行为。
多模态大语言模型在视觉-语言任务中的综合综述与指南
机构 * JTB Technology Corp.(JTB技术公司) ; Stockton University(斯托顿大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; AppCubic USA(AppCubic美国公司) ; Nomad Sustaintech LTD(Nomad可持续科技有限公司) ; Georgia Institute of Technology(佐治亚理工学院) ; Emory University(埃默里大学) ; University of Liverpool(利物浦大学) ; Indiana University(印第安纳大学) ; Purdue University(普渡大学)
AI总结 本文综述了多模态大语言模型在视觉-语言任务中的应用,探讨了其架构、训练方法及挑战,并提供了理论与实践的全面指南。
基于被动专家经验的个性化是否足够?一项在AI辅助考试中的案例研究
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Adobe(Adobe公司)
AI总结 本文研究了基于被动专家经验的个性化在AI辅助考试中的效果,发现其能降低任务负荷但存在局限,需结合主动个性化以提升用户体验。
Comments Accepted into Tailoring AI: Exploring Active and Passive LLM Personalization (PALS) workshop at EMNLP 2025
FastFHE: 基于FHE的可扩展打包和深度可分离CNN推理
机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) ; UCAS(中国科学院大学) ; Fordham University(福特汉姆大学) ; Dalian University of Technology(大连理工大学) ; Beihang University(北京航空航天大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 FastFHE通过可扩展加密打包、深度可分离卷积、BN点积融合和Legendre多项式近似,提升FHE下CNN推理效率与精度。
迈向可扩散的高维潜在空间:从频率视角出发
机构 * Meta AI ; Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出FreqWarm方法,通过增加高频潜在信号的早期曝光,提升高维潜在空间的可扩散性,有效改善生成质量。
Comments 11 pages, 7 figures, 4 tables
利用外源信号进行水文时间序列预测
机构 * College of Computing(计算学院) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Virginia(弗吉尼亚大学) ; School of Data Science(数据科学学院) ; Computer Science(计算机科学) ; Biocomplexity Institute(生物复杂性研究所)
AI总结 本文提出利用外源信号提升水文时间序列预测性能,通过整合全面的外源输入,显著提高降雨-径流建模效果。
备忘录:通过强化学习训练内存高效的具身智能体
机构 * University of Oxford(牛津大学) ; Georgia Tech University(佐治亚理工学院) ; Toyota Motor Europe(丰田欧洲公司)
AI总结 Memo通过在训练过程中交错周期性总结标记与输入,实现内存高效的具身智能体强化学习训练,优于长上下文基线并更高效。
Comments Accepted for Spotlight Presentation at NeurIPS 2025
离散扩散模型的快速求解器:高阶算法的理论与应用
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。
Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)
基于贝叶斯关系事件建模的信任保留人机协同自主性
机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(电子与计算机工程学院,佐治亚理工学院) ; Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学)
AI总结 本文提出基于贝叶斯关系事件建模的信任保留协同自主策略,通过动态推断人类信任提升人机协作效率与用户接受度。
Journal ref in IEEE Robotics and Automation Letters, vol. 9, no. 11, pp. 10716-10723, Nov. 2024
通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量
机构 * Adobe(Adobe公司) ; Georgia Tech(佐治亚理工学院)
AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。
超越现实:利用StickerNet学习表现性创作
机构 * Picsart AI Research(Picsart人工智能研究) ; Picsart Inc(Picsart公司) ; College of Computing(计算学院) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。
动量多边际施罗德桥匹配
机构 * Georgia Institute of Technology(佐治亚理工学院) ; FAIR at Meta(Meta 的 FAIR)
AI总结 3MSBM通过学习满足多位置约束的随机系统光滑测度值样条,改进了多边际设置中匹配框架的收敛性和可扩展性。
扩散去噪超光谱高斯点云
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出DD-HGS方法,通过引入波长敏感的球谐函数、光谱损失和扩散去噪器,实现超光谱场景的3D显式重建,提升3D高斯点云方法的性能。
Comments Accepted to 3DV 2026
Web-Shepherd: 促进强化网络代理的PRMs
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。
Comments NeurIPS 2025 Spotlight
OuroMamba:一种无需数据的视觉Mamba量化框架
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Intel Labs(英特尔实验室)
AI总结 OuroMamba提出一种无需数据的视觉Mamba量化方法,通过生成语义丰富的合成数据和混合精度量化技术,实现高效的模型压缩与性能提升。
Comments Accepted to ICCV 2025
从文本到多模态:探索大型语言模型在医疗实践中的演变与影响
机构 * Kyoto University(京都大学) ; Georgia Institute of Technology(佐治亚理工学院) ; National Taiwan Normal University(台湾师范大学) ; Indiana University(印第安纳大学) ; Hong Kong University of Science(香港科学大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Cornell University(康奈尔大学) ; University of Liverpool(利物浦大学) ; University of Edinburgh(爱丁堡大学) ; Zhejiang University(浙江大学) ; Purdue University(Purdue 大学) ; Emory University, Atlanta, GA, USA(埃默里大学) ; West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)
AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。
Comments 12 pages, 1 figure
没有被遗漏的请求:通过Medha解决长上下文LLM推理中的异质性
机构 * Microsoft(微软公司) ; Georgia Institute of Technology(佐治亚理工学院) ; UC San Diego(圣地亚哥大学)
AI总结 Medha 通过引入细粒度抢占式调度和新型并行策略,有效解决长上下文LLM推理中的异质性问题,显著提升系统吞吐量和响应效率。
大语言模型与认知科学:对相似性、差异性和挑战的全面综述
机构 * Kyoto University(京都大学) ; Indiana University(印第安纳大学) ; National Taiwan Normal University(台湾师范大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Hong Kong University of Science(香港科学大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Cornell University(康奈尔大学) ; University of Liverpool, UK(利物浦大学) ; University of Edinburgh, UK(爱丁堡大学) ; Zhejiang University(浙江大学) ; Purdue University(普渡大学) ; Emory University(埃默里大学) ; West China Biomedical Big Data Center, West China Hospital, Sichuan University(四川大学西昌生物大数据中心、西昌医院)
AI总结 本文综述了大语言模型与认知科学的相似性、差异性和挑战,探讨了LLMs在认知领域的应用及改进方法。
Comments 10 pages, 1 figure
MFM-point: 多尺度流匹配用于点云生成
机构 * Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA(英伟达)
AI总结 MFM-Point通过多尺度流匹配框架提升点云生成的可扩展性和性能,同时保持简洁高效,实现多类别和高分辨率生成任务中的优异表现。
在视觉语言模型中实现工具集成推理的规模化代理强化学习
机构 * Virginia Tech(弗吉尼亚理工大学) ; Emory University(埃默里大学) ; KAUST(阿联酋卡塔尔大学) ; Georgia Tech(佐治亚理工学院) ; Cisco(思科系统) ; TAMU(德克萨斯大学奥斯汀分校) ; UT Southwestern Medical Center(德克萨斯西南医学中心) ; Eigen AI
AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。
Comments 17 pages, 9 figures, work in progress
什么是理解语言意味着?
机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute) ; Harvard University(哈佛大学) ; School of Psychology(心理学学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Massachusetts Institute of Technology(麻省理工学院) ; Department of Brain and Cognitive Sciences(脑科学与认知科学系)
AI总结 本文探讨了理解语言的认知和神经机制,提出通过将信息导出至其他大脑区域来构建心理模型,以深入理解语言。