arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Georgia Institute of Technology(佐治亚理工学院)

共收录 1669
2512.01989 2025-12-02 cs.CV

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01953 2025-12-02 cs.LG

KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference

KV Pareto: 系统层面优化KV缓存与模型压缩以实现长上下文推理

Sai Gokhale, Devleena Das, Rajeev Patwari, Ashish Sirasao, Elliott Delaye

机构 * Georgia Institute of Technology(佐治亚理工学院) Advanced Micro Devices (AMD)(先进微器件(AMD))

AI总结 KV Pareto通过系统层面优化KV缓存与模型压缩,实现长上下文推理中的内存效率与准确率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01172 2025-12-02 stat.ML cs.LG math.OC

High-dimensional Mean-Field Games by Particle-based Flow Matching

高维均场博弈的粒子流匹配方法

Jiajia Yu, Junghwan Lee, Yao Xie, Xiuyuan Cheng

机构 * Department of Mathematics, Duke University(杜克大学数学系) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程学院)

AI总结 本文提出基于粒子的深度流匹配方法,用于解决高维均场博弈问题,通过流神经网络实现无模拟的速度匹配,并在理论和实验上证明了其收敛性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01141 2025-12-02 cs.SE cs.LG

Neural Variable Name Repair: Learning to Rename Identifiers for Readability

神经变量名修复:学习为可读性重命名标识符

Muhammad Yousuf, Akshat Bagade, Chhittebbayi Penugonda, Maanas Baraya

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出神经变量名修复方法,通过微调和重排技术提升代码可读性,实验显示其在精确匹配和部分相似度评分上显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01119 2025-12-02 cs.LG cs.AI

World Model Robustness via Surprise Recognition

通过惊喜识别提升世界模型鲁棒性

Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 通过惊喜识别提升世界模型在噪声环境下的鲁棒性,增强自动驾驶模拟中智能体的稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00598 2025-12-02 cs.LG cs.AI cs.CY

Developing Fairness-Aware Task Decomposition to Improve Equity in Post-Spinal Fusion Complication Prediction

开发公平性感知的任务分解以提高脊柱融合术后并发症预测的公平性

Yining Yuan, J. Ben Tamo, Wenqi Shi, Yishan Zhong, Micky C. Nnamdi, B. Randall Brenn, Steven W. Hwang, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) UT Southwestern Medical Center(西南医学中心) Shriners Children’s Hospital(儿童烧伤医院)

AI总结 FAIR-MTL通过公平性感知的多任务学习框架,提升脊柱融合术后并发症预测的公平性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00596 2025-12-02 cs.IR cs.AI

DLRREC: Denoising Latent Representations via Multi-Modal Knowledge Fusion in Deep Recommender Systems

DLRREC: 通过深度融合多模态知识在深度推荐系统中进行潜在表示去噪

Jiahao Tian, Zhenkai Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 DLRREC通过深度融合多模态和协同知识,提升深度推荐系统中潜在表示的去噪能力,从而实现更精确的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14776 2025-12-02 cs.CL

COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation

COMPASS:基于上下文调节的PID注意力转向系统用于减少幻觉

Kenji Sahay, Snigdha Pandya, Rohan Nagale, Anna Lin, Shikhar Shiromani, Kevin Zhu, Dev Sunishchal

机构 * Algoverse Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校)

AI总结 COMPASS通过上下文调节PID注意力转向系统减少大型语言模型的幻觉,通过可解释的反馈回路提升生成的准确性与可解释性。

Comments 9 pages, 6 figures including algorithmns, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15626 2025-12-02 cs.RO cs.SY eess.SY

Adaptive Legged Locomotion via Online Learning for Model Predictive Control

通过在线学习的自适应四肢运动控制

Hongyu Zhou, Xiaoyu Zhang, Vasileios Tzoumas

机构 * Department of Aerospace Engineering, University of Michigan(密歇根大学航空航天工程系) Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(佐治亚理工学院机器人与智能机器研究所)

AI总结 该研究提出了一种通过在线学习和模型预测控制实现自适应四肢运动的算法,能够处理未知负载和不规则地形下的复杂任务。

Comments IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01970 2025-12-02 math.OC cs.AI cs.LG cs.SY eess.SY

Differentiable Optimization for Deep Learning-Enhanced DC Approximation of AC Optimal Power Flow

可微优化用于深度学习增强的交流最优功率流近似

Andrew Rosemberg, Michael Klamkin, Pascal Van Hentenryck

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出基于深度学习的可微优化框架,用于增强直流最优功率流近似,以更准确地模拟交流最优功率流行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06284 2025-12-02 cs.AI

A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks

多模态大语言模型在视觉-语言任务中的综合综述与指南

Chia Xin Liang, Pu Tian, Caitlyn Heqi Yin, Yao Yua, Wei An-Hou, Li Ming, Xinyuan Song, Tianyang Wang, Ziqian Bi, Ming Liu

机构 * JTB Technology Corp.(JTB技术公司) Stockton University(斯托顿大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AppCubic USA(AppCubic美国公司) Nomad Sustaintech LTD(Nomad可持续科技有限公司) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) University of Liverpool(利物浦大学) Indiana University(印第安纳大学) Purdue University(普渡大学)

AI总结 本文综述了多模态大语言模型在视觉-语言任务中的应用,探讨了其架构、训练方法及挑战,并提供了理论与实践的全面指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23376 2025-12-01 cs.HC cs.CL

Is Passive Expertise-Based Personalization Enough? A Case Study in AI-Assisted Test-Taking

基于被动专家经验的个性化是否足够?一项在AI辅助考试中的案例研究

Li Siyan, Jason Zhang, Akash Maharaj, Yuanming Shi, Yunyao Li

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) Adobe(Adobe公司)

AI总结 本文研究了基于被动专家经验的个性化在AI辅助考试中的效果,发现其能降低任务负荷但存在局限,需结合主动个性化以提升用户体验。

Comments Accepted into Tailoring AI: Exploring Active and Passive LLM Personalization (PALS) workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22434 2025-12-01 cs.CR cs.AI

FastFHE: Packing-Scalable and Depthwise-Separable CNN Inference Over FHE

FastFHE: 基于FHE的可扩展打包和深度可分离CNN推理

Wenbo Song, Xinxin Fan, Quanliang Jing, Shaoye Luo, Wenqi Wei, Chi Lin, Yunfeng Lu, Ling Liu

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) UCAS(中国科学院大学) Fordham University(福特汉姆大学) Dalian University of Technology(大连理工大学) Beihang University(北京航空航天大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 FastFHE通过可扩展加密打包、深度可分离卷积、BN点积融合和Legendre多项式近似,提升FHE下CNN推理效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22249 2025-12-01 cs.CV

Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective

迈向可扩散的高维潜在空间:从频率视角出发

Bolin Lai, Xudong Wang, Saketh Rambhatla, James M. Rehg, Zsolt Kira, Rohit Girdhar, Ishan Misra

机构 * Meta AI Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出FreqWarm方法,通过增加高频潜在信号的早期曝光,提升高维潜在空间的可扩散性,有效改善生成质量。

Comments 11 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11849 2025-12-01 cs.LG

Leveraging Exogenous Signals for Hydrology Time Series Forecasting

利用外源信号进行水文时间序列预测

Junyang He, Judy Fox, Alireza Jafari, Ying-Jung Chen, Geoffrey Fox

机构 * College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院) University of Virginia(弗吉尼亚大学) School of Data Science(数据科学学院) Computer Science(计算机科学) Biocomplexity Institute(生物复杂性研究所)

AI总结 本文提出利用外源信号提升水文时间序列预测性能,通过整合全面的外源输入,显著提高降雨-径流建模效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19732 2025-12-01 cs.AI cs.CV cs.RO

Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning

备忘录:通过强化学习训练内存高效的具身智能体

Gunshi Gupta, Karmesh Yadav, Zsolt Kira, Yarin Gal, Rahaf Aljundi

机构 * University of Oxford(牛津大学) Georgia Tech University(佐治亚理工学院) Toyota Motor Europe(丰田欧洲公司)

AI总结 Memo通过在训练过程中交错周期性总结标记与输入,实现内存高效的具身智能体强化学习训练,优于长上下文基线并更高效。

Comments Accepted for Spotlight Presentation at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02009 2025-12-01 cs.RO

Trust-Preserved Human-Robot Shared Autonomy enabled by Bayesian Relational Event Modeling

基于贝叶斯关系事件建模的信任保留人机协同自主性

Yingke Li, Fumin Zhang

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(电子与计算机工程学院,佐治亚理工学院) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学)

AI总结 本文提出基于贝叶斯关系事件建模的信任保留协同自主策略,通过动态推断人类信任提升人机协作效率与用户接受度。

Journal ref in IEEE Robotics and Automation Letters, vol. 9, no. 11, pp. 10716-10723, Nov. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21592 2025-11-27 cs.CV

MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training

通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量

Haotian Xue, Qi Chen, Zhonghao Wang, Xun Huang, Eli Shechtman, Jinrong Xie, Yongxin Chen

机构 * Adobe(Adobe公司) Georgia Tech(佐治亚理工学院)

AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20957 2025-11-27 cs.CV

Beyond Realism: Learning the Art of Expressive Composition with StickerNet

超越现实:利用StickerNet学习表现性创作

Haoming Lu, David Kocharian, Humphrey Shi

机构 * Picsart AI Research(Picsart人工智能研究) Picsart Inc(Picsart公司) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10168 2025-11-27 stat.ML cs.LG

Momentum Multi-Marginal Schrödinger Bridge Matching

动量多边际施罗德桥匹配

Panagiotis Theodoropoulos, Augustinos D. Saravanos, Evangelos A. Theodorou, Guan-Horng Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) FAIR at Meta(Meta 的 FAIR)

AI总结 3MSBM通过学习满足多位置约束的随机系统光滑测度值样条,改进了多边际设置中匹配框架的收敛性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21890 2025-11-27 cs.CV

Diffusion-Denoised Hyperspectral Gaussian Splatting

扩散去噪超光谱高斯点云

Sunil Kumar Narayanan, Lingjun Zhao, Lu Gan, Yongsheng Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出DD-HGS方法,通过引入波长敏感的球谐函数、光谱损失和扩散去噪器,实现超光谱场景的3D显式重建,提升3D高斯点云方法的性能。

Comments Accepted to 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15277 2025-11-27 cs.CL

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10959 2025-11-27 cs.CV cs.AI

OuroMamba: A Data-Free Quantization Framework for Vision Mamba

OuroMamba:一种无需数据的视觉Mamba量化框架

Akshat Ramachandran, Mingyu Lee, Huan Xu, Souvik Kundu, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel Labs(英特尔实验室)

AI总结 OuroMamba提出一种无需数据的视觉Mamba量化方法,通过生成语义丰富的合成数据和混合精度量化技术,实现高效的模型压缩与性能提升。

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17264 2025-11-27 cs.LG cs.DC

No Request Left Behind: Tackling Heterogeneity in Long-Context LLM Inference with Medha

没有被遗漏的请求:通过Medha解决长上下文LLM推理中的异质性

Amey Agrawal, Haoran Qiu, Junda Chen, Íñigo Goiri, Chaojie Zhang, Rayyan Shahid, Ramachandran Ramjee, Alexey Tumanov, Esha Choukse

机构 * Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院) UC San Diego(圣地亚哥大学)

AI总结 Medha 通过引入细粒度抢占式调度和新型并行策略,有效解决长上下文LLM推理中的异质性问题,显著提升系统吞吐量和响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02387 2025-11-27 cs.AI cs.CL

Large Language Models and Cognitive Science: A Comprehensive Review of Similarities, Differences, and Challenges

大语言模型与认知科学:对相似性、差异性和挑战的全面综述

Qian Niu, Junyu Liu, Ziqian Bi, Pohsun Feng, Benji Peng, Keyu Chen, Ming Li, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Ziyuan Qin, Riyang Bao, Xinyuan Song, Zekun Jiang

机构 * Kyoto University(京都大学) Indiana University(印第安纳大学) National Taiwan Normal University(台湾师范大学) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool, UK(利物浦大学) University of Edinburgh, UK(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(普渡大学) Emory University(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University(四川大学西昌生物大数据中心、西昌医院)

AI总结 本文综述了大语言模型与认知科学的相似性、差异性和挑战,探讨了LLMs在认知领域的应用及改进方法。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20041 2025-11-26 cs.CV cs.AI cs.LG

MFM-point: Multi-scale Flow Matching for Point Cloud Generation

MFM-point: 多尺度流匹配用于点云生成

Petr Molodyk, Jaemoo Choi, David W. Romero, Ming-Yu Liu, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

AI总结 MFM-Point通过多尺度流匹配框架提升点云生成的可扩展性和性能,同时保持简洁高效,实现多类别和高分辨率生成任务中的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19773 2025-11-26 cs.AI cs.CL cs.CV

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

在视觉语言模型中实现工具集成推理的规模化代理强化学习

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Hanrui Wang, Di Jin, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) Emory University(埃默里大学) KAUST(阿联酋卡塔尔大学) Georgia Tech(佐治亚理工学院) Cisco(思科系统) TAMU(德克萨斯大学奥斯汀分校) UT Southwestern Medical Center(德克萨斯西南医学中心) Eigen AI

AI总结 本文提出VISTA-Gym,通过多轮轨迹采样和端到端强化学习,提升视觉语言模型的工具集成推理能力,在多个基准测试中取得显著优势。

Comments 17 pages, 9 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19757 2025-11-26 cs.CL

What does it mean to understand language?

什么是理解语言意味着?

Colton Casto, Anna Ivanova, Evelina Fedorenko, Nancy Kanwisher

机构 * Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究 institute) Harvard University(哈佛大学) School of Psychology(心理学学院) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) Department of Brain and Cognitive Sciences(脑科学与认知科学系)

AI总结 本文探讨了理解语言的认知和神经机制,提出通过将信息导出至其他大脑区域来构建心理模型,以深入理解语言。

详情

展开后加载摘要…

URL PDF HTML 收藏