arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Georgia Institute of Technology(佐治亚理工学院)

共收录 1666
2603.23914 2026-03-26 cs.CV cs.LG

Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding

面向大视觉-语言模型的注意力感知推理优化

Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Selim Furkan Tekin, Tiansheng Huang, Zachary Yahn, Yichang Xu, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Research(思科研究)

AI总结 本文提出AttentionPack框架,通过紧凑注意力机制和解压机制提升大视觉-语言模型解码效率,实验表明内存效率提升8倍,支持更大批次和更快推理,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23550 2026-03-26 cs.LG

Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction

隐式回合式策略优化用于主动用户-大语言模型交互

Haoyu Wang, Yuxin Chen, Liang Luo, Buyun Zhang, Ellie Dingqiao Wen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta AI

AI总结 本文提出隐式回合式策略优化方法,通过隐式过程奖励模型从稀疏结果信号中提取细粒度回合级奖励,提升多轮协作任务的训练稳定性与收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23419 2026-03-25 cs.HC cs.AI

Biased Error Attribution in Multi-Agent Human-AI Systems Under Delayed Feedback

多智能体人机系统中延迟反馈下的偏差性错误归因

Teerthaa Parakh, Karen M. Feigh

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究探讨了在延迟反馈下多智能体人机系统中决策与责任归因受认知偏差的影响,通过实验发现参与者对负反馈的修正更强烈,且常错误归因于不同AI代理,导致决策调整与实际原因弱相关。

Comments 14 pages, 9 figures. Preprint. An extended abstract is under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19116 2026-03-25 cs.LG cs.AI

Graph Structure Learning with Privacy Guarantees for Open Graph Data

具有隐私保障的开放图数据图结构学习

Muhao Guo, Jiaqi Wu, Yizheng Liao, Wenke Lee, Shengzhe Chen, Yang Weng

机构 * Arizona State University(亚利桑那州立大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出一种在数据发布阶段集成高斯差分隐私的图结构学习框架,通过在数据发布前注入结构化高斯噪声,实现隐私保护与图结构恢复的平衡,实验验证了在严格隐私预算下保持高图恢复准确性的隐私-效用权衡。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21635 2026-03-24 cs.RO cs.SY eess.SY

RTD-RAX: Fast, Safe Trajectory Planning for Systems under Unknown Disturbances

RTD-RAX:在未知扰动下快速安全的轨迹规划

Evanns Morales-Cuadrado, Long Kiu Chung, Shreyas Kousik, Samuel Coogan

机构 * Georgia Institute of Technology(佐治亚理工学院) School of Electrical and Computer Engineering(电子与计算机工程学院) School of Mechanical Engineering(机械工程学院) School of Civil and Environmental Engineering(土木与环境工程学院)

AI总结 RTD-RAX通过非保守的RTD方法快速生成目标导向候选轨迹,并利用混合单调可达性实现快速扰动感知在线安全认证,确保在实时不确定环境下轨迹安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15054 2026-03-24 cs.CL cs.AI cs.LG q-bio.BM

MolLangBench: A Comprehensive Benchmark for Language-Prompted Molecular Structure Recognition, Editing, and Generation

MolLangBench: 一种全面的分子结构识别、编辑和生成语言提示基准

Feiyang Cai, Jiahui Bai, Tao Tang, Guijuan He, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) HitGen University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出MolLangBench,用于评估分子语言接口任务,发现现有模型在分子识别和编辑任务上表现欠佳,生成任务更差,强调了对化学应用中更可靠AI系统的研发需求。

Comments ICLR-2026 Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04071 2026-03-24 stat.ML cs.LG

Tightening optimality gap with confidence through conformal prediction

通过校准预测紧缩最优性间隙

Miao Li, Michael Klamkin, Russell Bent, Pascal Van Hentenryck

机构 * H. Milton Stewart School of Industrial and Systems Engineering(H. Milton Stewart工业与系统工程学院) Georgia Institute of Technology(佐治亚理工学院) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

AI总结 本文提出一种校准预测框架,用于紧缩松散的原始和对偶界。通过选择性推理处理异方差性,并利用其认证有效性生成更紧的预测区间,提升大规模工业问题的效率。

Comments none

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01886 2026-03-24 cs.CL cs.AI q-fin.RM

Advanced Deep Learning Techniques for Analyzing Earnings Call Transcripts: Methodologies and Applications

高级深度学习技术用于分析业绩说明会文本:方法与应用

Umair Zakir, Evan Daykin, Amssatou Diagne, Jacob Faile

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文比较了BERT、FinBERT和ULMFiT等深度学习方法在业绩说明会文本情感分析中的表现,探讨了NLP在提取大规模金融文本情感信息中的应用,旨在提升投资决策与风险管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21317 2026-03-24 cs.LG

Stream separation improves Bregman conditioning in transformers

流分离改进变换器中的Bregman条件

James Clayton Kerce

机构 * Georgia Tech Research Institute(佐治亚理工学院研究机构)

AI总结 研究通过流分离提升变换器中Bregman几何的条件,发现流分离能显著提高有效秩,即使没有辅助监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20585 2026-03-24 cs.LG stat.ML

RECLAIM: Cyclic Causal Discovery Amid Measurement Noise

RECLAIM:在测量噪声中进行循环因果发现

Muralikrishnna G. Sethuraman, Faramarz Fekri

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(佐治亚理工学院电气与计算机工程学院)

AI总结 RECLAIM通过最大似然估计和残差归一化流处理循环因果和测量噪声,理论保证一致性和实验证明有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20009 2026-03-24 cs.CL cs.AI cs.LG

LinguaMap: Which Layers of LLMs Speak Your Language and How to Tune Them?

LinguaMap:哪些LLM层说你的语言以及如何调节它们?

J. Ben Tamo, Daniel Carlander-Reuterfelt, Jonathan Rubin, Dezhi Hong, Mingxian Wang, Oleg Poliannikov

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

AI总结 本文提出LinguaMap方法,通过分析LLM各层的语言控制机制,发现语言一致性瓶颈并提出选择性微调策略,实现多语言适应的高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06552 2026-03-24 cs.CL

Flipping the Dialogue: Training and Evaluating User Language Models

翻转对话:训练和评估用户语言模型

Tarek Naous, Philippe Laban, Wei Xu, Jennifer Neville

机构 * Microsoft Research(微软研究院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出User LMs,通过多轮对话模拟人类用户,验证其在真实场景下优于传统模拟方法,提升评估准确性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16449 2026-03-24 cs.CL cs.AI

PersonaMatrix: A Recipe for Persona-Aware Evaluation of Legal Summarization

PersonaMatrix: 一种面向人物的法律摘要评估配方

Tsz Fung Pang, Maryam Berijanian, Thomas Orth, Breanna Shi, Charlotte S. Alexander

机构 * Georgia Institute of Technology(佐治亚理工学院) Michigan State University(密歇根州立大学)

AI总结 本文提出PersonaMatrix框架,通过六个角色评估法律摘要,引入控制的维度转移试点数据集,以暴露法律摘要在人物意识和非人物意识法官间的差异最优解。

Comments Accepted for publication in JURIX 2025 (Legal Knowledge and Information Systems, FAIA series, IOS Press). Long Paper

Journal ref JURIX (Legal Knowledge and Information Systems), 416, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13859 2026-03-24 cs.CV

Accurate Quantization for Gait Representation Learning

精确的量化方法用于姿态表示学习

S. Tian, H. Gao, G. Hong, S. Wang, J. Wang, X. Yu, S. Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Tsinghua University(清华大学) The University of Queensland(昆士兰大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出了一种可微的软量化器以提升姿态表示学习的精度,通过两阶段训练策略和类间距离引导校准策略,有效解决了二值化输入下的收敛问题,实验验证了方法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16715 2026-03-24 cs.LG cs.AI math.OC

Policy Optimization over General State and Action Spaces

在一般状态和动作空间上进行策略优化

Caleb Ju, Guanghui Lan

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(赫尔曼·米勒工业与系统工程学院,佐治亚理工学院)

AI总结 本文提出了一种新的策略镜像下降方法,用于处理一般状态和动作空间的强化学习问题,同时引入了新的函数逼近方法,并探讨了这些方法在不同强化学习问题中的收敛性。

Comments Writing updates and new experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20211 2026-03-24 cs.CY cs.AI

Exploring Teacher-Chatbot Interaction and Affect in Block-Based Programming

探索基于积木编程的教师-聊天机器人交互与情感

Bahare Riahi, Ally Limke, Xiaoyi Tian, Viktoriia Storozhevykh, Sayali Patukale, Tahreem Yasir, Khushbu Singh, Jennifer Chiu, Nicholas lytle, Tiffany Barnes, Veronica Catete

机构 * Computer Science(计算机科学) North Carolina State University(北卡罗来纳州立大学) University of Virginia(弗吉尼亚大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究探讨了教师在使用基于大语言模型的聊天机器人进行科学与计算思维活动时的交互与情感,提出了三种教师类型并提出了设计建议。

Comments 19 pages, 9 figures, CHI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19661 2026-03-23 cs.RO

Legged Autonomous Surface Science In Analogue Environments (LASSIE): Making Every Robotic Step Count in Planetary Exploration

足部自主表面科学在类地环境中的应用(LASSIE):在行星探索中使每一步都发挥作用

Cristina G. Wilson, Marion Nachon, Shipeng Liu, John G. Ruck, J. Diego Caporale, Benjamin E. McKeeby, Yifeng Zhang, Jordan M. Bretzfelder, John Bush, Alivia M. Eng, Ethan Fulcher, Emmy B. Hughes, Ian C. Rankin, Jelis J. Sostre Cortés, Sophie Silver, Michael R. Zanetti, Ryan C. Ewing, Kenton R. Fisher, Douglas J. Jerolmack, Daniel E. Koditschek, Frances Rivera-Hernández, Thomas F. Shipley, Feifei Qian

机构 * Collaborative Robotics and Intelligent Systems Institute, Oregon State University(协作机器人与智能系统研究所,俄勒冈州立大学) Department of Geology and Geophysics, Texas A&M University(地质与地球物理系,德克萨斯大学) Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) Department of Earth and Environmental Science, University of Pennsylvania(地球与环境科学系,宾夕法尼亚大学) Department of Astronomy and Planetary Science, Northern Arizona University(天文学与行星科学系,北方亚利桑那大学) School of Earth and Atmospheric Sciences, Georgia Institute of Technology(地球与大气科学学院,佐治亚理工学院) NASA Marshall Space Flight Center(美国国家航空航天局马歇尔航天飞行中心) NASA Johnson Space Center(美国国家航空航天局约翰逊航天中心) Department of Electrical and Systems Engineering, University of Pennsylvania(电气与系统工程系,宾夕法尼亚大学) Department of Psychology, Temple University(心理学系, Temple 大学)

AI总结 本文提出两种新方法,通过高机动性腿部机器人和受人类启发的数据采集算法,提升行星表面探索效率,实现更灵活的科学探索与地质环境分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19634 2026-03-23 cs.HC cs.AI cs.CY cs.IR

MetaCues: Enabling Critical Engagement with Generative AI for Information Seeking and Sensemaking

MetaCues:通过生成式AI促进信息检索与意义建构中的批判性参与

Anjali Singh, Karan Taneja, Zhitong Guan, Soo Young Rieh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出MetaCues工具,通过元认知提示和笔记界面提升用户在信息检索中的批判性思维,实验显示其能提高用户对搜索主题的态度判断信心和广泛探究能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01425 2026-03-23 cs.DS cs.LG math.ST stat.ML stat.TH

In-and-Out: Algorithmic Diffusion for Sampling Convex Bodies

入出:用于采样凸体的算法扩散

Yunbum Kook, Santosh S. Vempala, Matthew S. Zhang

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Vector Institute(向量研究所)

AI总结 本文提出一种新的随机游走算法,用于均匀采样高维凸体,实现了最先进的运行时间复杂度,并在输出保证上优于现有方法,特别是在Rényi散度方面。

Comments To appear in Random Structures & Algorithms; conference version appeared in NeurIPS 2024 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14052 2026-03-23 cs.CV cs.MA

A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

一种多智能体感知-行动联盟用于高效长视频推理

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01176 2026-03-23 cs.RO

Path Integral Particle Filtering for Hybrid Systems via Saltation Matrices

基于盐化矩阵的混合系统路径积分粒子滤波

Karthik Shaji, Sreeranj Jayadevan, Bo Yuan, Hongzhe Yu, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出一种基于最优控制的粒子滤波方法,利用盐化矩阵处理混合系统接触事件中的不确定性传播,该方法具有鲁棒性、灵活性和处理复杂接触动态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05709 2026-03-23 cs.LG stat.ML

Flow-based Conformal Prediction for Multi-dimensional Time Series

基于流的多维时间序列置信预测

Junghwan Lee, Chen Xu, Yao Xie

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(希拉德-米利斯坦斯通工业与系统工程学院,佐治亚理工学院)

AI总结 本文提出基于流和分类器无指导的新型时间序列置信预测方法,解决观测相关性和非一致性评分的交换性假设问题,并构建多维输出的预测集,提供精确的覆盖保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19131 2026-03-20 cs.LG cs.RO

From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models

从推理效率到具身效率:重新审视视觉-语言-动作模型的效率指标

Zhuofan Li, Hongkun Yang, Zhenyang Chen, Yangxuan Chen, Yingyan, Lin, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港理工大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文重新审视视觉-语言-动作模型的效率指标,发现传统参数、FLOPs或token解码吞吐量无法反映机器人平台的实际表现,提出具身效率指标如任务完成时间、轨迹平滑度等,揭示传统方法在具身效率上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18448 2026-03-20 cs.LG

Seeking Universal Shot Language Understanding Solutions

寻找通用短语语言理解解决方案

Haoxin Liu, Harshavardhan Kamarthi, Zhiyuan Zhao, Hongjie Chen, B. Aditya Prakash

机构 * Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories(杜比实验室)

AI总结 本文提出SLU-SUITE框架,通过49万人工标注数据揭示VLM在SLU任务中的瓶颈,提出UniShot和AgentShots两种通用解决方案,实验显示在领域内任务优于专用模型,在领域外任务超越商业VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18029 2026-03-20 cs.LG cs.AI

Engineering Verifiable Modularity in Transformers via Per-Layer Supervision

通过逐层监督在Transformer中工程化可验证的模ularity

J. Clayton Kerce

机构 * Georgia Tech Research Institute(佐治亚理工学院研究 institute)

AI总结 本文通过逐层监督和双流处理,揭示Transformer内部隐藏的模块化结构,实现对模型行为的更精确控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17910 2026-03-19 cs.CV

SpiderCam: Low-Power Snapshot Depth from Differential Defocus

SpiderCam: 低功耗差分模糊拍摄深度

Marcos A. Ferreira, Tianao Li, John Mamish, Josiah Hester, Yaman Sangar, Qi Guo, Emma Alexander

机构 * Northwestern University(西北大学) Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学)

AI总结 SpiderCam通过FPGA实现低功耗差分模糊拍摄深度,实时生成480x400稀疏深度图,功耗仅624mW,首次实现被动FPGA 3D相机亚瓦特总功耗。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19945 2026-03-19 cs.LG cs.SY eess.SY

Constraint Learning in Multi-Agent Dynamic Games from Demonstrations of Local Nash Interactions

从局部纳什互动演示中学习多智能体动态博弈的约束

Zhouyu Zhang, Chih-Yuan Chiu, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院) School of ECE(电子工程学院) Schools of AE and CSP(航空航天与通信科学学院)

AI总结 本文提出基于逆动态博弈的算法,从给定的局部纳什均衡互动数据中学习参数约束,通过混合整数线性规划编码KKT条件,恢复与互动演示局部纳什站稳一致的约束,并设计满足底层约束的运动计划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17374 2026-03-19 cs.CV

Shot-Aware Frame Sampling for Video Understanding

面向快门的视频帧采样

Mengyu Zhao, Di Fu, Yongyu Xie, Jiaxing Zhang, Zhigang Yuan, Shirin Jalali, Yong Cao

机构 * ByteDance(字节跳动) Rutgers University(罗格斯大学) Georgia Tech(佐治亚理工学院)

AI总结 本文提出InfoShot,一种任务无关的快门感知帧采样方法,用于长视频理解。通过分割视频为语义一致的快门,并选择两种互补的关键帧,以保留视频结构和短时变化信息,提升视频理解和异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏