arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Georgia Institute of Technology(佐治亚理工学院)

共收录 1663
2607.16712 2026-07-21 cs.AI cs.CL 新提交

DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening

DS@GT在eRisk 2026的ARC:用于对话式抑郁症筛查的具有结构化算法指导的混合多智能体大语言模型系统

Victor Gong, David Guecha

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 介绍DS@GT参加eRisk 2026对话式抑郁症筛查挑战赛,其系统历经三个阶段,最终采用混合配置并添加算法组件。提交三次运行结果,混合运行3表现出色,以低成本超付费基线,验证较弱开源模型经算法监督可与专有模型竞争。

Comments Conference and Labs of the Evaluation Forum (CLEF), 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16657 2026-07-21 cs.SD 新提交

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

HARP:用于神经音频编解码器的谐波感知残差划分

Qiaoyu Yang, Lixing He, Binyue Deng, Weifeng Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) The Chinese University of Hong Kong(香港中文大学) Tencent Music Entertainment(腾讯音乐娱乐集团)

AI总结 研究针对神经音频编解码器中码本频谱纠缠等问题,提出HARP训练策略,将RVQ阶段分组,在解码器能访问低频时各小组细化目标频带,重建泛音保留连贯性,该策略无需架构改变,性能优于标准RVQ和并行分解。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16453 2026-07-21 cs.CV 新提交

DS@GT ARC at AnimalCLEF 2026: Species-Aware Graph Construction for Multi-Species Animal Re-Identification

DS@GT ARC参加2026年动物CLEF:用于多物种动物重新识别的物种感知图构建

Evan Sinclair Smith, Anthony Miyaguchi, Snigdha Palamari, Danté Evangelista

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 该研究针对多物种动物重新识别问题,提出将其作为物种感知图构建,通过整合预处理、检索、验证、评分、边缘接纳和社区检测等流程,提升识别效果,所选提交在230个团队中排名第五,凸显视觉表示与多种约束校准整合的重要性。

Comments 18 pages, 8 figures. Accepted to the CLEF 2026 Working Notes. Code: https://github.com/dsgt-arc/animalclef-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16384 2026-07-21 cs.LG math.OC math.PR stat.ML 新提交

Scaling Limits of Constant-Stepsize SGD at Flat Minima

常步长随机梯度下降在平坦极小值处的缩放极限

Jingyi Zhang, Cheng Mao, Debankur Mukherjee

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究常步长随机梯度下降在平坦极小值处的缩放极限,通过分析由压缩驱动链生成马尔可夫噪声的SGD,证明其在特定距离下的收敛性,给出不同平坦指数下的收缩因子及小步长缩放极限,揭示了与强凸情况不同的行为。

Comments 52 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17033 2026-07-21 cs.LG physics.chem-ph 新提交

ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

ChemFusion:用于反应产率预测的多模态交叉注意力网络

Qiwei Han, Chi Zhou

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究过渡金属催化反应产率预测难题,提出ChemFusion多模态交叉注意力网络,融合电子特征与3D原子坐标,用交叉注意力机制,在交叉偶联库基准测试中性能出色,还能自主学习识别和惩罚空间位阻,提供物理可解释性。

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12190 2026-07-21 cs.RO cs.CV

Bundle Adjustment in the Eager Mode

急切模式下的捆绑调整

Zitong Zhan, Huan Xu, Zihang Fang, Xinpeng Wei, Yaoyu Hu, Chen Wang

机构 * Spatial AI & Robotics (SAIR) Lab, University at Buffalo(空间人工智能与机器人实验室,布法罗大学) Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种与PyTorch无缝集成的高效急切模式捆绑调整库,通过稀疏感知的自动微分设计和GPU加速的稀疏运算,提升了在机器人应用中捆绑调整的运行效率和性能。

Journal ref IEEE Transactions on Robotics (T-RO), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14473 2026-07-21 cs.CL cs.AI 版本更新

Does RAG Know When Retrieval Is Wrong? Diagnosing Context Compliance under Knowledge Conflict

RAG 能知道检索错误吗?知识冲突下的上下文合规性诊断

Yihang Chen, Pin Qian, Su Wang, Sipeng Zhang, Huan Xu, Shuhuai Lin, Xinpeng Wei

机构 * Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 提出上下文驱动分解(CDD)方法,在推理时探测并干预检索增强生成中的上下文与参数知识冲突,揭示上下文合规性模式并提升鲁棒性。

Comments Preprint. 3 figures, 3 tables. Diagnostic study of context compliance in RAG under knowledge conflict; closed-API evaluations (Gemini-2.5-Flash and Claude family)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08765 2026-07-21 physics.comp-ph cs.LG cs.NA math.NA stat.ML 版本更新

One-shot acceleration of transient PDE solvers via online-learned preconditioners

通过在线学习预处理器实现瞬态偏微分方程求解器的一次性加速

Mikhail Khodak, Min Ki Jung, Brian Wynne, Edmond Chow, Egemen Kolemen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Seoul National University(首尔国立大学) Princeton University(普林斯顿大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对瞬态偏微分方程数值模拟,提出用强盗算法利用线性求解器反馈在线学习预处理器配置的PCGBandit方法,直接在OpenFOAM上实现,可一次性加速模拟,在流体和MHD问题上验证了有效性。

Comments code available at https://github.com/mkhodak/PCGBandit

Journal ref Computer Physics Communications 327 (2026) 110304

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14592 2026-07-21 cs.RO cs.AI 版本更新

DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks

DSBench:用于评估外部和车内风险的综合基准测试

Xianhui Meng, Yuchen Zhang, Zhijian Huang, Zheng Lu, Ziling Ji, Yandan Lin, Yaoyao Yin, Hongyuan Zhang, Wei Zhou, Guangfeng Jiang, Li Zhang, Long Chen, Hangjun Ye, Jun Liu, Xiaoshuai Hao

机构 * University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院) Xiaomi EV(小米电动车) Fudan University(复旦大学) Xidian University(西安电子科技大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学)

AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23185 2026-07-21 cs.RO 版本更新

Physically-Feasible Reactive Synthesis for Terrain-Adaptive Locomotion

用于地形自适应运动的物理可行反应式合成

Ziyi Zhou, Qian Meng, Hadas Kress-Gazit, Ye Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学)

AI总结 针对四足动物在动态变化地形的运动规划问题,提出综合规划框架,结合反应式合成与混合整数凸规划,采用符号修复机制,经实验验证该框架能识别缺失技能并在关键环境有效响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15079 2026-07-20 cs.AI 版本更新

BrainPilot: Automating Brain Discovery with Agentic Research

BrainPilot:通过智能研究实现大脑发现自动化

Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海期智研究院) Business School, Renmin University of China(中国人民大学商学院) School of Physics, Beihang University(北京航空航天大学物理学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Behavioral and Cognitive Neuroscience Center, Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院行为与认知神经科学中心) College of Engineering, Georgia Institute of Technology(佐治亚理工学院工程学院) School of Life Sciences & IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学生命科学学院&清华-IDG/麦戈文脑科学研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Weixian College, Tsinghua University(清华大学未央学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

AI总结 研究针对脑科学研究整合证据难、人工智能代理有缺陷的问题,提出完全开源的多智能体系统BrainPilot,它有可追溯日志和验证结果,含知识库与技能库,经实验评估,其开源模型以低成本达先进框架性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03651 2026-07-20 cs.LG math.OC 版本更新

LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs

基于文本业务输入的大语言模型引导的交通枢纽容量规划

Xiaoyue Liu, Zheng Dong

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究提出用大语言模型代理依自然语言业务描述迭代提出枢纽容量决策的框架,核心机制是思维链推理协议,经反馈回路验证决策,在实际货运网络中表现优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15172 2026-07-17 cs.RO 新提交

AHEAD: Anticipatory Hand-Driven Teleoperation via Human Intent Prediction

AHEAD:通过人类意图预测实现预期的手动驱动遥操作

Seok Joon Kim, Junho Lee, Federica Spinola, Taein Kwon, Mohsen Moghaddam

机构 * Georgia Institute of Technology(佐治亚理工学院) Neuromeka Ltd.(Neuromeka有限公司) INRIA(法国国家信息与自动化研究所) University of Oxford(牛津大学)

AI总结 研究旨在减少机器人反应时间并降低操作员工作量,提出AHEAD实时VR遥操作系统,通过处理手和头部信号及场景上下文预测意图,转换为稳定目标,该系统意图预测准确率高,能有效减少延迟并降低操作员负荷。

Comments Accepted to IROS2026, 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14509 2026-07-17 cs.CV cs.AI cs.LG 新提交

Multi-Scale ViT Inference with Habitat-Fit Priors and kNN Retrieval for Multi-Species Plant Identification

基于栖息地适应先验和kNN检索的多尺度ViT推理用于多物种植物识别

Alper Erten, Murilo Gustineli, Adrian Cheung

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对植被样方图像多物种植物识别难题,基于微调的DINOv2 ViT-L/14分类器,采用多尺度切片分解、kNN检索、栖息地适应降级等方法,在PlantCLEF 2026挑战赛中获第三名,私有排行榜宏F1为0.43902。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14474 2026-07-17 cs.SD cs.AI cs.LG 新提交

Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026

令牌能竞争吗?针对BirdCLEF+ 2026的与监督式CNN主干竞争的令牌表示

Anthony Miyaguchi, Murilo Gustineli, Adrian Cheung

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对BirdCLEF+ 2026中动物发声多标签检测任务,先构建监督基线,后对比神经音频编解码器的编解码表示与基础嵌入的语义表示,比较两个生物声学专家模型和四个基于令牌的编码器,探究基于令牌的表示能否竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14400 2026-07-17 cs.CL cs.IR 新提交

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础

Brandon Michaels, Brendon Johnson

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。

Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14107 2026-07-17 cs.CL cs.AI 新提交

Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs

北极星:用于扩散语言模型高效推理的漂移感知缓存校准和令牌承诺

Mingyu Lee, Akshat Ramachandran, Souvik Kundu, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel AI Group(英特尔人工智能集团)

AI总结 研究针对扩散语言模型推理效率受双向注意力和静态阈值影响的问题,提出北极星框架,利用令牌表示漂移信号,由北极星缓存和北极星提交两组件构成,大幅提升了模型在准确性-吞吐量方面的表现及解码并行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14943 2026-07-17 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 新提交

Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control

通过机制可解释性和最优控制将鲁棒性引入世界行动模型

Jihoon Hong, Julian Skifstad, Qiyue Dai, Alice Chan, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究世界行动模型在分布转移下的脆弱性,利用机制可解释性通过对比激活方向和基于模型的最优控制实现WAM转向,产生WA-LQR,预测不同模型转向能力,在部分模型上提高了对多种扰动的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20556 2026-07-17 stat.ML cs.LG math.OC 版本更新

Distributionally Robust Optimization via Iterative Algorithms in Continuous Probability Spaces

连续概率空间中基于迭代算法的分布鲁棒优化

Linglingzhi Zhu, Yunqin Zhu, Yao Xie

机构 * H. Milton Stewart School of Industrial and Systems Engineering(H. Milton Stewart工业与系统工程学院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究连续概率空间中分布鲁棒优化的计算挑战,利用布雷尼尔定理提出迭代算法框架,建立收敛保证和复杂度界,基于神经网络传输映射的数值结果显示该方法可实现鲁棒分类器稳定训练及有效最坏情况推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12963 2026-07-16 cs.CL 版本更新

The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context

稳健性的错觉:聚合准确率掩盖了与任务无关的上下文下的预测翻转

Yanzhe Zhang, Sanmi Koyejo, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

AI总结 研究大语言模型在含无关上下文环境中的表现,发现聚合准确率掩盖了单个示例预测的不稳定性,如随机伪词会改变部分预测,且此不稳定性受多种因素调节,揭示了尾部风险,推动对模型进行单个示例可靠性评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10936 2026-07-16 cs.LG stat.ML 版本更新

Bandit PCA with Minimax Optimal Regret

具有极小极大最优遗憾值的强盗主成分分析

Moïse Blanchard, Dmitrii Ostrovskii, Aadirupa Saha

机构 * Georgia Tech(佐治亚理工学院) UIC(伊利诺伊大学芝加哥分校)

AI总结 研究强盗反馈版本的在线主成分分析,改进了遗憾值的上下界,弥合差距至\(r\sqrt{dT}\)。上界通过新算法实现,结合在线镜像下降与多尺度探索;下界通过构造自适应对手,将遗憾值下界估计转化为子空间估计问题,并讨论其与量子断层扫描联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12370 2026-07-15 cs.RO 新提交

StratMamba: Strategic and Reactive Stream Partitioning for Path-Efficient LiDAR-Based Obstacle Avoidance

StratMamba:用于基于路径高效的激光雷达避障的策略性和反应性流划分

Hung-Chieh Wu, Xiaopan Zhang, Kasra Sinaei, Ryan Abnavi, Kasun Weerakoon, Christopher Bradley, Seyed Fakoorian, Jiachen Li, Donald Ebeigbe

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) AlphaZ, Inc.(阿尔法兹公司) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究针对复杂环境中机器人导航问题,提出StratMamba双流时间建模架构,结合快慢衰减内存架构处理激光雷达数据。经多场景评估及与其他基线对比,其在时间推理效率、导航速度和路径最优性方面表现出色,在现实中性能更稳健。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 6 figures. Video: https://www.youtube.com/watch?v=Z0FfO_AVaSw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12334 2026-07-15 cs.CL cs.ET 新提交

QUBO-Optimized Evidence Selection for Retrieval-Augmented Question Answering with Unconventional Solvers

使用非常规求解器的QUBO优化证据选择用于检索增强问答

Rahul Singh, Madhav Vadlamani

机构 * University of California Santa Barbara(加利福尼亚大学圣巴巴拉分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究针对检索增强问答中证据选择问题,将其转化为QUBO问题构建能量函数,平衡多种因素选择证据段落,再由下游语言模型生成答案。在HotpotQA上评估,该方法性能与基于LLM的选择器相当,为RAG管道提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12304 2026-07-15 cs.CV cs.LG 新提交

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation

时间基准分数衡量的是什么?分解视频视觉语言模型评估中的通道使用情况

Farrukh Rahman

机构 * Microsoft(微软) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究视频视觉语言模型评估中时间基准分数衡量问题,提出无标签筛选方法“反转下降”区分模型通道使用情况,如Molmo2和Qwen3-VL,指出综合分数不能反映潜在失败模式,此区分在多基准和任务中成立。

Comments 9 pages, 11 pages supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11855 2026-07-14 cs.RO 新提交

Robust bipedal locomotion on flowable slopes via foot-driven terrain manipulation

通过足部驱动的地形操纵在可流动斜坡上实现稳健的双足运动

Deniz Kerimoglu, Junnosuke Kamohara, Jiyeon Maeng, Ziwon Yoon, Seth Hutchinson, Ye Zhao, Daniel I. Goldman

机构 * Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学)

AI总结 研究双足机器人在颗粒斜坡上的运动控制问题,通过研究带防滑钉足部的地面动力学,发现中等防滑钉间距利于行走,据此设计可调整防滑钉深度的足部,应用于大小不同的双足机器人,提出以肢体为中心调节地形相互作用的新控制方法。

Comments 38 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10892 2026-07-14 cs.RO 新提交

A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer

用于多任务块推的单扩散策略控制器,具有零样本模拟到现实转移

Haitong Ma, Haldun Balim, Yang Hu, Bo Dai, Na Li

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 研究旨在用强化学习从零训练单扩散策略用于多任务块推,提出含简单策略损失函数的框架,结合反向课程生成等应对探索挑战,评估其在不同条件下零样本从模拟到现实的转移能力,证明该流程有效。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10537 2026-07-14 cs.SD cs.MM eess.AS 新提交

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

利用未配对数据和对比对齐进行预训练的舞蹈音乐生成

Ryota Kimura, Sangheon Park, Natalia Polouliakh, Taketo Akama

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Keio University(庆应义塾大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对舞蹈音乐生成中高质量配对数据稀缺问题,提出利用未配对和配对数据的框架,结合预训练单峰编码器、对比预训练及控制网络模块,实验证明该方法提升了舞蹈音乐对齐和音频质量,优于现有技术。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏