arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-05-01 至 2026-05-01 共收录 5
2604.28156 2026-05-01 cs.RO cs.AI cs.LG

FlexiTac: A Low-Cost, Open-Source, Scalable Tactile Sensing Solution for Robotic Systems

FlexiTac:一种低成本、开源、可扩展的触觉传感解决方案,用于机器人系统

Binghao Huang, Yunzhu Li

机构 * Columbia University(哥伦比亚大学)

AI总结 FlexiTac是一种低成本、开源、可扩展的触觉传感模块,通过灵活的传感器垫和紧凑的读取板实现高密度触觉信号采集,支持现代触觉学习流程。

Comments Website: https://flexitac.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27378 2026-05-01 math.OC cs.LG cs.MA

Continuous-time q-learning for mean-field control with common noise, part-II: q-learning algorithms

连续时间Q学习用于具有公共噪声的均场控制,第二部分:Q学习算法

Zhenjie Ren, Xiaoli Wei, Xiang Yu, Xun Yu Zhou

机构 * LaMME, Université Évry Paris-Saclay(Évry巴黎萨克雷大学LaMME研究中心) Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系)

AI总结 本文基于放松控制公式,提出Q学习算法以解决具有受控公共噪声的均场控制问题,通过改进的Iq函数和martingale正交条件实现策略和价值函数的更新,并在无限时间线性二次框架下证明了收敛性。

Comments Keywords: Mean-field control, common noise, martingale characterization, optimal q-learning algorithm, Actor-Critic q-learning algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27372 2026-05-01 math.OC cs.LG cs.MA

Continuous-time q-learning for mean-field control with common noise, part-I: Theoretical foundations

连续时间q学习用于具有公共噪声的均场控制,第一部分:理论基础

Zhenjie Ren, Xiaoli Wei, Xiang Yu, Xun Yu Zhou

机构 * LaMME, Université Évry Paris-Saclay(Évry巴黎萨克雷大学LaMME研究中心) Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系)

AI总结 本文研究了熵正则化均场控制中连续时间q函数的特性,通过离散采样动作证明价值函数收敛,并推导了探索性HJB方程,建立了最优策略迭代的存在性和唯一性,最后在一般线性二次设定中显式刻画最优策略。

Comments Keywords: Continuous-time reinforcement learning, mean-field control, common noise, policy improvement, integrated q-function, two-layer fixed point

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26103 2026-05-01 cs.AR cs.AI cs.DC cs.LG

AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving

AMMA: 一种面向低延迟1M上下文注意力服务的多芯片片内存架构

Zhongkai Yu, Haotian Ye, Chenyang Zhou, Ohm Rishabh Venkatachalam, Zaifeng Pan, Zhengding Hu, Junsung Kim, Won Woo Ro, Po-An Tsai, Shuyi Pei, Yangwook Kang, Yufei Ding

机构 * University of California, San Diego(加州大学圣迭戈分校) Columbia University(哥伦比亚大学) Yonsei University(延世大学) NVIDIA(NVIDIA公司) Samsung Semiconductor, Inc.(三星半导体公司)

AI总结 AMMA是一种面向低延迟1M上下文注意力服务的多芯片片内存架构,通过提高内存带宽和优化并行计算方案,显著降低注意力延迟和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11119 2026-05-01 stat.ML cs.LG

DDO-RM: Distribution-Level Policy Improvement after Reward Learning

DDO-RM:奖励学习后基于分布的策略改进

Tiantian Zhang, Jierui Zuo, Michael Chen, Wenping Wang

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学) Department of Management Science and Engineering(管理科学与工程系) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 DDO-RM通过将奖励评分转化为显式目标分布,改进策略在分布层面的性能,实验显示其在准确性与边际均值上优于DPO。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏