arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

共收录 1073
2607.28545 2026-08-06 cs.CL cs.AI cs.SE 版本更新

ORCA-bench: How Ready Are Language Model Agents for Oncall?

ORCA-bench:语言模型智能体的值班待命准备程度如何?

Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech(康奈尔科技学院) Traversal Columbia University(哥伦比亚大学)

AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13357 2026-08-06 cs.CV cs.AI 版本更新

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学)

AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22167 2026-08-05 cs.LG cs.AI 版本更新

Estimating Tail Risks in Language Model Output Distributions

语言模型输出分布中的尾部风险估计

Rico Angell, Raghav Singhal, Zachary Horvitz, Zhou Yu, Rajesh Ranganath, Kathleen McKeown, He He

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Center for Data Science, New York University(纽约大学数据科学中心)

AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10696 2026-08-05 cs.CL cs.AI 版本更新

$π$-Attention: Online Efficient Sparse Transformers for Long-Context Modeling

π-注意力:用于高效长上下文建模的周期性稀疏变换器

Pike D. Liu, Chang Liu, Yanxuan Yu

机构 * University of California - Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学)

AI总结 本文提出π注意力,通过周期性稀疏结构实现高效长上下文建模,相比环形注意力在接收场增长上更优,且在相同上下文长度下使用更少的GPU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00617 2026-08-04 cs.CV 新提交

Diagnosing Under-Development of Irreversible Processes in Video Generation

诊断视频生成中不可逆过程的欠发展问题

Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(理化学研究所 iTHEMS) RIKEN AIP(理化学研究所 AIP) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

AI总结 本研究针对视频生成模型是否遵循物理不可逆性的问题,提出含进展与静态率的两部分协议,发现模型存在不可逆属性欠发展问题,并验证解耦属性潜空间的单调性构建可消除可操纵的读出引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03573 2026-08-04 stat.ML cs.LG 版本更新

Local-Time Riemannian Score Matching on the Quantum Pure-State Manifold

随机薛定谔扩散模型用于纯态集合生成

Jian Xu, Wei Chen, Shigui Li, Chao Li, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(华南理工大学) Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

AI总结 本文提出随机薛定谔扩散模型(SSDMs),在复射影空间CP^{d-1}上构建基于分数的生成框架,通过局部欧几里得奥本海姆-乌尔申贝格近似实现无解析过渡密度的训练,提升量子机器学习的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20544 2026-08-04 cs.CV cs.AI cs.LG 版本更新

New York Smells: A Large Multimodal Dataset for Olfaction

纽约气味:一个大规模多模态数据集用于嗅觉

Ege Ozguroglu, Junbang Liang, Ruoshi Liu, Mia Chiquier, Michael DeTienne, Wesley Wei Qian, Alexandra Horowitz, Andrew Owens, Carl Vondrick

机构 * Columbia University(哥伦比亚大学) Cornell University(康奈尔大学) Osmo Labs(Osmo实验室)

AI总结 New York Smells 数据集通过多模态数据提升机器对嗅觉的感知能力,展示了视觉数据在跨模态学习中的作用。

Comments Project website at https://smell.cs.columbia.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17709 2026-08-04 cs.LG cs.CR stat.ML

CEGA: A Cost-Effective Approach for Graph-Based Model Extraction and Acquisition

Zebin Wang, Menghan Lin, Bolin Shen, Ken Anderson, Molei Liu, Tianxi Cai, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) Harvard University(哈佛大学) Columbia University(哥伦比亚大学)

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML 2025), Proceedings of Machine Learning Research 267:63690-63706, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27017 2026-08-03 cs.LG cs.RO 版本更新

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18476 2026-08-03 stat.CO cs.AI cs.LG 版本更新

AI4BayesCode: From Natural Language Descriptions to Validated Modular Stateful Bayesian Samplers

AI4BayesCode: 从自然语言描述到经过验证的模块化状态性贝叶斯采样器

Jungang Zou, Alex Ziyu Jiang, Qixuan Chen

机构 * Department of Biostatistics, Columbia University(哥伦比亚大学生物统计学系)

AI总结 该研究提出AI4BayesCode系统,通过自然语言描述生成可运行且验证过的MCMC采样器,采用模块化设计和递归状态性编码范式,提升了贝叶斯模型的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14614 2026-07-31 cs.DS cs.LG 版本更新

Tight Bounds for Learning Polyhedra with a Margin

具有边距的多面体学习的紧界

Shyamal Patel, Santosh Vempala

机构 * Columbia University(哥伦比亚大学) Georgia Tech(佐治亚理工学院)

AI总结 本文提出了一种在误差ε内学习k个半空间交集的算法,时间复杂度为多项式乘以指数项,改进了以往工作并匹配了密码学和统计查询下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26178 2026-07-30 cs.CL 新提交

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25798 2026-07-29 cs.RO 新提交

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design

Transformer Transformer:一种用于运动条件机器人协同设计的统一模型

Huy Ha, C. Karen Liu, Shuran Song

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

AI总结 研究运动条件机器人协同设计问题,提出基于RoboTokens训练的Transformer Transformer统一模型,能跨实体空间和用例,通过动力学自引导优化设计,实验显示其可零样本优化,制造的优化设计大幅降低跟踪误差。

Comments 26 pages, 12 figures, 20 tables. Project page: https://transformer-transformer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25202 2026-07-29 cs.CL 新提交

A Cross-lingual Comparison of Human and Classification Model Entrainment Behavior in Code-switched Speech Settings

代码切换语音设置中人类与分类模型夹带行为的跨语言比较

Debasmita Bhattacharya, Siying Ding, Alayna Nguyen, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Instagram(照片墙)

AI总结 研究代码切换语音设置中人类与分类模型夹带行为,通过跨语言分析发现词汇夹带具普遍性,声学韵律等方面有语境差异,分类器能检测夹带但优先考虑的特征与人类不同,引入评估模型决策框架并提出对话代理发展挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25157 2026-07-29 cs.AI 新提交

PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention

PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Jesson Wang, Siheng Wang, Guang Yang, Haoyan Xu, Chenhao Wei, Zhengqing Yuan, Youran Shen, Yanfang Ye, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Stevens Institute of Technology(史蒂文斯理工学院) University of Notre Dame(圣母大学) Nanyang Technological University(南洋理工大学)

AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25136 2026-07-29 cs.AI 新提交

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加利福尼亚大学伯克利分校) City College of New York, CUNY(纽约市立大学城市学院) Stevens Institute of Technology(史蒂文斯理工学院) Nanyang Technological University(南洋理工大学)

AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27720 2026-07-29 cs.AI 版本更新

Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models

对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应

Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Columbia University, New York, USA(哥伦比亚大学) University of Michigan, Ann Arbor, USA(密歇根大学)

AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22954 2026-07-28 cs.CL stat.AP 新提交

Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

迈向电子健康记录中文档不一致性的自动检测

Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

机构 * Duke University(杜克大学) Columbia University Medical Center(哥伦比亚大学医学中心) Vanderbilt University Medical Center(范德堡大学医学中心)

AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22837 2026-07-28 cs.LG cs.AI cs.CL 新提交

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

通过对数偏差对语言模型进行极其简单的黑箱适应

Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究院) Columbia University(哥伦比亚大学)

AI总结 研究如何通过简单API级控制调整语言模型,开发黑箱方法学习对数偏差向量,无需修改模型权重或梯度,该方法在数学和推理基准上优于基础模型,是一种轻量级的语言模型适应机制。

Comments 36 pages, 4 figures, 6 tables. Appendix included. Code available at https://github.com/Ofek-Israeli/logit_bias_lm_adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31513 2026-07-28 cs.CV 版本更新

Personalize Your Large Vision-language Models With In-context Prompt Tuning

用上下文提示调优个性化你的大型视觉语言模型

Yanshu Li, Jiaqian Li, Kuai Yu, Xi Xiao, Dongfang Liu, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Purdue University(普渡大学) Rutgers University(罗格斯大学)

AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。

Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22901 2026-07-28 cs.LG 版本更新

Accelerating Frequency Domain Diffusion Models with Error-Feedback Event-Driven Caching

通过误差反馈事件驱动缓存加速频域扩散模型

Dong Liu, Yanxuan Yu, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Yale University(耶鲁大学) East China Normal University(华东师范大学) Columbia University(哥伦比亚大学)

AI总结 本文提出E²-CRF方法,利用频域扩散模型的频谱局部化和镜像对称性,通过事件驱动的残差动态实现自适应缓存,提升推理速度2.2倍并保持样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21702 2026-07-28 cs.CL cs.AI 版本更新

CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference

CSV-Decode: 可证的子词汇解码以实现高效的大型语言模型推理

Dong Liu, Shu Wang, Yanxuan Yu, Haisheng Wang, Ben Lengerich

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) College of Engineering, Columbia University(哥伦比亚大学工程学院) Department of Statistics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校统计学系)

AI总结 CSV-Decode通过构建子词汇表实现高效的大语言模型推理,提供精确的top-k认证和ε-认证的softmax近似,显著提升速度并保持分布保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09478 2026-07-28 cs.CV 版本更新

GazeLT: Visual attention-guided long-tailed disease classification in chest radiographs

GazeLT:胸部X光片中视觉注意力引导的长尾疾病分类

Moinak Bhattacharya, Gagandeep Singh, Shubham Jain, Prateek Prasanna

机构 * Department of Biomedical Informatics, Stony Brook University, NY, US(斯通比克大学生物医学信息学系) Department of Radiology, Columbia University, NY, US(哥伦比亚大学放射学系) Department of Computer Science, Stony Brook University, NY, US(斯通比克大学计算机科学系)

AI总结 研究针对胸部X光片中长尾疾病分类问题,提出GazeLT方法,通过整合和分解机制利用视觉搜索时间维度,在两个公开数据集上实验,其平均准确率超最佳长尾损失方法4.1%、基于视觉注意力基线方法21.7%。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://protect.checkpoint.com/v2/r01/___https://melba-journal.org/2026:020___.YzJ1OnN0b255YnJvb2s6YzpnOmI4YTI5YmRmZTQ0YjIxZjdhNzI0YWJhZDc5NDA0MzdhOjc6Njc3Nzo5YTc1NmVjZTg2MTcwMjA1MDI5NzM4MTczZGEwYTNkOWIwMTI3NDM2Yzg0MGU3ZmQxY2RmNmMyNDdmN2JkODExOnQ6VDpG

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19190 2026-07-27 cs.RO cs.AI 版本更新

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00024 2026-07-27 cs.CL cs.AI cs.CY 版本更新

WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics

WHBench:通过专家在环验证评估前沿大语言模型在女性健康主题上的表现

Sneha Maurya, Spandana Govindgari, Girish Kumar, Akhara AI

机构 * Columbia University(哥伦比亚大学) Rubric AI

AI总结 本文提出WHBench,通过专家设计的47个场景评估22个模型,揭示临床重要失败模式,强调安全性和公平性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19139 2026-07-27 cs.LG q-bio.NC 版本更新

Hierarchical Latent Structure Learning through Online Inference

通过在线推断学习层次化潜在结构

Ines Aitsahalia, Kiyohito Iigaya

机构 * Center for Theoretical Neuroscience and Zuckerman Institute(理论神经科学中心和Zuckerman研究所) Columbia University(哥伦比亚大学) Department of Psychiatry, Columbia University Irving Medical Center(精神病学系,哥伦比亚大学伊万杰琳医学中心) New York State Psychiatric Institute(纽约州精神医学研究所) Columbia Data Science Institute(哥伦比亚数据科学研究所)

AI总结 本文提出HOLMES模型,通过在线推断学习层次化潜在结构,实现了在序列数据中发现层次结构的可行计算框架。

Comments 4 figures, 5 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20914 2026-07-24 cs.LG cs.NI 新提交

Three-Pronged Spectral Control for Federated Parameter Efficient Fine Tuning

用于联邦参数高效微调的三叉戟频谱控制

Shiva Raj Pokhrel, Dipsan Bhattarai, Anwar Walid

机构 * School of IT, Deakin University(迪肯大学信息技术学院) Columbia University(哥伦比亚大学)

AI总结 研究针对联邦参数高效微调在非IID客户端异质性下的脆弱性,提出TRISHUL频谱控制框架,通过共享冻结多头低秩基、核范数近端收缩及非均匀分配适应头,提升了收敛性、稳定性和最终性能。

Comments 18 pages, 17 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20683 2026-07-24 cs.RO 新提交

FELT: Generating Tactile Signals from Vision for Visuo-Tactile Manipulation

FELT:从视觉生成触觉信号用于视觉触觉操纵

Zinan Li, Yiyang Ling, Yuming Gu, Binghao Huang, Chenhao Liang, Sharfin Islam, Hisham Bedri, John Chirikjian, Yunzhu Li, Stefanos Nikolaidis, Daniel Seita

机构 * Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) Columbia University(哥伦比亚大学) Starpilot(星航)

AI总结 研究针对触觉数据稀缺问题,提出FELT框架,利用视觉编码器和查询解码器从RGB观测合成触觉图像,通过单独分支解码左右传感器面板,实验表明该方法能提升策略成功率,潜在特征训练和部署无需真实触觉传感器。

Comments 26 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏