arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 366 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 366 篇

2608.06939 2026-08-11 cs.CV 版本更新 50%

Degradation-Aware Prompt Learning with Cross-Modal Compensation for Adverse Weather Removal

面向恶劣天气去除的退化感知跨模态补偿提示学习

Wanshu Fan, Yunzhe Zhang, Yue Shen, Liyan Wang, Jing Qin, Kin-Man Lam, Cong Wang, Jinshan Pan

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) The Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加利福尼亚大学旧金山分校) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 其他LLM :language model(abstract)

AI总结 该研究针对恶劣天气导致图像退化影响视觉系统可靠性的问题,提出 DCMPC-Net 模型,通过跨模态提示补偿实现鲁棒的恶劣天气图像修复,性能优于现有最先进方法。

Comments Accepted for publication in IEEE Transactions on Image Processing. The code is available at: https://github.com/fanamber831/DCMPC-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新 50%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 其他LLM :language model(abstract)

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01905 2026-08-07 cs.CV 版本更新 50%

PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph

PhotoHOI:从单张RGB照片合成3D手-物体交互

Zhenhao Zhang, Jiajun Zhang, Wei Min, Yebin Liu

专题命中 其他LLM :language model(abstract)

AI总结 PhotoHOI从单张RGB照片与开放词汇指令合成3D手-物体交互,通过视觉-语言模型解析任务规格、规划碰撞感知轨迹、学习接触与抓取先验,在GRAB、H2O数据集及真实照片上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03474 2026-08-07 cs.SE 版本更新 50%

From Absolute to Relative Code Comprehensibility Prediction

从绝对代码可理解性预测到相对代码可理解性预测

Nadeeshan De Silva, Martin Kellogg, Oscar Chaparro

专题命中 其他LLM :LLM(abstract_cn)

AI总结 该研究针对现有绝对代码可理解性预测模型表现不佳的问题,提出相对可理解性预测任务,通过实验证明其在多数配置下优于基线模型,且受从业者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12715 2026-08-05 cs.CV 版本更新 50%

VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection

VLC Fusion:面向鲁棒目标检测的视觉-语言条件传感器融合

Aditya Taparia, Noel Ngu, Mario Leiva, Joshua Shay Kricheli, John Corcoran, Nathaniel D. Bastian, Gerardo Simari, Paulo Shakarian, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学) Department of Computer Science and Engineering, Universidad Nacional del Sur and Institute for Computer Science and Engineering(计算机科学与工程系,国家南方大学和计算机科学与工程研究所) U.S. Department of Defense(美国国防部) United States Military Academy(美国军事学院) Syracuse University(雪城大学)

专题命中 其他LLM :language model(abstract)

AI总结 本文提出VLC Fusion视觉-语言条件传感器融合框架,利用VLM捕捉环境线索动态调整模态权重,在多传感器融合目标检测任务中,于自动驾驶与军事目标数据集上较传统方法实现更优性能。

Comments 27 pages, 20 figures, Accepted for presentation at ECML PKDD 2026, Shortlisted for the Best Research Track Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03434 2026-08-04 hep-th gr-qc nlin.CD 版本更新 50%

Berry Picking: Random Wave Chaos Hierarchy for BPS Microstate Geometries

Berry采摘:BPS微观态几何的随机波混沌层次结构

Vladan Djukić, Milica Stepanović, Mihailo Čubrović

专题命中 其他LLM :LLM(abstract_cn)

AI总结 研究不同超引力背景下探测波与测地线的混沌强度,发现波混沌随超对称减少和喉道变长变强,测地线运动则相反,还通过相关测试及计算解释二者差异,指出BPS混沌层次在体和场论中作用不同。

Comments 40 pages, 9 figures; this version: additional explanations in section 5, improved figures, additional discussion in section 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28568 2026-08-04 cs.CV 版本更新 50%

XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs

XSPA:构建不可察觉的X形稀疏对抗扰动以对视觉语言模型的可迁移攻击

Chengyin Hu, Jiaju Han, Xuemeng Sun, Qike Zhang, Luwei Yang, Lehan Sun, Jiahuan Long, Yiwei Wei, Jiujiang Guo

专题命中 其他LLM :language model(abstract)

AI总结 本文提出XSPA攻击,通过限制扰动为两条相交对角线,测试VLMs在稀疏扰动下的鲁棒性,实验表明其能显著破坏跨任务语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25129 2026-08-04 cs.CV 版本更新 50%

AirSplat: Alignment and Rating for Robust Feed-Forward 3D Gaussian Splatting

AirSplat:基于鲁棒前馈3D高斯散射的对齐与评分

Minh-Quan Viet Bui, Jaeho Moon, Munchurl Kim

机构 * KAIST(韩国科学技术院)

专题命中 其他LLM :foundation model(abstract)

AI总结 本文提出AirSplat框架,通过自一致性姿态对齐和基于评分的透明度匹配技术,提升无姿态视角合成的重建质量。

Comments Project page: https://kaist-viclab.github.io/airsplat-site, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18545 2026-08-04 cond-mat.dis-nn cond-mat.stat-mech cond-mat.str-el quant-ph 版本更新 50%

Large deviations in the many-body localization transition: The case of the random-field XXZ chain

多体局域化转变中的大偏差:随机场XXZ链的情况

Greivin Alfaro Miranda, Fabien Alet, Giulio Biroli, Leticia F. Cugliandolo, Nicolas Laflorencie, Marco Tarzia

专题命中 其他LLM :prompting(abstract)

AI总结 本研究针对随机场XXZ自旋链,采用平均场无序玻璃态系统类比方法,识别多体局域化转变的三个区域,推导有限大小相图,揭示有限尺寸下MBL相失稳源于罕见短程共振路径。

Comments Updated published version. Implemented corrections from the referees with the improvement of some of the Figures

Journal ref Phys. Rev. B 114, 014210 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03697 2026-08-04 eess.AS 版本更新 50%

Improving ASR Fairness for Cleft Lip and Palate Speech: A Study on Severity-Aware Data Mixing

改善唇腭裂语音的自动语音识别公平性:一项关于严重程度感知数据混合的研究

Susmita Bhattacharjee, Jagabandhu Mishra, H. S. Shekhawat, Ravi Jasuja, S. R. Mahadeva Prasanna

专题命中 其他LLM :foundation model(abstract)

AI总结 该研究针对唇腭裂(CLP)语音的ASR公平性问题,提出严重程度感知的CLP与正常语音混合策略,在AIISH和NMCPC数据集上使GMM-HMM、Whisper等模型的词错误率显著降低,提升了ASR公平性。

Comments Submitted to Speech Communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03827 2026-08-04 stat.AP 版本更新 50%

Equity in Focus : Investigating Gender Disparities in Glioblastoma via Propensity Score Matching

聚焦公平性:通过倾向得分匹配研究胶质母细胞瘤中的性别差异

Solomon Eshun

专题命中 其他LLM :prompting(abstract)

AI总结 本研究采用倾向得分匹配(PSM)分析癌症基因组图谱(TCGA)数据,发现调整混杂因素后男性胶质母细胞瘤(GBM)发病率高于女性,为性别公平性及针对性治疗提供依据。

Comments This preprint is withdrawn because the scope and direction of this research have changed substantially, and the current version is no longer representative of the work the author intends to disseminate

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25416 2026-08-03 cs.CY 版本更新 50%

The Traffickers' Pitch: Detecting Deceptive Recruitment in Online Job Boards

人贩子的推销:检测在线招聘平台中的欺骗性招聘

Siyi Zhou, Peiran Qiu, Tanishq Salkar, Leonardo Blas Urrutia, Dacheng Shen, Nora Adadurova, Deyang Hsu, Eun Cheol Choi, Emilio Ferrara

专题命中 其他LLM :language model(abstract)

AI总结 提出一个计算框架,通过语言特征识别人口贩卖招募者并分析其在线招聘模式,利用网络驱动标注方法构建风险招聘广告的真实数据,并基于语言差异设计多模型集成分类器提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22799 2026-07-29 physics.flu-dyn 版本更新 50%

Theory and simulation of elastoinertial rectification of oscillatory flows in two-dimensional deformable rectangular channels

二维可变形矩形通道中振荡流弹性惯性整流的理论与模拟

Uday M. Rade, Shrihari D. Pande, Ivan C. Christov

专题命中 其他LLM :foundation model(abstract)

AI总结 研究二维可变形矩形通道中振荡流的弹性惯性整流机制,通过理论与数值模拟探讨流体-结构相互作用对压力和变形的影响,分析无量纲数对循环平均压力的作用。

Comments 25 pages, 13 figures; v2: major revision of theory, all simulations re-ran with compressible neo-Hookean model; v3: minor updates, accepted for publication in Physical Review Fluids

Journal ref Phys. Rev. Fluids 11 (2026) 074102

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15469 2026-07-28 cs.CV 版本更新 50%

Mamba-CL: Optimizing Selective State Space Model in Null Space for Continual Learning

Mamba-CL:在零空间中优化选择性状态空间模型用于持续学习

De Cheng, Yue Lu, Lingfeng He, Shizhou Zhang, Xi Yang, Nannan Wang, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Northwestern Polytechnical University(西北工业大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 研究针对持续学习中灾难性遗忘问题,提出Mamba-CL框架,通过更新与先前任务特征子空间正交的参数微调曼巴模型核心,推导一致性约束并应用零空间投影,经实验验证该方法在抗遗忘方面优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11957 2026-07-27 cs.CV 版本更新 50%

Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity

基于VLM描述比较的异常帧检测,用于提取特定专家操作和具有视频内自相似性的上下文决策场景

Ryo Sakai, Kaname Yokoyama

专题命中 其他LLM :language model(abstract)

AI总结 本文针对关键基础设施维护中专家知识传承问题,提出基于VLM描述比较检测异常帧的方法,可提取特定专家操作及上下文决策场景,在模拟实验中该方法的提取率高于传统方法,有效发现含专家知识的候选场景。

Comments 17 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13924 2026-07-21 cs.HC 版本更新 50%

ExpressionCueLens: A Cross-Cultural Analysis of Human-AI Companion Conversations on Social Media

表情线索透镜:社交媒体上人类与人工智能伴侣对话的跨文化分析

Lynnette Hui Xian Ng, Yunze Xiao, Lionel Z. Wang, Weihao Xuan, Mona Diab

专题命中 其他LLM :LLM(abstract)

AI总结 研究社交媒体上人类与人工智能伴侣对话,引入表情线索透镜框架,将语言等线索归为十类。通过分析约3500篇Reddit和小红书帖子发现,文化和平台规范影响对陪伴智能体的认知,为具文化敏感性的智能体设计提供启示。

Comments Accepted at Journal of Ambient Intelligence and Humanized Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30534 2026-07-20 cs.CV 版本更新 50%

Orca: The World is in Your Mind

Orca: 世界在你心中

Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao, Huaihai Lyu, Senwei Xie, Euan Liu, Klara Tian, Tianfeng Long, Yichi Zhang, Zhengliang Cai, Ruike Chen, Jifan Zhao, Ruochuan Shi, Zihan Tang, Jing Lyu, Wenxing Tan, Ningbo Zhang, Yangtao Hu, Yuming Gao, Xiansheng Chen, Junkai Zhao, Congsheng Xu, Boan Zhu, Ziqi Wang, Yupu Feng, Qiongqiong Zhang, Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men, Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng, Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan Wang, Pengwei Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出Orca通用世界基础模型,通过无意识学习和有意识学习两种互补范式,从多模态世界信号中学习统一的世界潜在空间,并支持文本生成、图像预测和具身动作生成等下游任务。

Comments Project page: https://orca-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11999 2026-07-16 cs.CY 版本更新 50%

Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack

承保智能体经济:人工智能保险堆栈蓝图

Cristian Trout, Sanmi Koyejo, Sasha Romanosky, Giorgio Ripamonti, Lynn Thompson, Desiree Spain, Alex Taylor, Kevin Casey, Stephen Casper, Matthew Botvinick, Sean McGregor, Miles Brundage, A. Feder Cooper, Patricia Paskov, Adrien Ecoffet, Ben Bucknall, Kevin Wei, Markus Anderljung, Lukasz Szpruch, Bri Treece, Tom Zick, Gabriel Weil, Ugur Ozer, Kevin Kalinich, Jesus Gonzalez, Vitaly Baranov, Moran Koren, Guy Laban, Gil Arazi, Henri Winand, Derek Blum, Toby Clowes, Adam Kleinman, Anita Srinivasan, Tom Fehring, Rune Kvist, Rajiv Dattani

专题命中 其他LLM :foundation model(abstract)

AI总结 研究人工智能智能体经济下保险面临的风险及可保性问题,提出构建含八个组件的人工智能保险堆栈,通过行业协调实现限额承保,还探讨了前沿人工智能灾难性风险承保及所需工具,以助保险公司管理相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06256 2026-07-16 cs.RO 版本更新 50%

Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition

诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败

Ke Rui, Yushen Zuo, Jiawei Wang, Haoran Jia, Jinming Ma, Weitao Zhou, Minglei Li

机构 * SimpleAI

专题命中 其他LLM :language model(abstract)

AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。

Journal ref RSS SemRob Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10607 2026-07-16 cs.CV 版本更新 50%

Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation

跟踪并描述任何运动:通过轨迹条件生成实现开放词汇时空字幕

Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 其他LLM :language model(abstract)

AI总结 研究提出TCAM框架,无需文本查询和区域提示,通过字幕感知重采样器在点粒度结合跟踪与语言,用现有分割注释训练,能描述视频中运动、定位时间及轨迹,优于密集视频字幕基线,匹配相关方法,为运动驱动视频理解提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16701 2026-07-15 cs.SE 版本更新 50%

What's Inside a GitHub Repository? An Empirical Study on the Contents of 10K Projects

GitHub仓库中有什么?对10000个项目内容的实证研究

Andre Hora, João Eduardo Montandon, Diego Elias Costa

专题命中 其他LLM :LLM(abstract_cn)

AI总结 本文通过分析10000个GitHub仓库的文件和目录,揭示了过去十年仓库内容的变化,包括README.md标准化、GitHub Actions兴起、配置格式演变及生成式AI相关内容的增长。

Comments Paper accepted to ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19632 2026-07-15 cs.CV 版本更新 50%

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

CreatiParser: 从位图图形设计生成可编辑的图层

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ByteDance Intelligent Creation(字节跳动智能创作) School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 其他LLM :language model(abstract)

AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09925 2026-07-15 cs.CV 版本更新 50%

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS:基于高斯的稀疏多视图捕获逆渲染

Patrick Noras, Jun Myeong Choi, Didier Stricker, Pieter Peers, Roni Sengupta

机构 * University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) College of William & Mary(威廉与玛丽学院)

专题命中 其他LLM :foundation model(abstract)

AI总结 研究针对稀疏视图设置下基于高斯的逆渲染精度下降问题,提出GAINS两阶段逆渲染框架,利用基础模型先验稳定几何和材质估计,经实验验证其在提升材质参数精度等方面效果显著,尤其在稀疏视图下优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06186 2026-07-14 cs.RO 版本更新 50%

Calf-Integrated Arms for Bimanual Quadruped Loco-Manipulation

用于双足四足运动操纵的小腿集成手臂

Yan Pan, Yuanchuan Ren, Chipui Chan, Jingcheng Sun, Chengxu Zhou

机构 * University College London(伦敦大学学院)

专题命中 其他LLM :language model(abstract)

AI总结 研究双足四足运动操纵设计权衡问题,核心方法是将特定操纵器集成到前小腿,实现双手地面操纵且四足着地、基座可行走,借助视觉语言模型排序技能,模拟中完成三项双手任务。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23481 2026-07-14 physics.flu-dyn 版本更新 50%

Continuity equations in the Generalised Lagrangian Mean theory

广义拉格朗日平均理论中的连续性方程

Vladimir A. Vladimirov

专题命中 其他LLM :prompting(abstract)

AI总结 本文在广义拉格朗日平均理论框架下,研究连续性方程的形式及其有效性条件,通过引入兼容性方程,将McIntyre-Andrews变换推广至任意流体运动。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06223 2026-07-10 cs.SE 版本更新 50%

Scaling Mobile Chaos Testing with AI-Driven Test Execution

通过人工智能驱动的测试执行扩展移动混沌测试

Juan Marcano, Ashish Samant, Kai Song, Lingchao Chen, Kaelan Mikowicz, Tim Smyth, Mengdie Zhang, Ali Zamani, Arturo Bravo Rovirosa, Sowjanya Puligadda, Srikanth Prodduturi, Mayank Bansal

专题命中 其他LLM :LLM(abstract)

AI总结 研究大规模分布式系统中移动应用易受后端服务故障影响的问题,核心方法是将DragonCrawl与uHavoc集成实现人工智能驱动的测试执行,主要贡献是识别风险、缩短调试时间,证明在生产规模实现移动弹性验证可行。

Comments 10 pages of content, 1 page of citations, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12558 2026-07-09 physics.soc-ph 版本更新 50%

Involution game with migration and spatial heterogeneity of social resources

自反游戏与迁移及社会资源空间异质性

Bo Li, Qiwen Ge, Yong Shi

专题命中 其他LLM :prompting(abstract)

AI总结 本文提出一个包含 agent 迁移和资源分布空间异质性的自反博弈模型,探讨迁移和资源分配条件对自反动态的影响,发现总资源恒定时相似资源水平抑制自反,而总资源增加会加剧自反,并识别努力比和效用乘数的阈值效应。

Comments 20 pages, 7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12937 2026-07-03 cs.CV 版本更新 50%

SGMatch: Semantic-Guided Non-Rigid Shape Matching with Flow Regularization

SGMatch: 基于语义引导与流正则化的非刚性形状匹配

Tianwei Ye, Xiaoguang Mei, Yifan Xia, Fan Fan, Jun Huang, Jiayi Ma

机构 * Wuhan University(武汉大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出SGMatch框架,通过融合视觉基础模型的语义特征和条件流匹配正则化,解决非等距变形和拓扑噪声下的非刚性3D形状匹配问题。

Comments 29 pages, 13 figures, 17 tables. Project Page: https://yetianwei.github.io/SGMatch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18368 2026-07-03 cs.RO 版本更新 50%

Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation

学习多任务机器人操作的语义原子技能

Yihang Zhu, Weiqing Wang, Shijie Wu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 其他LLM :language model(abstract)

AI总结 提出AtomSkill框架,通过语义对比对齐和关键姿态想象,从演示中学习可重用原子技能,实现多任务机器人操作,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新 50%

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 其他LLM :prompting(abstract)

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏