arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-20 至 2026-03-20 共收录 69 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14 篇

2603.10651 2026-03-20 cs.RO cs.AI 62%

Interleaving Scheduling and Motion Planning with Incremental Learning of Symbolic Space-Time Motion Abstractions

交织调度与运动规划的增量学习符号时空运动抽象

Elisa Tosello, Arthur Bit-Monnot, Davide Lusuardi, Alessandro Valentini, Andrea Micheli

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种交织调度与运动规划的增量学习框架,用于多物体共享空间的调度与运动规划,通过符号时空运动抽象提升复杂时空约束下的执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18447 2026-03-20 cs.DB cs.AI cs.CL cs.CV cs.IR 62%

SODIUM: From Open Web Data to Queryable Databases

SODIUM:从开放网络数据到可查询数据库

Chuxuan Hu, Philip Li, Maxwell Yang, Daniel Kang

机构 * UIUC(伊利诺伊大学香槟分校)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 研究针对需要整合多源网络数据的分析问题,提出SODIUM任务,通过系统化构建潜在数据库支持查询。开发SODIUM-Agent系统,采用ATP-BFS算法实现深度网络探索与结构化信息提取,准确率达91.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18218 2026-03-20 cs.CV cs.RO 62%

Semantic Segmentation and Depth Estimation for Real-Time Lunar Surface Mapping Using 3D Gaussian Splatting

基于3D高斯溅射的实时月球表面制图中的语义分割与深度估计

Guillem Casadesus Vila, Adam Dai, Grace Gao

机构 * Department of Aeronautics and Astronautics(航空航天系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种实时制图框架,结合密集感知模型与3D高斯溅射表示,在挑战性环境下实现高精度月球表面制图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18510 2026-03-20 cs.CV 57%

OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂

Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang

机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) VIVO BlueImage Lab(VIVO BlueImage实验室) HKUST(香港科技大学)

专题命中 具身导航 :robotic(abstract);分类 cs.CV

AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18326 2026-03-20 cs.LG 57%

Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration

摆脱离线悲观主义:用于安全前沿探索的向量场奖励塑造

Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici, Ness B. Shroff

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 本文提出向量场奖励塑造方法,通过梯度对齐和旋转向量项诱导持续安全前沿探索,验证了在连续导航任务中有效平衡安全与信息收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18705 2026-03-20 physics.app-ph 50%

Fueling Dynamics towards Tunable Liquid Metal Machine

为可调液态金属机器提供动力的动力学

Jingyi Li, Minghui Guo, Ju Wang, Xi Zhao, Jing Liu

专题命中 具身导航 :robotics(abstract)

AI总结 研究探讨了液态金属机器在受限空间中的动力学行为,揭示了燃料区域演变与末端障碍物相互作用对运动方向和可控性的影响,为自主机器人和运输系统提供理论基础。

Comments 24 pages, 6 figures. This article was submitted to Exploration in August 2025 and has been under review twice since then

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18360 2026-03-20 cs.IT eess.SP math.IT 50%

LEO-based Carrier-Phase Positioning for 6G: Design Insights and Comparison with GNSS

基于低轨卫星的载波相位定位用于6G:设计洞察与与GNSS的比较

Harish K. Dureppagari, Harikumar Krishnamurthy, Chiranjib Saha, Xiaofeng Wang, Alberto Rico-Alvariño, R. Michael Buehrer, Harpreet S. Dhillon

专题命中 具身导航 :navigation(abstract)

AI总结 本文研究了基于低轨卫星的NR-NTN系统联合时延和载波相位定位,提出双波形设计以实现鲁棒的载波相位跟踪,并展示LEO定位在几秒内达到厘米级精度,优于GNSS的米级精度。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05525 2026-03-20 physics.atom-ph physics.ins-det 50%

Real time synchronisation of a free-running atomic clock time base with UTC using GNSS signals for application in experimental physics

利用GNSS信号实时同步自由运行原子钟时间基准与UTC的应用于实验物理学

Claire Dalmazzone, Mathieu Guigue, Boris Popov, Stefano Russo, Vincent Voisin

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出利用GNSS信号实时校准自由运行原子钟时间基准与UTC,首次实现该方法,测试了两种原子钟并展示了在±15ns范围内的高精度同步。

Comments Soon to appear in Nuclear Instruments and Methods A

Journal ref Nucl. Instrum. Methods Phys. Res. A 1088 (2026) 171471

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 4 篇

2509.03636 2026-03-20 cs.AI cs.CL cs.LG 82%

CausalARC: Abstract Reasoning with Causal World Models

CausalARC:基于因果世界模型的抽象推理

Jacqueline Maasch, John Kalantari, Kia Khezeli

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 CausalARC通过因果世界模型进行低数据和分布外推理,结合原则性数据增强提供少量示例反馈,用于评估语言模型在抽象推理、反事实推理、程序合成和因果发现中的表现。

Comments Peer-reviewed workshop paper

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Bridging Language, Agent, and World Models (LAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18266 2026-03-20 cs.LG cs.AI 81%

Enactor: From Traffic Simulators to Surrogate World Models

Enactor:从交通模拟器到替代世界模型

Yash Ranjan, Rahul Sengupta, Anand Rangarajan, Sanjay Ranka

机构 * Department of CISE, University of Florida(佛罗里达大学计算机与信息科学系)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于transformer的生成模型,用于捕捉交通参与者间的复杂交互并生成物理一致的轨迹,通过模拟循环测试,展示了在长时间范围内优于传统方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08794 2026-03-20 cs.AI 79%

LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed

基于LLM的世界模型可以独立做出决策,但需要严谨的评估

Chang Yang, Xinrun Wang, Junzhe Jiang, Qinggang Zhang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文从决策视角出发,对基于LLM的世界模型进行综合评估,设计了政策验证、行动提案和政策规划三项任务,评估了GPT-4o和GPT-4o-mini在不同环境中的表现,发现LLM世界模型在长期决策任务中性能下降,且不同功能组合会引入额外的不稳定性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19219 2026-03-20 cs.CV cs.LG 62%

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2603.19131 2026-03-20 cs.LG cs.RO 73%

From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models

从推理效率到具身效率:重新审视视觉-语言-动作模型的效率指标

Zhuofan Li, Hongkun Yang, Zhenyang Chen, Yangxuan Chen, Yingyan, Lin, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港理工大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人基础模型 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文重新审视视觉-语言-动作模型的效率指标,发现传统参数、FLOPs或token解码吞吐量无法反映机器人平台的实际表现,提出具身效率指标如任务完成时间、轨迹平滑度等,揭示传统方法在具身效率上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18342 2026-03-20 cs.RO cs.AI cs.LG 67%

Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model

将不确定性移至关键时刻:面向VLA模型可靠不确定性的量化

Yanchuan Tang, Taowen Wang, Yuefei Chen, Boxuan Zhang, Qiang Guan, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Kent State University(肯特州立大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出统一的不确定性量化方法,通过最大值滑动窗口池化保留瞬时风险信号,结合运动感知稳定性加权强调不稳定行为的高频动作振荡,并通过贝叶斯优化进行DOF自适应校准,提升失败预测准确性和故障检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2603.18784 2026-03-20 cs.RO 57%

ViTac-Tracing: Visual-Tactile Imitation Learning of Deformable Object Tracing

ViTac-Tracing:变形物体追踪的视觉-触觉模仿学习

Yongqiang Zhao, Haining Luo, Yupeng Wang, Emmanouil Spyrakos Papastavridis, Yiannis Demiris, Shan Luo

机构 * Robot Perception Laboratory, Department of Engineering, King’s College London(机器人感知实验室,工程系,伦敦国王学院) Personal Robotics Laboratory, Department of Electrical and Electronic Engineering, Imperial College London(个人机器人实验室,电子与电气工程系,伦敦帝国学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种视觉-触觉模仿学习方法,实现变形物体的一维和二维追踪。通过局部和全局视角结合视觉与触觉感知,提升细粒度调整并优化任务进度,实验表明在多种变形物体上达到80%和65%的成功率。

Comments The paper has been accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 57%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 3 篇

2603.18130 2026-03-20 cs.RO cs.AI 84%

Final Report for the Workshop on Robotics & AI in Medicine

医学领域机器人与人工智能研讨会最终报告

Juan P Wachs

专题命中 人机交互与遥操作 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研讨会聚焦医疗领域机器人与AI的协同发展,强调数据获取、评估方法标准化及跨学科培训的重要性,提出建立国家AI与机器人卓越中心的迫切需求。

Comments 51 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18520 2026-03-20 cs.RO 83%

Robotic Agentic Platform for Intelligent Electric Vehicle Disassembly

智能电动汽车拆解机器人平台

Zachary Allen, Max Conway, Lyle Antieau, Allen Ponraj, Nikolaus Correll

机构 * Department of Computer Science, University of Colorado, Boulder(科罗拉多大学博尔德分校计算机科学系)

专题命中 人机交互与遥操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出RAPID平台,通过感知驱动操作、灵活自动化和AI辅助机器人编程,解决电动汽车电池包拆解的自动化问题,实验评估了三种快拆策略并引入代理AI规范以提升人机协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18354 2026-03-20 cs.RO 57%

Multi-material Direct Ink Writing and Embroidery for Stretchable Wearable Sensors

多材料直接墨水书写与刺绣用于可拉伸可穿戴传感器

Lukas Cha, Ryman Hashem, Ria Prakash, Tanguy Declety, Wenze Zhang, Liang He

机构 * Institute of Biomedical Engineering, University of Oxford, UK(生物医学工程研究所,牛津大学,英国) The Podium Institute for Sports Medicine and Technology, University of Oxford, UK(体育医学与技术研究所,牛津大学,英国) École Polytechnique Fédérale de Lausanne, Switzerland(洛桑联邦理工学院,瑞士)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种纺织品兼容的制造流程,结合多材料直接墨水书写与自动化刺绣,实现可拉伸应变传感器直接嵌入服装中,展示出高达120%的拉伸性能和线性响应特性,适用于运动捕捉和柔性机器人应用。

Comments 6 pages, 8 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 16 篇

2603.18811 2026-03-20 cs.RO 83%

V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors

V-Dreamer:通过视频生成先验自动机器人仿真与轨迹合成

Songjia He, Zixuan Chen, Hongyu Ding, Dian Shao, Jieqi Shi, Chenxu Li, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Northwestern Polytechnical University(西北工业大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 V-Dreamer通过视频生成先验自动构建仿真环境和可执行轨迹,利用大语言模型和3D生成模型生成物理合理的3D场景,并通过Sim-to-Gen模块实现高效轨迹合成。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16344 2026-03-20 cs.RO cs.AI 81%

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19166 2026-03-20 cs.RO cs.AI cs.CL cs.CV cs.LG 79%

Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation

含义与测量:多智能体概率性视觉语言导航

Swagat Padhan, Lakshya Jain, Bhavya Minesh Shah, Omkar Patil, Thao Nguyen, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学) Haverford College(哈弗福德学院)

专题命中 机器人数据与评测 :navigation(title);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出MAPG框架,通过分解语言查询并利用VLM进行语义 grounding,解决复杂度量-语义语言查询的难题,同时引入MAPG-Bench评估指标,展示在现实机器人中的应用效果。

Comments Equal contribution: Swagat Padhan and Lakshya Jain, 9 pages, 6 figures, paper website: https://lakshya-asu.github.io/Meanings-Measurements-Multi-Agent-Probabilistic-Grounding/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09109 2026-03-20 cs.RO cs.CV 73%

FoldNet: Learning Generalizable Closed-Loop Policy for Garment Folding via Keypoint-Driven Asset and Demonstration Synthesis

FoldNet:通过关键点驱动的资产和演示合成学习通用的闭环策略用于服装折叠

Yuxing Chen, Bowen Xiao, He Wang

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种合成服装数据集,通过关键点驱动的资产和演示合成,学习通用的服装折叠闭环策略,提升现实世界成功率25%。

Comments Project: https://pku-epic.github.io/FoldNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19074 2026-03-20 cs.RO cs.AI 62%

CAMO: A Conditional Neural Solver for the Multi-objective Multiple Traveling Salesman Problem

CAMO:一种用于多目标多旅行商问题的条件神经求解器

Fengxiaoxiao Li, Xiao Mao, Mingfeng Fan, Yifeng Zhang, Yi Li, Tanishq Duhan, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) China Unicom Shenzhen Branch(中国unicom深圳分公司) Central South University(中南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 CAMO提出一种条件神经求解器,解决多目标多旅行商问题,通过融合偏好和协作解码器实现多目标权衡,实验显示其在求解帕累托前沿方面表现优异。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 62%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18623 2026-03-20 cs.CV cs.AI 62%

OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data

OpenT2M:无花车运动生成:开源、大规模、高质量数据

Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu

机构 * CASIA(中国科学院自动化研究所) UCAS(乌拉尔联邦大学) BAAI(北京人工智能研究院) RUC(哈尔滨工业大学) PKU(北京大学) BeingBeyond

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 OpenT2M通过大规模高质量开源数据提升文本到运动生成的泛化能力,引入2D-PRQ运动分词器实现高效运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18034 2026-03-20 cs.CR cs.AI cs.LG 62%

Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems

语义变色龙:RAG系统中依赖语料库的污染攻击与防御

Scott Thornton

机构 * Independent Researcher(独立研究者)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究RAG系统中依赖语料库的污染攻击与防御,提出双文档污染攻击方法并评估混合检索防御效果,展示混合检索能有效降低攻击成功率。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02861 2026-03-20 cs.CV cs.AI cs.GR 62%

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

LiteReality:从RGB-D扫描生成图形-ready的3D场景重建

Zhening Huang, Xiaoyang Wu, Fangcheng Zhong, Hengshuang Zhao, Matthias Nießner, Joan Lasenby

机构 * University of Cambridge(剑桥大学) The University of Hong Kong(香港大学) Technical University of Munich(慕尼黑技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 LiteReality通过结构化场景图解析扫描数据,生成紧凑且逼真的3D虚拟场景,支持图形管线所需的关键特性,适用于AR/VR、游戏、机器人和数字孪生等应用。

Comments Project Page: https://litereality.github.io; Video: https://www.youtube.com/watch?v=ecK9m3LXg2c&feature=youtu.be Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10488 2026-03-20 cs.CV cs.AI cs.GR 62%

SVGBuilder: Component-Based Colored SVG Generation with Text-Guided Autoregressive Transformers

SVGBuilder:基于组件的带颜色SVG生成与文本引导自回归变换

Zehao Chen, Rong Pan

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 SVGBuilder基于组件的文本引导自回归变换生成高质量彩色SVG,显著降低计算开销,提升效率,引入ColorSVG-100K数据集提升模型多样性与颜色信息。

Comments Accepted by AAAI 2025. Project: https://svgbuilder.github.io

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39(3), 2358-2366

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19204 2026-03-20 cs.LG 57%

Robustness, Cost, and Attack-Surface Concentration in Phishing Detection

在钓鱼检测中的鲁棒性、成本和攻击面集中

Julian Allagan, Mohamed Elbakary, Zohreh Safari, Weizheng Gao, Gabrielle Morgan, Essence Morgan, Vladimir Deriglazov

机构 * Department of Mathematics, Computer Science, and Engineering Technology(数学、计算机科学与工程技术系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究通过成本感知逃避框架分析钓鱼检测中鲁棒性与攻击面集中问题,发现特征限制仅在移除主导低成本转换时提升鲁棒性,且攻击面集中于低成本特征。

Comments 14 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏