arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2597 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 196 篇

2608.00371 2026-08-04 cs.CV 新提交 57%

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29235 2026-08-03 cs.RO cs.AI cs.SY eess.SY 新提交 57%

FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution

FBFM:一种用于世界-动作模型执行中流匹配的无训练异步反馈机制

Peize Li, Ruimeng Zhang, Ru Zhang, Cong Huang, Kai Chen, Shanghang Zhang

机构 * Peking University(北京大学) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 该研究针对世界-动作模型分块反馈时间粒度粗、无法逐时间步纠错的问题,提出无训练异步反馈机制FBFM,在两类WAM上使LIBERO等任务成功率提升超5%,实现开环流生成与闭环真实世界动力学的桥接。

Comments 29 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-03 cs.HC cs.AI 新提交 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26579 2026-07-30 cs.RO cs.CV 新提交 57%

ContactFlow: A video action conditioning that transfers across embodiments

ContactFlow:一种可跨 embodiment 迁移的视频动作条件模型

Sami Azirar, Enrico Pallotta, Jan Nogga, Jürgen Gall, Sven Behnke, Hermann Blum

机构 * University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 Contact Flow 是一种与 embodiment 无关的动作表示,可跨人类演示与不同机器人 embodiment 迁移,用于构建能预测合理操纵结果的世界模型,集成到 pipeline 后在相关任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22798 2026-07-28 cs.SE cs.CV 新提交 57%

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

StateAct:在像素之前的程序状态,用于长期计算机使用代理

Yan Yang, Xiangru Jian, Ziyang Luo, Zirui Zhao, Yutong Dai, Ziji Shi, Hanshu Yan, Jun Hao Liew, Silvio Savarese, Junnan Li

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 研究针对计算机使用代理,提出基于程序状态的StateAct多代理框架,主要代理用代码处理状态,GUI子代理辅助,支持验证,在OSWorld 2.0上提升了Claude Opus 4.8的成功率,且成本降低,实现从感知到推理的瓶颈转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20926 2026-07-24 cs.AI 新提交 57%

SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration

SciExplore:评估从科学导航到信息整合的自主智能体

Yinhao Tang, Youqing Fang, Yanan Sun, Wenran Liu, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 介绍用于评估大语言模型和智能体科学信息检索与推理能力的基准SciExplore,包含四类任务,在其上评估多个先进模型和智能体,发现随着任务复杂度增加性能差距大,凸显当前模型在实际科学信息检索场景中的局限。

Comments 25 pages, 13 figures. Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14443 2026-07-17 cs.AI 新提交 57%

Tactile: Giving Computer-Using Agents Hands and Feet

触觉:赋予使用计算机的智能体双手和双脚

Yong Liu, Zhenyi Zhong, Zhanpeng Shi

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 研究针对计算机使用智能体操作层脆弱的问题,提出开源工具Tactile,将异构UI证据转换为基于动作的接口状态,通过特定循环操作。在相关任务中能提升Codex Success@100,证明可靠计算机使用需更强模型及可重用执行基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14280 2026-07-17 cs.RO cs.LG 新提交 57%

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

DiMaS:用于引导视觉-语言-动作模型的分布匹配

Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

机构 * ISIR, Sorbonne Université(法国国家信息与自动化研究所,索邦大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 研究针对基于流匹配的视觉-语言-动作模型细粒度行为控制不足的问题,提出DiMaS分布匹配引导策略,能有效控制行为,研究其泛化性并分析原因,推动了视觉运动设置下的分布匹配设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 57%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09042 2026-07-13 cs.LG 新提交 57%

Learning More from Less: Reinforcement Learning from Hindsight

从更少中学习更多:事后诸葛亮式强化学习

Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交 57%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10522 2026-07-07 cs.CV 新提交 57%

GUI-AC: Enhancing Continual Learning in GUI Agents

GUI-AC:增强GUI代理的持续学习能力

Can Lin, Tao Feng, Hangjie Yuan, Dan Zhang, Yifan Zhu, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 针对GUI代理在持续学习中的分布漂移和强化微调不稳定性问题,提出GUI-AC方法,通过自适应优势和动态裁剪机制提升性能,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 57%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25298 2026-06-25 cs.CV 新提交 57%

KidRisk: Benchmark Dataset for Children Dangerous Action Recognition

KidRisk:儿童危险动作识别基准数据集

Minh-Kha Nguyen, Trung-Hieu Do, Kim Anh Phung, Thao Thi Phuong Dao, Minh-Triet Tran, Trung-Nghia Le

机构 * Thong Nhat Hospital(统一医院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 构建包含2500个短视频和10000张图像的儿童危险动作数据集KidRisk,提出基于视觉语言模型的方法,在动作分类和危险识别上分别达到83.53%和96.14%的准确率。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交 57%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 57%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23565 2026-06-23 cs.RO cs.CV 新提交 57%

HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory

HoloAgent-0:具有3D空间记忆的统一具身智能体框架

Xiaolin Zhou, Liu Liu, Tingyang Xiao, Wei Feng, Fa Fu, Xinrui Meng, Xinjie Wang, Jialiang Han, Boyang Yu, Yun Du, Wei Sui, Zhizhong Su

机构 * Horizon Robotics D-Robotics Robotics

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 提出HoloAgent-0统一框架,通过三层耦合结构(具身AgentOS、3D空间记忆、具身技能)实现真实机器人闭环执行,在长程导航、跨机器人协调等任务上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 57%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17871 2026-06-17 cs.AI 新提交 57%

StepGuard: Guarding Web Navigation via Single-Step Calibration

StepGuard: 通过单步校准保护网页导航

Zhihao Cui, Yuchen Zhang, Xiyang Sun, Yaxiong Wang, Li Zhu, Jinpeng Hu, Liu Liu, Mengjia Li, Yujiao Wu

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Xiamen University(厦门大学) Zhejiang Lab(之江实验室) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 针对网页导航中单步脆弱性问题,提出StepGuard框架,通过动态双策略优化(DDPO)解决奖励冲突,并利用置信度引导的自适应导航反射(CANR)校准单步误差,显著提升导航与答案准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16802 2026-06-16 cs.AI 新提交 57%

LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control

LabOSBench: 科学仪器控制的计算机使用智能体基准测试

Anqi Zou, Han Deng, Chengyu Zhang, Junquan Hu, Yu Wang, Yuxiang Xing, Aokai Zhang, Hanling Zhang, Zhaoyang Liu, Ben Fei, Zhihui Wang, Wanli Ouyang

机构 * Shenzhen Loop Area Institute(深圳河套学院) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 提出LabOSBench基准,基于Web科学仪器模拟器评估多模态GUI智能体在仪器控制中的表现,揭示现有智能体在反馈驱动操作和长流程执行上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12978 2026-06-16 cs.RO cs.CV cs.SY eess.SY 新提交 57%

Trajectory-Level Redirection Attacks on Vision-Language-Action Models

轨迹级重定向攻击对视觉-语言-动作模型

Gokul Puthumanaillam, Vardhan Dongre, Pranay Thangeda, Hooshang Nayyeri, Dilek Hakkani-Tür, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文发现VLA模型存在轨迹级漏洞:看似保留原始指令的对抗性提示,能重定向机器人最终物理结果,并提出了命令保持的轨迹重定向威胁模型和在线提示搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14106 2026-06-15 cs.MA cs.CV 新提交 57%

Naive Visual Memory is Not Enough: A Failure-Mode Study of GUI Agents

朴素视觉记忆不足:GUI代理的失败模式研究

Seoyoung Choi, Minseok Ko, Hyunseok Lee, Kunwoong Kim, Woomin Song, Chanseok Jeon, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出动作锚定视觉记忆(AGMem),通过存储与成功动作相关的局部GUI区域图像而非全屏截图,减少GUI代理中的动作级错误,在OSWorld上将任务成功率提升33.3%。

Comments 9 pages, 5 figures, ICML 2026 WORKSHOP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13949 2026-06-15 cs.AI 新提交 57%

Minim: Privacy-Aware Minimal View for Agents via Trusted Local Sanitization

Minim: 通过可信本地净化实现代理的隐私感知最小化视图

Hexuan Yu, Chaoyu Zhang, Heng Jin, Shanghao Shi, Ning Zhang, Y. Thomas Hou, Wenjing Lou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 针对LLM代理传输完整UI状态导致隐私泄露的问题,提出MINIM框架,在客户端基于上下文完整性学习双重分数(敏感性和必要性),通过三元披露策略实现隐私感知的最小化视图,在减少敏感泄露的同时保留任务关键信息。

Comments Accepted at ICML 2026 (43rd International Conference on Machine Learning, Seoul, South Korea). Code available at https://github.com/yyyyhx/MINIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10742 2026-06-10 cs.CR cs.LG 新提交 57%

MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents

MemVenom:网络代理中多模态记忆的触发式投毒

Yv Zhang, Hao Sun, Hao Fang, Kuofeng Gao, Fan Mo, Bin Chen, Shu-Tao Xia, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Tianjin University(天津大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生学院,清华大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 提出MemVenom框架,针对网络代理的外部记忆系统,通过触发条件检索和攻击诱导,实现黑盒多模态记忆投毒,达到高成功率且不影响良性性能。

Comments Preprint. 27 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08500 2026-06-09 cs.SE cs.AI 新提交 57%

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

通过发起野生的代码理解之旅来投射SWE代理新兴思维模式

Zhengyi Zhuo, Yan Liu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07965 2026-06-09 cs.AI 新提交 57%

Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

工业场景中的零样本学习:新的大规模基准、挑战与基线

Zekai Zhang, Qinghui Chen, Maomao Xiong, Shijiao Ding, Zhanzhi Su, Xinjie Yao, Yiming Sun, Cong Bai, Jinglin Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.AI

AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07533 2026-06-09 cs.CL cs.AI cs.SD 新提交 57%

Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

桥接传统可解释性方法与多模态多语言模型:基于XAI的分析

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。

Comments Bachelor's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17774 2026-08-19 eess.SY eess.SP 新提交 50%

Edge-Native Embodied Intelligence for Action-Aware Wireless Edge Networks

面向动作感知无线边缘网络的边缘原生具身智能

Yiru Wang, Chuanao Jiang, Jiahui Cui, Zide Fan, Lei Wang, Zehui Xiong, Dong In Kim

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 该研究提出边缘原生具身智能(ENEI)框架,整合6G技术与具身智能,通过双向循环解决具身智能部署的资源与延迟问题,经案例验证可支撑自适应具身无线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14273 2026-08-17 cs.HC 新提交 50%

Designing Mobile and Wearable Sensor-Fused Conversational Agents for Health and Wellbeing

面向健康与福祉的移动及可穿戴传感器融合对话智能体设计

Hansoo Lee, Pablo Fonseca, Md Haseen Akhtar

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。

Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)

Journal ref In 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26), August 31-September 03, 2026, Swansea, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08880 2026-08-11 cs.SE 新提交 50%

Fusing UI Structure & Semantics for Feature-Oriented App Screen Retrieval & Clustering

融合UI结构与语义的面向特征的应用屏幕检索与聚类

Arun Krishna Vajjala, Yanfu Yan, Ajay Krishna Vajjala, Shrunal Pothagoni, Denys Poshyvanyk, Kevin Moran

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。

Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏