arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

共收录 1182
2607.09544 2026-07-13 cs.CV cs.LG 新提交

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09153 2026-07-13 cs.AI 新提交

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

KV-PRM:通过KV缓存转移实现高效的过程奖励建模以进行多智能体测试时扩展

Peng Kuang, Haibo Jin, Xiaoyu Han, Yanli Wang, Xiaopeng Yuan, Ye Yu, Kaidi Xu, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Imperial College London(伦敦帝国理工学院) City University of Hong Kong(香港城市大学)

AI总结 研究针对现有基于文本的过程奖励模型在长多智能体展开中评分成本高的问题,提出KV-PRM,通过读取KV缓存降低评分成本,经理论证明和实验验证,该模型在多基准测试及多种TTS方法下表现优异,大幅减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14130 2026-07-13 cs.LG cs.MA 新提交

Contract-Based Compositional Shielding for Safe Multi-Agent Reinforcement Learning

基于合约的组合屏蔽实现安全多智能体强化学习

Omar Adalat, Edwin Hamel-De le Court, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学)

AI总结 提出一种去中心化屏蔽方法,通过合约机制协调智能体局部LTL安全义务,在无集中运行时控制下保证全局安全并优化团队奖励。

Comments Accepted to EUMAS 2026, the 23rd European Conference on Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17502 2026-07-13 cs.AI 版本更新

Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs

迈向可关闭的智能体:在强化学习智能体和大语言模型中推广随机选择

Carissa Cullen, Harry Garland, Alexander Roman, Louis Thomson, Christos Ziakas, Elliott Thornley

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) New College of Florida(佛罗里达新学院) Imperial College London(伦敦帝国学院) MIT(麻省理工学院)

AI总结 本文提出DReST奖励函数,通过惩罚重复选择相同长度轨迹来训练智能体在不同轨迹长度间随机选择并有效追求目标,实验表明DReST训练的智能体在未见过的场景中表现出更高的有用性和中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08535 2026-07-10 cs.CL cs.AI 新提交

When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

当评判者改变时,测量结果也会改变:评估大语言模型作为评判者的可靠性

Zongyou Yang, Yinghan Hou, Xiaokun Yang

机构 * Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院) Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系) School of Electronic Information, Nanchang Institute of Technology(南昌工程学院电子信息学院)

AI总结 研究大语言模型作为评判者时分数因评估者变化而改变的问题,通过在四个数据集上比较两种升级路径,发现评判者升级不可互换,强评判者可减偏差,重复采样陪审团作用有限,结构化辩论能改决策,提出报告应含多方面内容。

Comments 6 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07998 2026-07-10 cs.RO 新提交

Factors Influencing Conversational Engagement in Robot-Delivered Individual Cognitive Stimulation Therapy (iCST) for Dementia in Home Settings

家庭环境中机器人辅助个体认知刺激疗法(iCST)对话参与度的影响因素

Emmanuel Akinrintoyo, Nicole Salomons

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 研究家庭环境中机器人辅助个体认知刺激疗法(iCST)对话参与度的影响因素,通过Co-STAR系统分析对话指标,发现个性化提示、交互阶段和参与者特征影响对话参与度,为自适应对话机器人设计提供参考。

Comments Accepted for publication at the IEEE RO-MAN Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08370 2026-07-10 math.AG cs.LG 新提交

Tubular Neighbourhoods of Pfaffian Sets and Applications to Neural Networks

普法夫式集的管状邻域及其在神经网络中的应用

Paul Lezeau, Martin Lotz

机构 * London School of Geometry and Number Theory, Imperial College London, UK(几何与数论学校,帝国学院伦敦,英国) Warwick Mathematical Institute, University of Warwick, UK(沃里克数学研究所,沃里克大学,英国)

AI总结 研究普法夫超曲面管状邻域体积界,推广代数簇相关结果。通过普法夫格式给出界,并应用于神经网络分类器,在均匀和高斯设置下得到条件数概率分布尾部界,特殊单隐藏层 sigmoid 网络有宽度多项式界。

Comments 32 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02514 2026-07-10 cs.AI 新提交

Distributed Attacks in Persistent-State AI Control

持久状态AI控制中的分布式攻击

Josh Hills, Ida Caspary, Asa Cooper Stickland

机构 * Constellation Astra Fellowship(Constellation Astra 奖学金) Imperial College London(帝国理工学院) UK AI Security Institute(英国人工智能安全研究所)

AI总结 研究AI编码代理在持久代码库中跨拉取请求分布攻击的威胁,提出Iterative VibeCoding基准,发现单一监控器无法同时防御渐进与非渐进攻击,而状态跟踪监控器可显著降低渐进攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16481 2026-07-10 cs.LG cs.SY eess.SY math.OC 版本更新

Optimal uncertainty bounds for multivariate kernel regression under bounded noise: A Gaussian process-based dual function

有界噪声下多元核回归的最优不确定性界:基于高斯过程的对偶函数

Amon Lahr, Anna Scampicchio, Johannes Köhler, Melanie N. Zeilinger

机构 * Institute for Dynamical Systems and Control, ETH Zurich(动态系统与控制研究所,苏黎世联邦理工学院) Department of Electrical Engineering, Chalmers University of Technology(电气工程系,查尔姆斯理工大学) Department of Mechanical Engineering, Imperial College London(机械工程系,伦敦帝国理工学院)

AI总结 针对有界噪声下再生核希尔伯特空间中的多输出函数,提出一种紧致、确定性的不确定性界,通过无约束对偶公式获得,具有与经典高斯过程置信界相同的结构,便于集成到下游优化中。

Comments Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10946 2026-07-10 cs.IT cs.AI cs.LG eess.SP math.IT 版本更新

ToDMA: Large Model-Driven Massive Token Communications for Semantic Multiple Access

ToDMA:用于语义多址接入的大模型驱动海量令牌通信

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Robert Schober, Deniz Gündüz

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) University of Surrey(Surrey大学) Friedrich-Alexander-University Erlangen-Nurnberg(埃森哲-亚琛工业大学) Imperial College London(伦敦帝国理工学院)

AI总结 本文提出ToDMA,一种大模型驱动的语义多址接入方案,将无源随机接入与上下文感知令牌处理结合,用于海量令牌通信。通过压缩感知检测令牌及估计信道状态信息,利用上下文模型恢复冲突令牌,能降低接入延迟并保持令牌恢复与语义重建质量。

Comments Submitted to IEEE journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06990 2026-07-09 cs.RO 新提交

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

用于鲁棒多机器人操作的闭环多智能体框架

Yi-Xiang He, Lan Wei, Haoming Cen, Jian-Jian Jiang, Zhuohao Li, Guanxing Lu, Yihan Yang, Dandan Zhang, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Imperial College London(帝国理工学院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对多机器人操作中高级推理应用于实际执行的挑战,提出基于分层闭环智能体的LLM框架,含规划、操作、验证智能体。经实际实验验证,该框架成功率高、适应性强,为多样操作任务提供可推广方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06701 2026-07-09 cs.CV cs.AI cs.GR cs.LG cs.RO 新提交

SPEAR: A Simulator for Photorealistic Embodied AI Research

SPEAR:用于逼真的具身人工智能研究的模拟器

Mike Roberts, Renhan Wang, Rushikesh Zawar, Rachith Dey-Prakash, Quentin Leboutet, Stephan R. Richter, Matthias Müller, German Ros, Rui Tang, Stefan Leutenegger, Yannick Hold-Geoffroy, Kalyan Sunkavalli, Vladlen Koltun

机构 * Adobe Research(Adobe研究院) Intel Labs(英特尔实验室) Manycore Tech Inc(众核科技公司) Adobe(Adobe公司) NVIDIA(英伟达公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国学院)

AI总结 研究针对现有逼真模拟器局限,提出SPEAR这一Python库,通过模块化插件架构连接控制UE应用程序,提升可编程性与渲染速度,还提供新图像模态和高级编程模型,经多样示例应用展示了其效用。

Comments Accepted for publication at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26028 2026-07-09 cs.CR cs.AI cs.MA 新提交

Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem

无信任代理能否被信任?ERC-8004 去中心化 AI 代理生态系统的实证研究

Xihan Xiong, Zelin Li, Wei Wei, Qin Wang, William Knottenbelt, Zhipeng Wang

机构 * Imperial College London(伦敦帝国学院) Ohio State University(俄亥俄州立大学) University of Bristol(布里斯托大学) The University of Manchester(曼彻斯特大学)

AI总结 本研究首次实证分析 ERC-8004 协议在三条链上的身份、声誉和验证注册表,发现大多数注册为占位符,声誉不可比且易被操纵,大量评论者存在 Sybil 行为,表明该协议目前无法提供可信决策基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01730 2026-07-09 cs.LG 版本更新

Decentralized Federated Learning by Partial Message Exchange

通过部分消息交换进行去中心化联邦学习

Shan Sha, Shenglong Zhou, Xin Wang, Lingchen Kong, Geoffrey Ye Li

机构 * School of Mathematics and Statistics, Beijing Jiaotong University(北京交通大学数学与统计学学院) Department of Electrical and Electronic Engineering, Faculty of Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

AI总结 研究去中心化联邦学习面临的挑战,提出PaME算法,通过允许相邻节点仅交换随机选择的稀疏坐标,降低通信成本、保护隐私且不牺牲准确性,经分析在温和假设下线性收敛,数值实验证明性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01683 2026-07-09 cs.CV 版本更新

ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving

ROAD-Waymo:一个用于自动驾驶的大规模动作感知数据集

Salman Khan, Izzeddin Teeti, Reza Javanmard Alitappeh, Mihaela C. Stoian, Eleonora Giunchiglia, Gurkirt Singh, Andrew Bradley, Fabio Cuzzolin

机构 * Oxford Brookes University(奥克斯福德布鲁克斯大学) MAZUST University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出ROAD-Waymo数据集,用于道路场景中代理、动作等检测技术开发与基准测试,比现有数据集更大更具挑战性,含大量标注数据,通过新注释管道增强完整性,还能解决不同国家道路场景的域适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05709 2026-07-08 cs.RO 新提交

Co-STAR: Cognitive Stimulation Therapy by an Autonomous Robot for Dementia -- A One-Week In-Home Study

Co-STAR:用于痴呆症的自主机器人认知刺激疗法——为期一周的家庭研究

Emmanuel Akinrintoyo, Nicole Salomons

机构 * Imperial College London(伦敦帝国学院)

AI总结 研究针对痴呆症患者认知疗法应用受限问题,开发并部署能在家自主提供认知刺激疗法的社交机器人,九名患者参与一周研究,结果显示该疗法可行且能提高依从率,凸显家庭成员作用,为痴呆症护理提供可扩展方法。

Comments Accepted for publication at the IEEE RO-MAN Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18419 2026-07-08 cs.CV cs.AI 版本更新

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12100 2026-07-08 cs.CV 版本更新

Did Models Learn Sufficiently? Attribution-Guided Training via Subset-Selected Counterfactual Augmentation

模型是否充分学习?通过子集选择的反事实增强进行归因引导训练

Yannan Chen, Ruoyu Chen, Wei Wang, Bin Zeng, Jinke Li, Shiming Liu, Qunli Zhang, Yaowei Wang, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区信息科学与技术学院) PCL Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Tianjin University(天津大学) Lanzhou University(兰州大学) Imperial College London(伦敦帝国理工学院)

AI总结 针对模型仅依赖有限充分原因导致泛化性差的问题,提出子集选择反事实增强(SS-CA),通过基于LIMA归因的反事实生成和数据增强,改善模型因果学习,提升分布内和分布外性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05319 2026-07-07 cs.CV cs.AI 新提交

Steering Optimisation Trajectories in Diffusion Representation Learning

引导扩散表示学习中的优化轨迹

Rajat Rasal, Avinash Kori, Tian Xia, Ben Glocker

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 该研究探究扩散自编码器图像质量相近但潜在结构差异大的成因,提出SteeringDRL方法,通过门控残差U-Net和噪声水平课程引导优化,提升表示质量并降低种子敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05292 2026-07-07 cs.LG cs.AI cs.CV 新提交

Air Quality Downscaling with Station-Guided Pseudo-Supervision

基于站点引导伪监督的空气质量降尺度方法

Guorun Wang, Simone Foti, Andreas D. Demou, Leonidas Kotoulas, Theodoros Christoudias, Alexandros Koliousis, Mihalis Nicolaou, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院) The Cyprus Institute(塞浦路斯研究所) Northeastern University London(伦敦东北大学) University of Cyprus(塞浦路斯大学)

AI总结 针对粗粒度大气场超分PM₂.₅的空间支持失配问题,该研究结合多源侧信息,提出站点引导框架实现高分辨率PM₂.₅降尺度与偏差校正,有效还原细粒度空间结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05274 2026-07-07 cs.CV 新提交

Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models

无附带损害擦除:扩散模型中的精确概念移除

Parth Upman, Nishita Jain, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

AI总结 针对无训练概念擦除易损害相关非目标概念的问题,提出CARE闭式算子,在交叉注意力值空间实现精确擦除,无模型微调,可更好保留非目标概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04356 2026-07-07 cs.LG 新提交

How Many Initial Points Does Bayesian Optimization Need?

贝叶斯优化需要多少初始点?

Mujin Cheon, James Odgers, Dong-Yeun Koh, Calvin Tsay

机构 * Korea Advanced Institute of Science & Technology (KAIST)(韩国科学技术院) HayanMind Inc.(哈扬思维公司) Technical University of Nuremberg (UTN)(纽伦堡工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Helmholtz Munich(亥姆霍兹慕尼黑中心) Imperial College London(伦敦帝国理工学院)

AI总结 研究贝叶斯优化初始点数量选择问题,发现初始点数量与总成本呈U型关系,不同超参数和采集函数都存在此权衡,汤普森采样是例外,还给出实用建议。

Comments 4 pages. Accepted at the ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04169 2026-07-07 cs.RO 新提交

Neural LiDAR Bundle Adjustment

神经激光雷达光束平差

Chin Yung Anson Hon, Kaicheng Zhang, Sen Wang

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 研究探索RGB NeRFs和LiDAR NeRFs关键设计差异,发现体素采样密度对LiDAR NeRF重要,据此提出Neural LiDAR Bundle Adjustment算法,实验证明其在多视点云配准和3D映射中有出色性能。

Comments 8 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03397 2026-07-07 cs.AI cs.CV 新提交

Efficient bias mitigation in T2I diffusion models using Concept Graphs

使用概念图在文本到图像扩散模型中有效减轻偏差

Mansi, Avinash Kori, Francesco Leofante

机构 * Department of Computing Imperial College London(伦敦帝国理工学院计算系)

AI总结 研究文本到图像扩散模型偏差问题,提出基于概念图对齐的CO-ALIGN方法,在模型内部概念本体上操作,能有效减轻偏差并保留生成完整性,性能优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03392 2026-07-07 cs.CR cs.LG 新提交

Scalable Differentially Private Data Compression via Diffusion and Stochastic Codes

通过扩散和随机码实现可扩展的差分隐私数据压缩

Gergely Flamich, Oykü Sıla Güner, Yanxiao Liu, Deniz Gündüz

机构 * Imperial College London(帝国理工学院)

AI总结 针对高维数据压缩难题,提出结合随机码与扩散模型的DP-DiPP压缩管道,通过扩展泊松私有表示并结合DiffC,实现差分隐私图像压缩,实验表明其性能远超基线。

Comments To appear in ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02799 2026-07-07 cs.CV 新提交

Conversational Human Audio-visual Talking Dialogue Generation

对话式人类视听对话生成

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Earth Science & Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, Heriot-Watt University(赫瑞瓦特大学计算机科学系) School of Computer Science, Northumbria University(诺森比亚大学计算机科学学院) College of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学广东省智能信息处理重点实验室) School of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

AI总结 提出CHAT框架,统一大语言模型和说话人脸模型,通过交互音频和面部行为细化模块,从单一文本提示生成多样、配对且相互响应的语音-面部对话片段,优于现有方法,合成数据集可作预训练数据。

Comments Accepted to ECCV 2026 as a main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02571 2026-07-07 cs.CV 新提交

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation

双自适应SAM3:基于低秩专家层的分层路由用于参数高效的医学图像分割

Ying Chen, Jinyue Li, Kun Wang, Qiankun Li, Yang Liu

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Imperial Global Singapore (IGS), Imperial College London(伦敦帝国理工学院新加坡帝国全球(IGS))

AI总结 提出双自适应SAM3框架,通过任务感知的动态专家路由器和参数感知的分解参数化专家设计,兼顾分割精度与参数效率,在医学图像分割上有高表现。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏