arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 1990
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26101 2026-08-27 cs.CV 新提交

RefVideo-6M: A Reliable Reference-Based Dataset for Instructional Video Editing

RefVideo-6M:一个用于教学视频编辑的可靠基于参考的数据集

Bojia Zi, Xiaoyan Yang, Yu Zhou, Ruijie Sun, Lihan Zhang, Bin Liang, Kam-Fai Wong, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) The Chinese University of Hong Kong (CUHK)(香港中文大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文针对现有视频编辑数据集的局限,构建含600万样本的RefVideo-6M参考引导编辑数据集,训练Ref-MoT模型,实验证明其监督更可靠,可提升编辑模型的视觉质量、可控性与参考一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26095 2026-08-27 cs.CV cs.AI 新提交

A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training

面向多模态无监督持续后训练的视觉依赖感知框架

Kaichen Li, Zhilin Zhu, Jianhao Huang, Zhengqin Lai, Baochen Xiong, Zibo Shao, Yaguang Song, Linhui Xiao, Xiaoshan Yang, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 针对多模态无监督持续后训练中现有方法忽略视觉依赖的问题,提出含VC-OT和VMA组件的VDA框架,可同时维持旧任务稳定性与新任务可塑性,经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26094 2026-08-27 cs.CV cs.AI cs.ET cs.HC cs.LG 新提交

MyoMechanix: Biomechanically-Grounded Compositional Skilled Activity Understanding and Coaching

MyoMechanix:基于生物力学的可组合技能活动理解与指导

Hao Yin, Paritosh Parmar, Lijun Gu, Lin Xu, Tianxiao Guo, Xiujin Liu, Tianyou Zheng, Yang Zhang, Weiwei Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) Arexeni Research and Technologies Inc.(Arexeni研究与技术公司) Beijing Sports University(北京体育大学) University of Michigan(密歇根大学)

AI总结 本文提出MyoMechanix多模态生态系统,构建FKG与CUBIST,建立三类任务,多模态方法提升AQA性能与可解释性,为物理AI提供生物力学基础的技能理解方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26088 2026-08-27 cs.AI cs.LG 新提交

Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings

行星预测引擎:通过智能数据选择和基础模型嵌入实现自主地理空间预测

Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin, Mandar Sharma, Mimi Sun, Hamed Sadeghi, Dav M. Ebengo, Mbulayi Onesime, Rouslan Solomakhin, John Wamburu, William Ogallo, Aisha Walcott-Bryant, Sanxing Chen, Arbaaz Muslim, Yael Mayer, Ronald Ho, Roy Lee, Ruth Alcantara, Abdoulaye Diack, Monica Bharel, Lambert Rosique, Jeremy Amez-Droz, Christopher Haire, James Manyika, Yossi Matias, Niv Efron, Gautam Prasad, Shravya Shetty

机构 * Google Research(谷歌研究院) Institut National de Recherche Biomédicale(国家生物医学研究院)

AI总结 该研究提出行星预测引擎(PPE),一种自主AI系统,可根据自然语言查询完成地理空间预测的端到端工作流程,在多类任务中优于现有模型,降低了行星规模分析的技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26086 2026-08-27 cs.LG cs.AI 新提交

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development

TraceML:机器学习开发中人类-智能体规划的实证分析

Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 TraceML通过构建人类与智能体在Kaggle竞赛中的配对轨迹数据集,实证分析了人类与智能体在机器学习开发规划上的差异,发现智能体存在行为循环问题,提炼的人类规划提示可缩小部分差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26083 2026-08-27 cs.LG cs.AI cs.CV stat.ML 新提交

ICON Decomposition: Multivariate Concept-Level Explanations of Deep Representations for Model Auditing

ICON分解:面向模型审计的深度表征的多变量概念级解释

Roshan Prakash Rane, Marco Simnacher, Manuel Pfeuffer, Marc-Andre Schulz, Nys Tjade Siegel, Maximilian Dreyer, Frederik Pahde, Wojciech Samek, Sonja Greven, Kerstin Ritter

机构 * Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所) Charité - Universitätsmedizin Berlin(柏林夏里特医学院) Humboldt-Universität zu Berlin(柏林洪堡大学) Tübingen AI Center, University of Tübingen(蒂宾根大学蒂宾根人工智能中心) German Center for Mental Health (DZPG)(德国心理健康中心) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希赫兹研究所) Technische Universität Berlin(柏林工业大学)

AI总结 该研究针对深度神经网络的捷径学习问题,提出ICON分解方法,通过量化概念在考虑其他概念及结果后的方差解释度,在合成数据及皮肤病变、脑成像模型上实现更准确的概念级解释,可用于模型审计。

Comments 44 pages, 12 figures, 3 tables. Includes Extended Data (7 figures, 2 tables). Code: this https URL (https://github.com/RoshanRane/ICON_decomposition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26076 2026-08-27 cs.RO 新提交

Fast Generative Grasping via Lie Group-Constrained MeanFlow

基于李群约束MeanFlow的快速生成式抓取

S. Talha Bukhari, Yi Wei, Ruiqi Ni, Zachary Kingston, Aniket Bera

机构 * Purdue University(普渡大学)

AI总结 该研究提出基于李群约束MeanFlow的快速生成式抓取方法,可在≤5次网络评估内采样可靠抓取,在ACRONYM数据集上性能与SOTA模型相当,推理延迟达毫秒级,且无需额外训练即可迁移到真实机器人抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26074 2026-08-27 cs.RO cs.AI 新提交

Gating Before Commitment: Anticipating Intent Divergence to Prevent Post-Interaction Decision Failures in Autonomous Driving

承诺前的门控:预测意图分歧以防止自动驾驶中交互后的决策失败

Cong Xu, Ravi Sankar

机构 * University of South Florida(南佛罗里达大学)

AI总结 该研究提出承诺前的门控决策层,通过语言引导意图模块检测自动驾驶车辆交互中的意图分歧,可修复规划、降低误触发率,其对故障的最快检测和不确定性否决作用获实验支持。

Comments 8 pages, 4 figures. Submitted to the 16th Workshop on Planning, Perception and Navigation for Intelligent Vehicles (PPNIV) at IROS 2026. Supplementary video included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26070 2026-08-27 cs.CL cs.AI cs.LG 新提交

Prefix Sliding for efficient test-time scaling

用于高效测试时缩放的前缀滑动

Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John Yang, Dapeng Jiang, Mika Senghaas, Fares Obeid, Johannes Hagemann, Sami Jaghouar, Ludwig Schmidt, Percy Liang, Jason Wei, Andrew Y. Ng, Luke Zettlemoyer, Yejin Choi, Mike Lewis

机构 * Stanford University(斯坦福大学) University of California at Santa Barbara(加州大学圣巴巴拉分校) Prime Intellect University of Washington(华盛顿大学)

AI总结 针对测试时推理内存成本过高问题,提出Prefix Sliding方法,通过丢弃非关键标记限制内存,无需训练可提速3倍,结合强化学习训练后性能更优且优于其他基线

Comments 28 pages (9 main), 22 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26069 2026-08-27 cs.LG 新提交

Group-Shared Low-Rank Approximation for Mobile-Efficient Pointwise Convolutions in Large-Kernel CNNs

用于大核卷积神经网络中移动高效逐点卷积的组共享低秩近似

Hao Luo, Yiting Yang, Wenyi Zhao, Man Jiang, Zhijun Lin, Ghulam Mohiuddin, Ting Jiang, Kunming Luo, Zihao Zhang, Qingsen Yan, Guoqing Wang, Wei Dong, Peng Wang

机构 * Northwestern Polytechnical University(西北工业大学) Nanchang University(南昌大学) China Mobile Chengdu Institute of Research and Development(中国移动成都研究院) Hong Kong University of Science and Technology(香港科技大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院) University of Electronic Science and Technology of China(电子科技大学)

AI总结 针对大核CNN中逐点卷积占比过高导致边缘部署瓶颈的问题,提出通道组共享低秩近似方法,在保持性能的同时降低存储成本,实现大核CNN的边缘高效部署。

Comments 17 pages, 10 figures, accepted by MobiCom2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26067 2026-08-27 cs.CV 新提交

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26066 2026-08-27 cs.RO 新提交

VirTooS: A ROS 2 - Unity Virtualization Toolkit for Fleet Management of Autonomous Mobile Robots

VirTooS:用于自主移动机器人车队管理的ROS 2-Unity虚拟化工具包

Andrea Drudi, Lorenzo Pichierri, Andrea Testa, Giuseppe Notarstefano

机构 * Department of Electrical, Electronic and Information Engineering, University of Bologna(博洛尼亚大学电气、电子与信息工程学院)

AI总结 本文提出VirTooS工具包,结合ROS 2与Unity引擎,支持自主移动机器人车队管理,可构建混合现实虚拟实验环境,实现真实与虚拟机器人交互,源代码将在GitHub公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26060 2026-08-27 cs.CL stat.ML 新提交

Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa: A Preliminary Study

微调Whisper以实现巴尼瓦语的自动语音识别:一项初步研究

Leonardo Duart, Tiago Fonseca, Thiago Chacón

机构 * University of Brasilia(巴西利亚大学)

AI总结 本研究对Whisper Small进行微调,构建巴尼瓦语ASR初始基准,证实多语言基础模型可适配资源匮乏的土著语言,为后续相关研究提供支撑。

Comments 12 pages, 3 tables. Preliminary study

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26058 2026-08-27 cs.RO 新提交

One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation

单一策略,多种具现体:面向异构具身操纵的以相机为中心的统一动作几何预训练

Xiaomi Embodied Intelligence Team, University of Macau: Shaoqing Xu, Fang Li, Guozhi Zhan, Zhixiang Duan, Yuhan Wang, Yuechen Luo, Shengyin Jiang, Hanbing Li, Zhiying Du, Longlong Wang, Longmei Jiang, Weixiang Liang, Ying Gong, Yong Pan, Ziping Zhao, Zhiyuan Chen, Yangwei You, Kun Ma, Qinyuan Liu, Hangjun Ye, Zhi-xin Yang

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队) University of Macau(澳门大学)

AI总结 该研究针对异构具身操纵数据的问题,提出UCAG-P预训练方法,通过以相机为中心的统一动作公式对齐数据,在多个基准任务上取得优异性能,无需特定微调。

Comments Technical Report,Project page: this https URL (https://public-bots.github.io/UCAG-P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26053 2026-08-27 cs.RO cs.AI cs.CL cs.LG 新提交

$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

R^3:通过强化学习训练机器人以自然语言进行推理

Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出R^3方法,通过中间训练和基于准则的强化学习将VLM转化为机器人推理器,在两个测试平台上提升了机器人的探索与泛化能力,优于仅指令式的模仿学习基线。

Comments 42 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26052 2026-08-27 cs.LG cs.AI cs.CL 新提交

How Much Rank Does LoRA Need? Rank-Error Bounds for Transformer Attention

LoRA需要多少秩?Transformer注意力的秩-误差边界

Gerard Conangla Planes

机构 * Aily Labs

AI总结 本文针对Transformer注意力,建立了LoRA秩与近似误差的理论边界,分析了秩的选择规律,扩展了相关分析至融合多头LoRA及联合查询/键更新的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26050 2026-08-27 cs.RO 新提交

When Obstacles Bend: Modeling Vegetation Deformation in the context of Field Robotics

当障碍物弯曲:野外机器人场景下的植被变形建模

Muhammad Hsaeeb Zaar Khizar, Tom Montagnon, Roland Lenain, Romuald Aufrère, Johann Laconte

机构 * LIMOS(利摩日信息学与优化实验室) Université Clermont Auvergne(克莱蒙奥弗涅大学) Clermont Auvergne INP(克莱蒙奥弗涅国立综合理工学院) CNRS(法国国家科学研究中心) INRAE(法国国家农业食品与环境研究院) Institut Pascal(帕斯卡尔研究院)

AI总结 针对现有可通行性评估绑定机器人动力学、难以跨平台迁移的局限,该研究提出通过植被固有力学特性建模,结合变形与力数据实现植被感知导航。

Comments 8 pages, 7 figures, submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26043 2026-08-27 cs.LG 新提交

Robust CurveMoE: Multi-Norm Adversarial Defense for Mixture-of-Experts Models via Mode Connectivity

鲁棒CurveMoE:通过模式连通性实现混合专家模型的多范数对抗防御

Xu Zhang, Ren Wang

机构 * Illinois Institute of Technology(伊利诺伊理工大学)

AI总结 本研究提出Robust CurveMoE混合专家框架,通过模式连通性连接不同范数的专用模型,引入贡献引导的部分更新降低成本,在CIFAR-100等数据集上显著提升了各类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26036 2026-08-27 cs.AI cs.CL 新提交

Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems

LLM数据智能体的追踪完整性:现实世界系统中可审计结构化推理的愿景

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

AI总结 本文针对LLM数据智能体提出追踪完整性标准,结合执行契约实现,通过CAIT率实验表明需同时评估答案准确率与可审计计算,为现实系统的LLM数据智能体提供评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26035 2026-08-27 cs.CL 新提交

Beyond Local Surprise: Grounded Dialogue as Selective Belief Revision under Referential Uncertainty

超越局部意外:指称不确定性下的对话作为选择性信念修正

Ziming Liu, Bhanu Chaitanya Jasti, Ziyang Xu, Hongyu Wu, Yi Wu, Jiqun Liu

机构 * University of Oklahoma(俄克拉荷马大学) University of Wisconsin–Milwaukee(威斯康星大学密尔沃基分校)

AI总结 该研究针对听者在指称不确定性下的对话保留/修正决策,提出数据驱动框架,发现不确定性敏感策略可在保留连贯理解的同时维持良好检索性能,其模式符合概念契约理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26033 2026-08-27 cs.CV eess.IV 新提交

UltraPIPS: Improving model perception in B-mode ultrasound with foundation models

UltraPIPS:利用基础模型提升B型超声中的模型感知能力

Tal Grutman, Tali Ilovitsh

机构 * School of Biomedical Engineering, Tel Aviv University(特拉维夫大学生物医学工程学院)

AI总结 该研究针对B型超声图像特性,提出采用超声领域特定骨干网络优化LPIPS指标,构建UltraPIPS库,可提升下游任务性能并平衡重建质量与真实性。

Comments MICCAI ASMUS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26019 2026-08-27 cs.LG cs.AI 新提交

DualOPSD: Adaptive Privileged Teachers for On-Policy Self-Distillation

DualOPSD:面向在线自蒸馏的自适应特权教师

Yutong Chen, Guangfu Guo, Zhichao Xu, Kunpeng Liu

机构 * Clemson University(克莱姆森大学) University of Utah(犹他大学)

AI总结 本研究提出非对称交替框架DualOPSD,让在线自蒸馏的特权教师与学生策略自适应,在Qwen3-8B等模型上提升了数学推理指标并减少截断。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-27 cs.CL 新提交

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yawei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26011 2026-08-27 cs.RO eess.SY 新提交

Phantom Navigator: Stealthy and Precise Unmanned Aerial Vehicle Redirection with Real-Time Tracking and GPS Spoofing

幻影导航器:利用实时跟踪与GPS欺骗实现隐蔽且精准的无人机重定向

Haocheng Meng, Shaocheng Luo, Songqiao Xie, Miroslav Pajic

机构 * Duke University(杜克大学)

AI总结 针对现有无人机重定向攻击可靠性、精准度不足的问题,提出幻影导航器攻击方法,结合离线可达性分析与在线闭环执行层,构建含激光雷达-相机栈的物理平台,实现隐蔽精准的无人机重定向,经案例验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26009 2026-08-27 cs.AI cs.LG cs.LO 新提交

Imitation Learning for Connection-Tableau Construction

用于连接表构造的模仿学习

Fredrik Rømming, Mantas Bakšys, Martin S. Fixman, Sean B. Holden

机构 * University of Cambridge(剑桥大学)

AI总结 该研究将连接表构造建模为迁移系统中的策略,结合模仿学习与图神经网络训练策略,在多个基准上较leanCoP提升了定理证明的问题解决率并大幅减少步数。

Comments 9 pages. Code: this https URL (https://github.com/fredrrom/connections)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26004 2026-08-27 cs.AI cs.CL 新提交

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

AsymSpec:面向智能体大语言模型的上下文非对称投机解码

Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

AI总结 AsymSpec是面向智能体大语言模型的非对称投机解码框架,通过轻量级草稿读全输入、大型验证模型用压缩视图,实现近90%完整上下文准确率,获1.3-1.7倍吞吐量加速且计算成本仅0.2-0.3倍。

Comments EMNLP Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26002 2026-08-27 cs.RO 新提交

DESCENT: Directed Edge Scene Encoding for Airport Surface Movement Prediction

DESCENT:面向机场地面运动预测的有向边场景编码

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Graz University of Technology(格拉茨工业大学) Institute of Visual Computing(视觉计算研究所)

AI总结 该研究针对机场地面运动预测领域,提出基于Transformer的DESCENT架构,结合PRS上下文采样与检测Transformer解码器,在Amelia-10基准上较现有最优基线实现显著性能提升,尤其在安全关键场景表现突出。

Comments IROS 2026. Project page at this https URL (https://github.com/a-pru/descent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25999 2026-08-27 cs.CL 新提交

Distinct dynamics of conceptual and referential disruptions in human reading and large language model processing

人类阅读与大语言模型处理中概念性与指称性干扰的不同动力学特征

Rui He, Nihal Altay, Wolfram Hinzen

机构 * Universitat Pompeu Fabra(庞培法布拉大学) Institut Català de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究所)

AI总结 该研究对比人类阅读与大语言模型处理,发现概念性与指称性干扰的动力学特征存在差异,为两种意义类型的可区分处理机制提供了聚合证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25998 2026-08-27 cs.CV 新提交

Uncertainty-Guided Latent Diffusion Models for Faithful Super Resolution

用于忠实超分辨率的不确定性引导潜在扩散模型

Ren Wang, Yung-Yu Chuang

机构 * National Taiwan University(国立台湾大学) NTU AI-CoRE(台大AI核心研究中心)

AI总结 针对单图像超分辨率的感知-失真权衡问题,提出新型UGDiff不确定性引导潜在扩散模型,通过结合重建不确定性与扩散采样器后验方差引导采样,实现更优的感知-失真平衡,性能优于现有同类方法。

Comments ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏