arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4512
2605.10628 2026-08-13 cs.CV 版本更新

Hyper-FSAD: Training-Free and Language-Free Few-Shot Anomaly Detection via Sparse Hyper Matching

超图增强的无训练和无语言少样本异常检测

Guohuan Xie, Xin He, Dingying Fan, Siqi Li, Yun Liu

机构 * Nankai University(南开大学) Tianjin University of Technology(天津工业大学) Tsinghua University(清华大学)

AI总结 本文提出HyperFSAD框架,通过超图推理机制实现无训练和无语言的少样本异常检测,利用稀疏超匹配和双分支图像评分提升鲁棒性,无需手工艺文本提示,在多个工业和医疗数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06710 2026-08-13 cs.RO 版本更新

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

RLinf-VLA: 一种用于视觉-语言-动作模型强化学习的统一高效框架

Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Harbin Institute of Technology(哈尔滨工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 RLinf-VLA是一种统一高效的框架,用于提升视觉-语言-动作模型在具身环境中的强化学习性能,通过统一接口和高效资源分配实现统一和可扩展的训练。

Comments Accepted to RSS 2026. This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965. The open-sourced code link: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11839 2026-08-13 cs.LG 版本更新

Grounding Large Language Models as Generalizable Policies in Network Control

大语言模型作为网络优化的通用策略

Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang

机构 * Bytedance(字节跳动) Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Department of Computer Science and Technology(计算机科学与技术系)

AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。

Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11201 2026-08-12 cs.CV 新提交

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Microsoft(微软公司)

AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10792 2026-08-12 cs.AI cs.LG 新提交

ChemWorld: Programmable Chemical Worlds for Controlled and Replayable Agent Experimentation

ChemWorld:用于可控且可重复智能体实验的可编程化学世界

Jiangjie Qiu, Yijun Li, Xiaonan Wang

机构 * Tsinghua University(清华大学)

AI总结 本研究提出可编程化学环境ChemWorld,分离公开实验契约与私有化学定律,支持实验轨迹精确重放,通过多组实验验证其可控性与可重放性,为化学智能体实验提供互补于物理实验室的基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10740 2026-08-12 cs.AI 新提交

Tree-of-Ideas: Automated Research Ideation via Cross-Trajectory Reasoning over Scholarly Evolution

思想树(Tree-of-Ideas):基于学术演化跨轨迹推理的自动化研究构想生成

Xun Li, Yiying Yang, Pengtao Li, Xiao Yao, Suyu Liu, Xiaoyang Ye, Ziyu Lu, Yuan Yao, Yangning Li, Yinghui Li, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) University of Melbourne(墨尔本大学) University of Sydney(悉尼大学) Shenzhen University(深圳大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Tencent Youtu Lab, Tencent(腾讯腾讯云图实验室)

AI总结 该研究提出两阶段框架Tree-of-Ideas,通过重构学术轨迹并跨轨迹推理生成研究构想,在6个人工智能主题上的自动方法中得分最高,接近人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10724 2026-08-12 cs.CV 新提交

InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection

InterPruner:面向多模态目标检测的、基于泰勒隐式准则与语言先验调制器的交互式结构化剪枝框架

Qi Ming, Zihan Yang, Shaoguang Huang, Si Sun, Hanqing Zhang, Nanqing Liu, Jiahui Lv, Juan Fang, Aleksandra Pizurica

机构 * Beijing University of Technology(北京工业大学) Southwest University(西南大学) China University of Geosciences Wuhan(中国地质大学(武汉)) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Yunnan Normal University(云南师范大学) Beijing Forestry University(北京林业大学) Ghent University(根特大学)

AI总结 本文提出首个面向红外-可见光目标检测器的交互式结构化通道剪枝框架InterPruner,结合TIC、MIRA、SPCA方法,在FLIR数据集剪枝50%通道时mAP提升0.6%,代码将发布于GitHub。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10690 2026-08-12 cs.CL 新提交

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

已发布的大语言模型词汇表能否支持隐藏语料库的词元级估计?

Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对隐藏语料库的词元级估计问题,提出分位数引导密度估计(QGDE)方法,利用已发布的LLM分词器词汇表实现了低误差的细粒度语料估计,为相关任务提供了新的有效信号来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10678 2026-08-12 cs.CL cs.AI 新提交

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

通过采样BPE词元统计审计中文网页规模语料库

Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

机构 * Tsinghua University(清华大学) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

AI总结 针对中文网页污染审计的三项挑战,提出Sampled-BPE轻量级审计流程,在大幅降低运行时间和内存消耗的同时保持精度,审计多类语料库并发布分层中文网页词元数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10435 2026-08-12 cs.CV 新提交

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics

DynaPPI:面向AI驱动蛋白质互作组学进展的大规模动态蛋白质数据集

Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

机构 * BIT(北京理工大学) HUST(华中科技大学) SJTU(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本研究提出DynaPPI动态蛋白质数据集,填补现有数据集忽略多体结合动态过程的空白,助力扩散模型预测未知蛋白质复合物结构,推动AI驱动的蛋白质互作组学发展。

Comments 9 pages, 1 figure, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI4Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10402 2026-08-12 cs.LG cs.DC 新提交

TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling

TideRL:通过就绪感知调度提升智能体强化学习的有效吞吐量

Yanyu Ren, Xizheng Wang, Xiao Liu, Bowen Lv, Hanchen Zhang, Shudan Zhang, Hanyu Lai, Shuai Wang, Li Chen, Dan Li, Jie Tang

机构 * Tsinghua University(清华大学) Zhongguancun Laboratory(中关村实验室)

AI总结 TideRL是一种就绪感知弹性RL系统,通过CTB、RA²P和ERS技术,在多轮智能体工作负载上大幅提升RL训练有效吞吐量,同时优化KV缓存命中率、训练时间和等待时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09986 2026-08-12 cs.AI cs.LG 新提交

MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis

MIDAS:面向不完整多模态情感分析的基于不确定性感知融合的互信息解缠方法

Yuhua Wen, Yingying Zhou, Qifei Li, Yingming Gao, Zhengqi Wen, Jianhua Tao, Ya Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

AI总结 本研究针对多模态情感分析中模态不完整的问题,提出MIDAS框架,通过互信息解缠与不确定性感知融合实现鲁棒的多模态表示,在多个数据集上取得优于基线的性能。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09449 2026-08-12 cs.CV 版本更新

Sekai2: From World Exploration to Interactive World Modeling

Sekai2:从世界探索到交互式世界建模

Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Tsinghua University(清华大学)

AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。

Comments Sekai2 dataset technical report. Developed at Alaya Lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28560 2026-08-12 cs.RO 版本更新

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

X-NavDP:通过组Q分数重加权匹配将导航扩散策略泛化到新行为和实体

Tianyu Yang, Yiming Zeng, Wenzhe Cai, Yuqiang Yang, Jiaqi Peng, Hui Cheng, Jiangmiao Pang, Tai Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Tsinghua University(清华大学)

AI总结 该研究针对导航扩散策略泛化性不足的问题,提出GQRM框架对X-NavDP进行后训练,大幅提升了跨实体视觉导航的模拟与现实场景成功率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16943 2026-08-12 cs.RO 版本更新

SinD 2.0: A Multi-City UAV Dataset with Semantic Risk Annotations for SOTIF-Oriented Safety Validation at Signalized Intersections

SinD 2.0:一个用于信号交叉口面向SOTIF安全验证的具有语义风险注释的多城市无人机数据集

Yunwei Li, Shengjie Fu, Chunrong Chen, Chengxiang Zhao, Yuchen Fan, Mingyu Zhu, Yanchao Xu, Jiahui Xu, Anran Wang, Huanan Wang, Yuxin Zhang, Lan Yang, Chuzhao Li, Jie Ji, Yi He, Abhijit Sarkar, Akash Sonth, Hong Wang, Jun Li

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Guangzhou Automobile Group Co., Ltd.(广州汽车集团股份有限公司) Jilin University(吉林大学) Chang’an University(长安大学) Chongqing University(重庆大学) Southwest University(西南大学) Wuhan University of Technology(武汉理工大学) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Virginia Tech(弗吉尼亚理工大学)

AI总结 针对自动驾驶系统在信号交叉口安全验证的瓶颈,介绍SinD 2.0多城市无人机数据集。通过跨域多样、高密度风险交互、分层语义注释及全栈测试工具链,能有效暴露算法性能局限,为ADS安全分析提供有力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21099 2026-08-12 cs.CV 版本更新

R2AoP: Reliable and Robust Angle of Progression Estimation from Intrapartum Ultrasound

R2AoP: 从产前超声可靠且鲁棒地估计进展角

Yuanhan Wang, Yifei Chen, Beining Wu, Mingxuan Liu, Xiaotian Hu, Chunbo Jiang, Yijin Li, Changmiao Wang, Feiwei Qin, Qiyuan Tian

机构 * Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文提出R2AoP框架,通过结构引导的分割和置信度引导的几何建模,实现了稳定的进展角估计,同时引入轻量级几何可靠测试时适应策略以提高在异质采集条件下的性能。

Comments 11pages,4 figures,Accepted by MICCAI PIPPI Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17751 2026-08-12 cs.RO cs.SY eess.SY 版本更新

Multisource Human-in-the-Loop Digital Twin Testbed for Connected and Autonomous Vehicles in Mixed Traffic Flow

多源人机协同数字孪生测试平台用于混合交通流中的连接与自动驾驶车辆

Jianghong Dong, Chunying Yang, Mengchi Cai, Chaoyi Chen, Qing Xu, Jianqiang Wang, Jiawei Wang, Keqiang Li

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系)

AI总结 本文提出了一种多源人机协同混合云控制测试平台(MSH-MCCT),用于在混合交通环境中测试连接与自动驾驶车辆(CAVs)与人类驾驶车辆(HDVs)之间的复杂交互,通过混合数字孪生概念结合混合现实与数字孪生,提升实验灵活性和可扩展性。

Journal ref 2026 in Journal of Intelligent and Connected Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19201 2026-08-12 cs.RO 版本更新

OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation

OmniVTA: 用于接触密集机械操作的视觉-触觉世界建模

Yuhang Zheng, Songen Gu, Yupeng Zheng, Weize Li, Yujie Zang, Shuai Tian, Xiang Li, Ce Hao, Chen Gao, Si Liu, Haoran Li, Yilun Chen, Shuicheng Yan, Wenchao Ding

机构 * TARS Robotics(TARS机器人实验室) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) CASIA(中国科学院自动化研究所) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学)

AI总结 本文提出OmniVTA框架,结合预测接触建模与高频触觉反馈,通过大规模视觉-触觉-动作数据集提升接触密集操作的性能与泛化能力。

Comments Project Page: https://mrsecant.github.io/OmniVTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22331 2026-08-12 math.OC cs.AI cs.LG 版本更新

On the Condition Number Dependency in Bilevel Optimization

关于双层优化中条件数依赖性的研究

Lesi Chen, Kaiyi Ji, Jingzhao Zhang

机构 * IIIS, Tsinghua University(清华大学信息学院)

AI总结 本文针对非凸上层、强凸下层的双层优化问题,建立了条件数依赖性的下界,揭示了双层与极小极大优化在条件数依赖上的首次可证明差距。

Comments v4 is a merge with v3 (Chen and Zhang) and https://arxiv.org/abs/2511.19656 (Ji, ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09613 2026-08-11 cs.CV 新提交

Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking

融合最优传输与常微分方程的统一连续时间4D重建与跟踪

Liying Yang, Hao Mo, Jialun Liu, Chen Liu, Xinxing Yu, Chenhao Guan, Hui Ma, Xiao Cao, Ajian Liu, Yanyan Liang

机构 * Macau University of Science and Technology(澳门科技大学) The University of Queensland(昆士兰大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所)

AI总结 本文提出Uni4R框架,通过最优传输与常微分方程协同学习连续速度场,结合流匹配引导解码器与积分一致性训练策略,实现统一连续时间4D重建与点跟踪,在相关任务及新基准上达SOTA性能。

Comments Preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09591 2026-08-11 cs.RO cs.CV 新提交

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

FactorDrive:面向端到端自动驾驶的、由规划关键因素驱动的自适应多步推理

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

机构 * Southeast University(东南大学) Universiti Malay(马来亚大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 该研究针对现有端到端自动驾驶方法在空间物理证据融合、推理适应及推理路径优化上的不足,提出FactorDrive框架,通过PCF-CoT数据集与QS-GRPO算法优化推理,在两类基准上取得最优规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09586 2026-08-11 cs.AI cs.GT cs.MA 新提交

ICM Out! Better Tournament Strategy from Computed Continuations, vs. Solvers and LLMs

ICM 失效!基于计算延续的更优锦标赛策略——与求解器及大语言模型(LLMs)的对比

Boning Li, Longbo Huang

机构 * Tsinghua University(清华大学)

AI总结 该研究提出战略延续优化(SCO)策略构建方法,通过锦标赛实验对比发现,SCO 策略比基于解析 ICM 的策略更优,且在替换对手为 LLMs 等时仍保持优势,明确了 ICM 作为锦标赛策略构建目标的局限性。

Comments 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09571 2026-08-11 cs.SD 新提交

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

SonicWeave:用于统一音频场景生成的分块路由混合专家模型

Yunrui Cai, Xu Li, Yucheng Zhou, Jinchao Li, Dingdong Wang, Dongchao Yang, Xixin Wu, Chen Zhang, Zhiyong Wu, Pengfei Wan, Helen Meng

机构 * Kuaishou Technology(快手科技) The Chinese University of Hong Kong(香港中文大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出SonicWeave,一种带CPE-MoE的流匹配模型,可通过单一权重集生成含语音、音乐等的统一音频场景,在多项基准及复杂场景评估中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09343 2026-08-11 cs.AI 新提交

LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling

基于模拟轨迹的大语言模型引导式启发式设计:动态生产与自动导引车调度的案例研究

Jinbo Li, Chuanhao Li

机构 * Tsinghua University(清华大学)

AI总结 该研究提出LLM引导的启发式设计框架,通过模拟轨迹诊断优化AGV与生产调度策略,在多组实验中优于多种基线方法,证实模拟轨迹可指导代码层面的策略改进。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09333 2026-08-11 cs.RO 新提交

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

DH-VLM:面向自动驾驶的双时域协同隐层推理框架

Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

机构 * Tsinghua University(清华大学)

AI总结 本文提出DH-VLM双时域协同隐层推理框架,结合基础设施与自车实现非对称语义协同,构建协同QA数据集支撑推理,在规划性能、通信成本等指标上优于现有方法,为协同自动驾驶提供实用鲁棒范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09311 2026-08-11 cs.CV 新提交

Degraded Infrared Small Object Detection via Degradation-Adapted Physics-Guided Restoration

面向退化红外小目标检测的退化自适应物理引导恢复方法

Xinkai Lu, Wenjun Chen, Yi Li, Yi Chang, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Ocean Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院海洋工程学院)

AI总结 针对红外小目标检测中退化泛化性差的问题,提出DAISOD框架,结合退化识别、专用分支处理与物理引导恢复,构建对应数据集,实验表明其性能优于现有方法。

Comments Accept by ICIG2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏