arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4517
2607.11892 2026-07-15 cs.CL cs.AI 新提交

G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis

G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架

Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程重点实验室) Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)

AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11327 2026-07-15 cs.LG cs.AI 版本更新

PRISM Edit: One Vector for All Temporal Answers

PRISM Edit:适用于所有时间答案的单一向量

Chen Huang, Qi Zheng, Ruiqin Zheng, Long Zeng, Yuantong Xu

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 研究针对大语言模型时间事实更新问题,基于因果追踪发现其内部计算支持新旧答案区分,进而引入PRISM Edit,通过优化单一多义词表示及利用固有调制路径,在新基准上评估,相比基线提升了时间一致性等指标且速度更快。

Comments Chen Huang and Qi Zheng contributed equally. Corresponding authors: Long Zeng, Yuantong Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31437 2026-07-15 cs.CV 版本更新

Astra: a generalizable report generation foundation model for 3D computed tomography

Astra:一种用于三维计算机断层扫描的通用报告生成基础模型

Zhuhao Wang, Fang Chen, Chaohui Yu, Zihan Li, Yuchao Zheng, Jing Wang, Xuan Yang, Jia Guo, Zhenlu Yang, Xingju Zheng, Yihua Sun, Haojie Han, Xiaoxiao Qin, Zhan Feng, Wenbo Xiao, Chao Zhu, Yuehua Li, Shipeng Zhang, Hao Luo, Yunsong Peng, Fan Wang, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Laboratory(壶辰实验室) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Radiology, Guizhou Provincial People’s Hospital(贵州省级人民医院放射科) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院放射科) Department of Radiology, Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院放射科) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 提出Astra模型,通过风格统一和强化学习,在8个器官系统的CT报告生成中实现高精度,平均细粒度诊断指标提升44.1%,并加速临床工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12783 2026-07-15 cs.IR cs.AI 版本更新

SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise

SQuTR:一种在语音噪声下 spoken query 到文本检索的鲁棒性基准

Yuejie Li, Ke Yang, Yueying Hua, Berlin Chen, Jianhao Nie, Yueping He, Caixin Kang

机构 * Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) Soochow University(苏州大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Tsinghua University(清华大学) The University of Tokyo(东京大学)

AI总结 SQuTR通过大规模数据集和统一评估协议,评估语音检索系统在复杂噪声环境下的鲁棒性,揭示了极端噪声下检索性能显著下降的问题。

Comments Accepted by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09977 2026-07-15 cs.CV 版本更新

INFANiTE: Implicit Neural representation for high-resolution Fetal brain spatio-temporal Atlas learNing from clinical Thick-slicE MRI

INFANiTE:隐式神经表示用于高分辨率胎儿脑空间-时间大体图谱学习从临床厚切片MRI

Xiaotian Hu, Mingxuan Liu, Hongjia Yang, Tongxi Song, Yijin Li, Yifei Chen, Haoxiang Li, Zihan Li, Yingqi Hao, Ziyu Li, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Beihang University(北航大学) Tsinghua University(清华大学) Sichuan University(四川大学) University of Oxford(牛津大学)

AI总结 INFANiTE通过隐式神经表示方法,实现了从厚切片MRI中高效生成高分辨率胎儿脑空间-时间大体图谱,显著加快了图谱构建过程,提升了图谱的一致性、参考保真度和生物合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04241 2026-07-15 cs.LG math.OC 版本更新

Learning an Interpretable Risk Scoring System for Maximizing Decision Net Benefit

学习一种可解释的风险评分系统以最大化决策净收益

Wenhao Chi, Ş. İlker Birbil

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Amsterdam Business School, University of Amsterdam(阿姆斯特丹大学阿姆斯特丹商学院)

AI总结 本文提出一种直接优化决策阈值范围内净收益的风险评分系统,通过稀疏整数线性规划构建透明评分系统,实现可解释性和实用性,同时验证了净收益优化与传统性能指标的一致性。

Comments 50 pages, 9 figures, 17 tables, and 6 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-07-15 cs.RO cs.AI 版本更新

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 17 pages, 8 figures. Project Page: https://baai-humanoid.github.io/DECO-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23276 2026-07-15 cs.LG cs.MA 版本更新

Auditable Context-Aware HFMD Forecasting with Structured LLM Agents

基于结构化大语言模型代理的可审计上下文感知手足口病预测

Joongwon Chae, Runming Wang, Chen Xiong, Gong Yunhan, Lian Zhang, Ji Jiansong, Dongmei Yu, Peiwu Qin

机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) Hengqin Laboratory, Zhuhai, China(横琴实验室) The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)

AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07482 2026-07-15 eess.SP cs.AI

VSLLaVA: a pipeline of large multimodal foundation model for industrial vibration signal analysis

VSLLaVA:一种用于工业振动信号分析的大型多模态基础模型流水线

Qi Li, Xinran Zhang, Jinfeng Huang, Hongliang He, Feibin Zhang, Zhaoye Qin, Fulei Chu

机构 * State Key Laboratory of Tribology, Department of Mechanical Engineering, Tsinghua University(摩擦学国家重点实验室,清华大学机械工程系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

AI总结 VSLLaVA通过专家知识引导的指令微调和双模式评估框架,提升工业振动信号分析的端到端多模态模型性能。

Journal ref Advanced Engineering Informatics 76 (2026): 105023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11644 2026-07-14 cs.CV 新提交

Motion4Motion: Motion Transfer Across Subjects at Inference

Motion4Motion:推理时跨主体的运动转移

Ling-Hao Chen, Zixin Yin, Duomin Wang, Xianfang Zeng, Gang Yu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究视频间运动转移,此前方法依赖骨骼结构有局限。提出免训练的Motion4Motion框架,对角色运动流建模,突破跨物种运动转移难题,实验结果显示该方法优于基线。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11508 2026-07-14 cs.LG cs.AI stat.ML 新提交

CDFM: Towards a General-Purpose Causal Discovery Foundation Model

CDFM:迈向通用因果发现基础模型

Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui

机构 * School of Computer Science, Guangdong University of Technology, Guangzhou, China(广东技术大学计算机科学学院) College of Mathematics and Computer, Shantou University, Shantou, China(汕头大学数学与计算机学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 研究针对因果发现中特定数据集方法的局限,提出通用框架CDFM,通过研究因果可识别性理论边界构建变分框架,将未知因果机制视为潜在变量,经大量合成模型预训练,性能优于传统算法,推动因果发现范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11503 2026-07-14 cs.CL 新提交

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

GEIS:用于长篇文章生成的智能体技能生成-评估-改进循环

Jiale Zhang, Juntao Hu, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(泰赛科技有限公司)

AI总结 针对长篇文章生成难题,提出GEIS循环,通过在Tasi Harness中实现文章写作、证据图像收集等技能,经核心写作、成对评估及改进技能,在20个主题实验中提升了PDF质量得分,证明可将其转变为可改进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11481 2026-07-14 cs.RO 新提交

Towards Human-level Dexterous Teleoperation

迈向人类水平的灵巧遥操作

Puhao Li, Zeyuan Chen, Yingying Wu, Pengkun Wei, Yuyang Li, Tianyu Wang, Jiaxiao Shi, Mingrui Yu, Baoxiong Jia, Song-chun Zhu, Tengyu Liu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Lab of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司) Peking University(北京大学)

AI总结 研究如何通过遥操作赋予机器人手内灵巧性,提出TeleDexter手 - 物体协同跟踪控制器,利用混合奖励训练,经单阶段强化学习及随机化处理可零样本迁移到真实机器人,在多项任务上取得高成功率并能训练自主策略。

Comments Project Website: https://bigai-dex.github.io/blog/teledexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11433 2026-07-14 cs.AI 新提交

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

全决策:一种用于全模态问答的渐进式证据状态智能体系统

Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 研究全模态问答中证据分散问题,提出全决策系统,将问答转化为证据闭合过程,维护结构化证据状态,通过确定性状态更新处理异构观察,提升了准确率,验证了证据状态控制在多步证据寻求中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11374 2026-07-14 cs.LG 新提交

Surprisingly Simple and Effective Multi-Domain Graph Foundation Model through Graph-to-Table Alignment

通过图到表对齐实现惊人简单且有效的多域图基础模型

Chunyu Hu, Tianyin Liao, Ge Lan, Xingxuan Zhang, Jianxin Li, Peng Cui, Ziwei Zhang

机构 * Nankai University(南开大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 研究如何让表格基础模型有效捕获图结构信息,提出GTAlign框架,先预训练图编码器捕获图表示,通过社区引导持续预训练弥合差距,应用于目标域推理,实验表明该框架在节点和图分类上显著优于基线,提供简单无文本的图基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11312 2026-07-14 cs.CV 新提交

SLVMBench: Skill Learning from Video Memory

SLVMBench:从视频记忆中学习技能

Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

AI总结 SLVMBench是首个用于评估视频大语言模型从长视频记忆学习技能并应用于实时任务能力的基准测试,通过特定视频流和人工标注进行测试,发现现有视频LLMs在此方面有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11185 2026-07-14 cs.AI 新提交

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

SCALECUA:通过可验证任务合成和高效在线强化学习扩展计算机使用代理

Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

AI总结 研究针对计算机使用代理扩展能力受限问题,提出ScaleCUA框架,通过可验证任务合成及高效训练实现。包括设计VeriGen生成任务、前沿采样提高效率、视觉上下文分割加速训练,在相关平台取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11163 2026-07-14 cs.CL cs.SD eess.AS 新提交

Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR

统一梯度投影:用于多语言低资源语音识别的语言平衡持续学习

Ziang Ren, Guodong Lin, Yuchen Ai, Kaize Tan, Wei-Qiang Zhang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 针对多语言低资源语音识别中微调导致灾难性遗忘及跨任务干扰问题,提出统一梯度投影(UGP)方法,通过语言平衡重放的参考梯度约束参数更新,结合梯度级与数据级重放,有效减轻遗忘,实现有效适应。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11109 2026-07-14 cs.IR cs.CL 新提交

Generative Chinese Statute Retrieval

生成式中文法规检索

Yiteng Tu, Zitao Su, Weihang Su, Xuanyi Chen, Yueyue Wu, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学) Quancheng Laboratory(清华实验室) Renmin University of China(中国人民大学)

AI总结 针对法规检索中口语化查询与正式法规语言的差距问题,提出GCSR生成式法规检索框架,通过多粒度结构化文档ID和多任务训练策略,将其转化为序列生成问题,实验证明该框架优于基线,凸显其在法律信息检索及推理任务中的有效性与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11096 2026-07-14 cs.CV cs.SD stat.ML 新提交

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

差异驱动门控:U-Net 解码器的自适应特征融合

Kai Li, Xuechao Zou, Jiashen Fu, Zijun Yan, Xintong Wang, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for Artificial Intelligence, BNRist, IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、北京信息科学与技术国家研究中心、IDG/麦戈文脑科学研究院) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机与信息技术学院)

AI总结 研究 U-Net 风格模型中多尺度特征融合问题,提出基于特征差异和熵差异的门控方法,通过从两特征流差异导出注意力权重生成耦合门控映射,实验表明该方法优于现有方法,为特征融合提供新范式。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11083 2026-07-14 cs.SD 新提交

The SonicAGI System for the REAL-TSE Challenge

用于 REAL-TSE 挑战赛的 SonicAGI 系统

Kai Li, Wendi Sang, Jintao Cheng, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系、人工智能研究所、BNRist、清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦戈文脑科学研究所、清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究所)

AI总结 本文介绍 SonicAGI 参加 REAL-TSE 挑战赛的情况,采用以数据为中心的方法,在线引入 SwiftNet-Lookahead 控制延迟,离线用 USEF-TFGridNet 权衡质量与保真度,在官方评估中取得较好成绩,证明相关训练和建模对对话式 TSE 有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10815 2026-07-14 cs.RO 新提交

Learning Roller-Skating Motions of Humanoid Robots Based on Adversarial Motion Priors

基于对抗运动先验的仿人机器人轮滑运动学习

Yunkang Cheng, Yutong Wu, Menghan Li, Shihe Zhou, Mingguo Zhao

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Key Laboratory of Embodied Intelligence Systems(北京具身智能系统重点实验室) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所)

AI总结 研究仿人机器人轮滑运动,提出基于对抗运动先验的强化学习框架,用于泵式滑行和推式滑行两种步态。通过动作捕捉收集数据并处理成参考运动状态,用独立管道学习步态,经模拟实验评估步态相关指标。

Comments 12 pages. Submitted preprint version. Accepted for oral presentation at CLAWAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10784 2026-07-14 cs.LG cs.AI 新提交

LSTrans: Efficient Knowledge Transfer for Lightweight and Automated ECG Classification

LSTrans:用于轻量级和自动心电图分类的高效知识转移

Yi Zhao, Jiajun Gao, Chenyang Xu, Yuxi Zhou, Hao Wang

机构 * School of Mechano-Electronic Engineering Xidian University Xi'an, China(机械电子工程学院 西安电子科技大学 西安中国) School of Cyber Engineering Xidian University Xi'an, China(网络工程学院 西安电子科技大学 西安中国) DCST, BNRist, RIIT, Institute of Internet Industry Tsinghua University Beijing, China(DCST、BNRist、RIIT、互联网产业研究院 清华大学 北京中国)

AI总结 针对可穿戴设备上心电图分类计算成本高的问题,提出轻量级混合模型LSTrans,它结合一维卷积主干、Transformer编码器及知识蒸馏,在多基准数据集实验中实现诊断灵敏度与资源效率的平衡,减少内存占用和训练延迟。

Comments Submitted to BIBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-07-14 cs.CL 新提交

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 8 pages, 4 tables; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10336 2026-07-14 cs.RO cs.CV 新提交

PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving

PrismAD:通过语义规划器混合实现端到端自动驾驶的解耦规划

Kang Ding, Zhigui Lin, Hongsong Wang, Jie Gui, Qi Liu, Zhe Wang, Luqi Tang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与出行国家重点实验室) School of Cyberspace Security, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Automotive Engineering, Wuhan University of Technology(武汉理工大学汽车工程学院) SAIC GM Wuling Automobile Co., Ltd.(上汽通用五菱汽车股份有限公司)

AI总结 研究针对自动驾驶规划器耦合问题,提出PrismAD框架,将场景令牌分组,用独立规划专家学习专门表示,语义感知路由器聚合预测,引入稀疏top-$K$激活,实验证明该框架性能具竞争力。

Comments 8 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10210 2026-07-14 cs.CR cs.CL 新提交

Toward Stronger Code Watermarking: A Grammar-Driven Approach to Optimizing the Trade-off Between Quality and Detectability

迈向更强的代码水印:一种语法驱动的方法来优化质量与可检测性之间的权衡

Licheng Yu, Aiwei Liu, Songze Li

机构 * Southeast University(东南大学) Tsinghua University(清华大学)

AI总结 针对大语言模型代码生成中质量与可检测性权衡难题,提出语法驱动水印方法(GDW),通过语法引导机制和角色感知调制注入水印,设计加权检测统计量,实验表明其在多方面优于现有方法且具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10191 2026-07-14 cs.SD cs.AI 新提交

Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

通过深度特征锚定偏好优化打破流式目标说话人提取中的质量-可懂度权衡

Shuhai Peng, Jinjiang Liu, Hui Lu, Liyang Chen, Guiping Zhong, Jiakui Li, Shiyin Kang, Zhiyong Wu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) SenseTime(商汤科技)

AI总结 研究流式目标说话人提取中的质量-可懂度权衡问题,提出扩大Conformer卷积核及基于WavLM的DPO微调策略,实现了相对可懂度10.9%的提升,同时音频质量和说话人相似度也有改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10004 2026-07-14 cs.CV 新提交

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

模型指导绘图:用于统一多模态推理的自适应视觉门控

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学)

AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08765 2026-07-14 cs.CV 版本更新

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

通过几何感知预训练增强上下文全景生成

Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

机构 * Insta360 Research(影石创新研究院) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Wuhan University(武汉大学)

AI总结 该研究提出两阶段框架Canvas360用于上下文全景生成,结合几何感知预训练与微调。通过构建数据集及特定建模方法,增强文本到全景生成,经实验验证其能提高全景图像保真度,在相关指标上表现优异。

Comments Project page: https://zry000.github.io/Canvas360/ Github: https://github.com/Insta360-Research-Team/Canvas360

详情

展开后加载摘要…

URL PDF HTML 收藏