arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 358
2606.16435 2026-06-16 eess.AS cs.SD 新提交

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

统一音频生成与编辑:联合条件建模与渐进训练

Haocheng Dong, Yuheng Lu, Cheng Gong, Shansong Liu, Xiao-Lei Zhang, Xuelong Li

机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) Tianjin Key Laboratory of Cognitive Computing and Application, School of Artificial Intelligence, Tianjin University(认知计算与应用重点实验室,天津大学人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

AI总结 提出AudioWeave统一模型,通过联合条件建模和渐进多阶段训练策略,实现文本到音频生成和音频编辑的单一框架,性能与专用模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16359 2026-06-16 cs.CR cs.LG 新提交

FEnc$^2$: Unifying Data Packing for Efficient Private Inference via Convolution and Architecture-Aware Fragment Encoding

FEnc$^2$: 通过卷积和架构感知的片段编码统一数据打包以实现高效私有推理

Ran Ran, Zhaoting Gong, Nuo Xu, Yuanchao Xu, Fan Yao, Wujie Wen

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 提出FEnc$^2$框架,通过卷积感知编码和架构感知密文压缩优化CKKS加密推理中的密文打包,减少旋转和密文数量,实现端到端加速高达228倍。

Comments 15 pages, 9 figures. To appear in ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16184 2026-06-16 cs.CV cs.MM 新提交

Closed-Loop Triplet Synergistic Generation for Long-Form Video

闭环三元组协同生成用于长视频

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16159 2026-06-16 cs.CV 新提交

Continuous Splatting meets Retinex: Continuous Gaussian Splatting and Implicit Reflectance Modeling for Low-Light Image Enhancement

连续Splatting遇见Retinex:用于低光图像增强的连续高斯Splatting与隐式反射建模

Yuhan Chen, Yicui Shi, Guofa Li, Wenxuan Yu, Ying Fang, Guangrui Bai, Wenbo Chu, Keqiang Li

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与运载工程学院) School of Engineering Science, University of Science and Technology of China(中国科学技术大学工程科学学院) National Innovation Center of Intelligent and Connected Vehicles(国家智能网联汽车创新中心) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

AI总结 提出CGS-Retinex框架,结合连续高斯Splatting与Retinex理论,通过连续参数场估计全局光照,并利用隐式神经表示独立建模反射率,实现低光图像增强,有效抑制噪声和过曝,恢复高频结构和色彩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16158 2026-06-16 cs.CV cs.CL 新提交

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

必要时聚焦:用于无训练视觉定位的自适应路由与协作定位

Yifan Wang, Peiming Li, Shiyu Li, Zhiyuan Hu, Xiaochen Yang, Wenming Yang, Yang Tang, Zheng Wei

机构 * East China University of Science and Technology(华东理工大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

AI总结 提出LazyMCoT动态框架,通过自适应路由评估不确定性,对简单查询跳过处理,对困难样本利用协作定位模块进行两阶段精炼,在提升推理精度的同时降低平均推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16152 2026-06-16 cs.AI 新提交

The Quality-Utility Paradox: Why High-Reward Data Impairs Small Model Mathematical Reasoning

质量-效用悖论:为什么高奖励数据会损害小模型的数学推理

Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 发现数学推理蒸馏中的质量-效用悖论:Oracle精炼的高奖励数据因分布漂移增加适应成本,反而不如SLM自生成数据;提出风格对齐精炼方法恢复效用。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16140 2026-06-16 cs.AI cs.CL 新提交

VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

VibeThinker-3B:探索小型语言模型中可验证推理的前沿

Sen Xu, Shixi Liu, Wei Wang, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Xin Zhou, Junlin Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出3B参数紧凑模型VibeThinker-3B,通过频谱到信号后训练范式(课程SFT、多域强化学习、离线自蒸馏)在可验证推理任务上达到前沿性能,匹配甚至超越大模型,并验证推理增强不损害指令可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16111 2026-06-16 cs.CL 新提交

Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

面向帕累托最优工具集成智能体的帕累托排名策略优化

Junyi Li, Xiaowei Qian, Yingyi Zhang, Wenlin Zhang, Guojing Li, Sheng Zhang, Xiao Han, Yichao Wang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出ParetoPO框架,通过超体积引导动态标量化和帕累托排名优势计算,在多目标下优化工具使用语言模型的准确性与效率权衡。

Comments ICML 2026 Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15924 2026-06-16 cs.CV cs.GR 新提交

TurboGS: Accelerating 3D Gaussian Splatting via Error-Guided Sparse Pixel Sampling and Optimization

TurboGS: 通过误差引导的稀疏像素采样与优化加速3D高斯泼溅

Zheng Dong, Daifei Qiu, Pinxuan Dai, Ke Xu, Jiamin Xu, Lili He, Rynson W. H. Lau, Weiwei Xu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出TurboGS框架,通过误差引导的稀疏像素采样、结构感知损失、动态密度控制和混合优化器,在保持高保真渲染质量的同时实现高达10倍的训练加速。

Comments Accepted by ICML2026. Project page: https://zhengdong.site/projects/TurboGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15912 2026-06-16 cs.LG cs.AI 新提交

On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents

基于课程回合级指导的在线策略蒸馏用于多轮智能体

Gengsheng Li, Mao Zheng, Mingyang Song, Ruiqi Liu, Tianyu Yang, Jie Sun, Qiyong Zhong, Haiyun Guo, Junfeng Fang, Dan Zhang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Large Language Model Department, Tencent(腾讯大语言模型部) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院)

AI总结 针对多轮智能体在线策略蒸馏中错误累积导致教师监督失效的问题,提出混合教师和学生生成回合的Guided-OPD算法,通过课程式衰减教师干预概率,在ALFWorld等任务上平均提升21.1%得分和25.5%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15906 2026-06-16 cs.IR cs.AI cs.CL cs.DB cs.MM 新提交

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

MAGE-RAG:面向长文档问答的多粒度自适应图证据多模态RAG

Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出MAGE-RAG框架,通过离线构建包含页面和元素节点的证据图,在线自适应构建证据子图,平衡证据覆盖与噪声控制,在长文档多模态问答中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15888 2026-06-16 cs.SD cs.AI eess.AS 新提交

NVMOS: Non-Verbal Vocalization Quality Assessment in Speech

NVMOS:语音中非语言发声质量评估

Jialong Mai, Jinxin Ji, Xiaofen Xing, Wencui Liu, Xiangmin Xu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对非语言发声(如笑声、叹息)的感知质量评估空白,构建NV-MOS数据集,提出首个专用模型NVMOS,通过局部聚焦模块达到专家级评估一致性。

Comments 6 pages. Code and model: https://github.com/yongaifadian1/NVMOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15880 2026-06-16 cs.CV cs.AI 新提交

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

深度残差注入:多模态大语言模型的全频谱取证信号感知

Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen, Ke-Yue Zhang, Yue Zhou, Caiyong Piao, Bin Li, Taiping Yao, Bo Wang, Youchang Xiao, Shouhong Ding

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对多模态大语言模型在取证中难以同时保留语义知识和捕获低级生成器伪影的问题,提出Deep-VRM方法,通过将伪影特定视觉信号作为残差路径注入中间层,实现全频谱信号感知,达到鲁棒检测性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15846 2026-06-16 cs.RO 新提交

FlashNav: Ultra-Fast Policy Training for Robot Navigation within 20 Seconds

FlashNav:20秒内实现超快速机器人导航策略训练

Shanze Wang, Yiwei Qian, Xinming Zhang, Jun Xue, Siwei Cheng, Xianghui Wang, Qingyuan Hu, Xiaoyu Shen, Wei Zhang

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出FlashNav框架,通过GPU加速和MDP对齐实现20秒内训练可部署的导航策略,在TurtleBot2和Unitree Go2上验证成功。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15833 2026-06-16 cs.CL 新提交

When Correct Edges Cannot Be Verified: A Provenance Gap in Incomplete KGQA and a Provenance-Favoring Completion Policy

当正确边无法被验证:不完全KGQA中的溯源缺口及一种偏好溯源的补全策略

Yongqi Kang, Yu Fu, Yong Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对不完全知识图谱问答中补全边的可验证性问题,发现76-96%的正确边缺乏文本支持,提出偏好溯源的TGComplete策略,在保持答案质量的同时显著提高边精度和严格忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15647 2026-06-16 cs.AI cs.CV cs.RO 新提交

Towards Next-Generation Healthcare: A Survey of Medical Embodied AI for Perception, Decision-Making, and Action

迈向下一代医疗:医疗具身AI在感知、决策与行动中的综述

Cheng Zhang, Qing Cai, Xingzheng Wu, Xun Yang, Xiaojun Chang, Bingkun Bao, Liqiang Nie, Xinwang Liu, Yi Yang

机构 * School of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院) Innovation School of Artificial Intelligence, Hefei University of Technology(合肥工业大学人工智能创新学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ReLER Laboratory, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文系统综述医疗具身AI的核心组件,强调感知、决策与行动的协调集成,并分析临床实践中的挑战与未来方向。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15267 2026-06-16 eess.AS cs.SD 新提交

Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity

基于LLM的TTS中的动态韵律预测以提高说话人相似度

Zhenwei Mou, Liping Chen, Yajun Hu, Zhen-Hua Ling, Xin Fang, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

AI总结 针对LLM-based TTS忽略风格特定韵律模式导致说话人相似度不足的问题,提出基于先前预测语音的动态音节韵律预测方法,显著提升韵律学习能力和说话人相似度。

Comments Accepted to INTERSPEECH 2026. 5 pages, 2 figures. Audio samples: https://muzw.github.io/dynapros/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15264 2026-06-16 eess.AS cs.SD 新提交

DuraMark: Duration-Embedded Watermarking in LLM-based TTS

DuraMark: 基于LLM的文本转语音中的时长嵌入水印

Zhenwei Mou, Weili Jiang, Liping Chen, Zhen-Hua Ling, Kong Aik Lee, Kai Gao, Boyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Forensic Science, Ministry of Public Security(公安部刑侦科学研究所) The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出DuraMark,一种基于音节时长编辑的信息级水印框架,利用可控时长的LLM-TTS模型嵌入水印,并使用时长提取器检测,有效抵抗生成式攻击。

Comments Accepted to INTERSPEECH 2026. 5 pages, 1 figure. Audio samples: https://muzw.github.io/duramark_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15253 2026-06-16 cs.CV 新提交

Focus, Align, and Sustain: Counteracting Gradient Dilution in Incremental Object Detection

聚焦、对齐与维持:对抗增量目标检测中的梯度稀释

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Yu Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出FAS框架,通过注入先验的查询聚焦判别信号、确定性锚点蒸馏对齐分配、流形支持回放维持旧类分布,解决增量目标检测中梯度稀释导致的性能下降问题。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15225 2026-06-16 cs.LG cs.AI cs.IR 新提交

Edu-Theater: A Data-Efficient Agent Framework for Scalable Learner Behavior Simulation through Staging Roll-Call

Edu-Theater: 一种通过点名排演实现可扩展学习者行为模拟的数据高效智能体框架

Weibo Gao, Qi Liu, Linan Yue, Zheng Zhang, Yichao Du, Fangzhou Yao, Ao Yu, Zhenya Huang, Shijin Wang

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) iFLYTEK Co., Ltd.(科大讯飞股份有限公司)

AI总结 提出Edu-Theater框架,通过构建群体水平能力先验和少量诊断查询,利用LLM智能体模拟学习者行为,在减少数据需求的同时提高模拟精度,并增强下游自适应测试等应用。

Comments LLM Agent, Educational Data Mining, Data Synthesis, Human Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15209 2026-06-16 cs.AI cs.CR 新提交

Attribute Inference from Interactive Targeted Ads

从互动定向广告中进行属性推断

Peihao Li

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文建模了互动定向广告中用户属性推断的噪声信道,通过合成基准评估了贝叶斯、监督、正无标签和自适应攻击,发现披露策略是最有效的控制手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15200 2026-06-16 cs.CV 新提交

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用

Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。

Comments 45 pages. https://icml.cc/virtual/2026/poster/63682

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15161 2026-06-16 cs.CL 新提交

Beyond Layer Importance in Layer-wise Sparsity: An Inter-Layer Perturbation-Absorption Perspective

超越逐层稀疏中的层重要性:层间扰动吸收视角

Tao Jing, Ningxin Wu, Chen Kang, Dong Yu, Changliang Li, Pengyuan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文通过受控扰动实验发现大语言模型中不同层对剪枝扰动的响应存在异质性,早期层放大扰动而中后期层吸收扰动,并基于此提出吸收感知校正方法,在70%稀疏度下降低困惑度7.13%并提升零样本准确率1.02%。

Comments 10 pages, 4 figures, 4 tables. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15110 2026-06-16 cs.CV 新提交

Physics-Driven Zero-Shot MRI Reconstruction with Non-local Image Priors

基于非局部图像先验的物理驱动零样本MRI重建

Lingtong Zhang, Wenlei Li, Mu He, Li Xiao, Yang Ji

机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

AI总结 提出一种物理驱动的零样本自监督学习框架,通过线圈灵敏度图引导的动态存储库、SPIRiT正则化和非局部自相似像素银行,解决欠采样MRI重建中的监督不足和过拟合问题,在FastMRI数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15104 2026-06-16 cs.CV 新提交

Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space

红外与可见光图像的文本驱动融合:在双曲空间实现图像场景自适应

Huan Kang, Hui Li, Tianyang Xu, Tao Zhou, Xiao-Jun Wu, Josef Kittler

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出一种文本驱动的红外与可见光图像融合框架,利用双曲流形学习嵌入层次语义,通过BLIP文本提示引导视觉-属性对齐,实现无文本输入的自适应融合,性能优于现有方法。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14905 2026-06-16 cs.CV 新提交

Deep Learning in Seismic Interpretation: Federated Advances in Salt Dome Segmentation

地震解释中的深度学习:盐丘分割的联邦学习进展

Muhammad Zain Mehdi, Muhammad Zaid, Owais Aleem

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出FedSaltNet联邦学习框架,结合轻量级Small U-Net和前景加权聚合策略,在四个非独立同分布地震数据集上实现盐丘分割,IoU相对提升4.0%,并证明简单架构在数据受限联邦环境中的必要性。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14882 2026-06-16 cs.RO 新提交

DynaHMRC: Decentralized Heterogeneous Multi-Robot Collaboration for Dynamic Tasks with Large Language Models

DynaHMRC: 基于大语言模型的动态任务去中心化异构多机器人协作

Wenhao Yu, Yu'ang Xie, Yifan Duan, Jie Peng, Guanting Ye, Ka-Veng Yuen, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) University of Macau (UM)(澳门大学)

AI总结 提出DynaHMRC去中心化框架,每个机器人作为角色感知的LLM智能体,通过四阶段闭环流程(自我描述、任务分配与领导竞标、领导者选举、反思执行)实现动态异构多机器人协作,并构建基准测试验证其高效性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14865 2026-06-16 cs.LG cs.AI 新提交

GRAPE: Guided Parameter-Space Evolution for Compact Adversarial Robustness

GRAPE: 面向紧凑对抗鲁棒性的引导式参数空间演化

Zhiyuan Ye, Xiangyu Zhou, Ji Qi, Hao Zhang, Yi Zhou

机构 * University of Science and Technology of China(中国科学技术大学) China Mobile (Suzhou) Software Technology Co., Ltd.(中移(苏州)软件技术有限公司)

AI总结 提出GRAPE框架,通过逐步暴露参数空间并利用对抗谱利用分数引导容量分配,在固定计算预算下提升紧凑模型的对抗鲁棒性,在CIFAR-10上以1.009倍FLOPs将PGD-20鲁棒准确率从51.70%提升至56.94%,参数减少21.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14821 2026-06-16 cs.IR cs.AI 新提交

Co-Scraper: query-aware DOM Pruning and Reusable Scraper Synthesis for Lightweight Web Data Extraction

Co-Scraper: 查询感知的DOM剪枝与可复用爬虫合成用于轻量级网页数据提取

Shoupeng Wang, Jiantao Qiu, Wuyang Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,开放数据实验室) University of Science and Technology of China(中国科学技术大学)

AI总结 提出Co-Scraper两阶段框架,通过查询感知的DOM剪枝和稳定提取策略归纳,利用微调Qwen3-8B模型将网页内容转化为可执行程序化包装器,在SWDE测试集上达到94.78%的F1分数和90.39%的复用成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14788 2026-06-16 cs.SD cs.AI cs.LG eess.AS 新提交

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

统一声学特征与文本的多模态大语言模型用于神经退行性疾病筛查

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出NeurMLLM框架,通过多模态大语言模型融合声谱图、MFCC和文本,实现阿尔茨海默病和帕金森病的精细分期,优于传统方法和现有LLM方法。

Comments IEEE International Conference on Healthcare Informatics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏