Nova3D: Code-Native Generation of Programmable 3D Assets
Nova3D:可编程3D资产的代码原生生成
专题命中 评测与基准 :LLM(abstract)
AI总结 研究针对交互式3D世界需求,提出Nova3D系统,以代码原生方式生成可编程3D资产。通过在基准测试中的表现,展示其能生成有效工件,满足多种约束,实现局部编辑和关节运动,在几何方面有竞争力,转变了3D对象的表示形式。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Nova3D:可编程3D资产的代码原生生成
专题命中 评测与基准 :LLM(abstract)
AI总结 研究针对交互式3D世界需求,提出Nova3D系统,以代码原生方式生成可编程3D资产。通过在基准测试中的表现,展示其能生成有效工件,满足多种约束,实现局部编辑和关节运动,在几何方面有竞争力,转变了3D对象的表示形式。
室内环境下无校准的3D多摄像机人体跟踪
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对室内环境下多摄像机人体跟踪依赖校准的问题,提出统一无校准3D MCPT框架,集成多种技术,采用姿态引导3D提升策略和全局身份关联方法,在挑战赛中取得53.13%的HOTA分数,为纯视觉3D跟踪建立基线。
Journal ref The 15th Conference on Information Technology and its Applications (CITA2026), Jul 2026, Ha Long, Vietnam
面向儿童的AIGC视频风险审查:一个基准和知识支持的迭代推理框架
机构 * Shandong University(山东大学) ; Fudan University(复旦大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 评测与基准 :language model(abstract)
AI总结 研究面向儿童的AIGC视频审查问题,构建CAVSR基准和分层风险分类法,提出结合多智能体协作与知识经验的QVRS-E框架,实验证明该方法能增强儿童相关风险审查,产生更可靠报告。
用于分类任务的基于三量子比特的神经量子核
专题命中 评测与基准 :pretraining(abstract)
AI总结 研究聚焦三量子比特,将神经量子核扩展到量子位设置,系统研究关键设计选择。在四个基准数据集任务中,三量子比特NQKs大多优于QNN基线,能从增加特征和系统规模受益,酉表示影响性能,凸显基于量子位量子模型潜力。
对齐异构DFT数据集:一种用于交叉泛函形成能的图神经网络方法
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究针对异构DFT计算中形成能误差导致多源数据整合困难的问题,采用基于图的迁移学习,利用MatPES数据库训练结构感知图神经网络,将PBE能量转换为r2SCAN级精度,有效升级数据集,推动高性能材料基础模型发展。
HyperImageNet:一个用于细粒度高光谱土地覆盖理解的大规模基准
专题命中 评测与基准 :foundation model(abstract)
AI总结 介绍用于细粒度高光谱土地覆盖理解的HyperImageNet基准,含原始图像等数据,支持语义和实例分割,建立开放环境基准评估方法和模型,实验证明其在相关研究中的有效性。
用于校园垃圾检测的合成与派生训练图像:基于YOLOv8n的多种子评估
机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校)
专题命中 评测与基准 :pretraining(abstract)
AI总结 研究校园垃圾检测中合成与派生图像对YOLOv8n检测器的作用,通过多种子实验设置不同联合训练配置,对比不同图像来源及处理方式下的检测效果,发现各配置未超真实图像基线,测试集小难得出特定类别有力结论。
AgenticNav:零样本视觉与语言导航作为工具调用框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Technologies Ltd(华为技术有限公司)
专题命中 评测与基准 :language model(abstract)
AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。
基于视网膜图像的青光眼筛查:面向视网膜知识的动态多级特征整合
机构 * State Key Laboratory of Ophthalmology, Zhongshan Ophthalmic Center, Sun Yat-sen University, Guangdong Provincial Key Laboratory of Ophthalmology and Vision Science, Guangdong Provincial Clinical Research Center for Ocular Diseases(眼科学国家重点实验室、中山眼科中心、中山大学、广东省眼科学重点实验室和视觉科学、广东省眼科临床研究中心) ; Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Hainan International College, Minzu University of China(海南国际学院,中国民族大学) ; School of Information Technology, Faculty of Business and Hospitality, Torrens University Australia(澳大利亚托伦斯大学信息科技学院,商业与酒店管理学院) ; AIM for Health Lab, Faculty of IT, Monash University, Australia(健康AIM实验室,墨尔本大学IT学院,澳大利亚) ; Department of Ophthalmology, Guangzhou First People’s Hospital, the Second Affiliated Hospital of South China University of Technology(广州第一人民医院,华南理工大学第二附属医院) ; The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出基于视网膜知识的动态多级特征整合框架,通过动态窗口机制和知识增强卷积注意力模块提升青光眼筛查的鲁棒性,实验表明其在AIROGS数据集上达到98.5%的AUC和94.6%的准确率。
Comments 15 pages. Published in Knowledge-based System
OccTrack360: 从环视鱼眼相机实现4D全景占用跟踪
机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) ; State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(极端光子学与仪器国家重点实验室,浙江大学) ; National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)
专题命中 评测与基准 :SLM(abstract_cn)
AI总结 OccTrack360提出新的4D全景占用跟踪基准及FoSOcc框架,解决鱼眼成像中的球面投影和体素定位问题,提升占用跟踪性能。
Comments Accepted to IEEE/RSJ IROS 2026. The benchmark and source code will be made publicly available at https://github.com/YouthZest-Lin/OccTrack360
假峰与无声漂移:开源框架中LLM辅助多物理场仿真的失败分类与效率分析
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究LLM辅助多物理场仿真开发中的失败模式,提出八类失败分类法,并通过LPCVD模型案例揭示假峰和无声漂移两类关键错误。
Comments 29 pages, 7 figures, 9 tables
DRC-Aid:利用推理时大语言模型通过智能体框架进行设计规则校正
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 研究针对布局中设计规则违规问题,提出DRC-Aid闭环智能体框架,利用确定性规则引擎、大语言模型等,通过预算深度优先搜索等方法进行局部DRC修复,在相关布局评估中效果良好,基于LLM的选择优于其他策略。
Comments 7 pages
训练语言模型以与推理时控制器协作
专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)
AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。
CONSISTRE:用于文档级关系抽取的统一一致性感知框架及大语言模型
机构 * Université de Sherbrooke(舍布鲁克大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 研究针对文档级关系抽取中,大语言模型预测易违反关系约束的问题,提出CONSISTRE统一框架。通过推理时的约束感知等及训练时的知识蒸馏强化学习两条路径解决,实验表明该框架有效提升性能,缩小开源与专有模型差距,增强可靠性。
Comments 13 pages, 2 figures. Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing
一种基于MLIR的大语言模型编译方法
机构 * Sophgo Inc(算能科技有限公司)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 针对大语言模型在专用硬件部署的挑战,提出基于MLIR的编译方法,用TopOp和TpuOp方言表示模型,分阶段编译,在TPU-MLIR编译器等项目实现,支持多种模型及量化部署形式。
大语言模型中的分层分级
机构 * Oakland University(奥克兰大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究提出分级大语言模型(GLLMs)框架,通过代数方法为变换器表示空间分级并传播加权标量作用,扩展相关理论到自回归语言模型。证明分层目标下分级与无分级的极小极大分离,最优分级可离线估计,训练后编译成标准变换器,兼具多种优势。
CSV-Decode: 可证的子词汇解码以实现高效的大型语言模型推理
机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) ; College of Engineering, Columbia University(哥伦比亚大学工程学院) ; Department of Statistics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校统计学系)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 CSV-Decode通过构建子词汇表实现高效的大语言模型推理,提供精确的top-k认证和ε-认证的softmax近似,显著提升速度并保持分布保证。
Omni-Prune:用于高效全模态大语言模型的查询感知统一令牌剪枝
机构 * Nanjing University(南京大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究针对全模态大语言模型推理时音频-视频令牌序列长、预填充延迟高和GPU内存使用量大的问题,提出无需训练的查询感知Omni-Prune框架,联合去除冗余并保留跨模态证据,实验证明其性能优于基线方法,能加速预填充并减少内存。
Comments 14 pages, 7 figures. Code: https://github.com/kimberlyii/Omni-Prune
TriSP:用于大语言模型的三信号结构化剪枝
机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究针对大语言模型部署受参数成本限制问题,提出TriSP方法,结合权重幅度、激活范数与梯度敏感性产生通道级分数,联合自适应预算分配和低秩适应恢复,实现低困惑度、高零样本准确率及高推理吞吐量。
关键词很重要:揭示设备端大语言模型提示的能量敏感性
机构 * Georgia State University(佐治亚州立大学)
专题命中 效率与部署 :LLM(title);prompting(title);large language model(abstract);language model(abstract)
AI总结 研究设备端大语言模型提示措辞与能耗关系,通过在智能手机上收集功率测量数据,量化语言特征对解码长度和总能量的影响,发现提示工程是提高能效的有效手段。
用MoP压缩LLM:剪枝混合方法
专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 MoP通过结合深度和宽度剪枝,提升了LLM的压缩效率和推理速度,同时在视觉-语言模型中实现了更高的计算效率。
Comments Code and models are available at: https://github.com/c2d-usp/Efficient-LLMs-with-MoP
RP - OPSD:用于多模态大语言模型的分辨率特权在线自蒸馏
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
AI总结 研究针对多模态大语言模型在线自蒸馏问题,利用同一图像高低分辨率视图信息差提出RP - OPSD,学生策略用低分辨率图像生成轨迹,教师策略用原始分辨率图像监督,实验表明该方法能提升性能并加快训练速度,为在线自蒸馏提供有效途径。
PCA:用于快速视频大语言模型的持久性感知压缩与聚合
机构 * Institute for Artificial Intelligence, Great Bay University(大湾区大学人工智能研究院) ; Sun Yat-sen University(中山大学) ; Youtu Lab, Tencent(腾讯优图实验室) ; Shenzhen University(深圳大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
AI总结 研究视频大语言模型长时帧冗余问题,提出PCA方法,含动态下采样和持久性感知运动增强模块,能在编码前保留视觉信息,提升效率与准确性,优于现有方法,速度有显著提升。
Comments Accepted by ACM MM 2026
SkipOPU:一种基于FPGA的覆盖处理器,用于具有动态分配计算的大型语言模型
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出SkipOPU,一种基于FPGA的覆盖处理器,通过轻量级路由机制动态分配计算,提升大型语言模型推理效率,减少冗余计算并降低存储开销。
Comments 28 pages, 10 figures, accepted by TRETS
KBF:知识边界作为语言模型和黑盒API审计的指纹
机构 * Beihang University China(北航中国) ; Xidian University China(西电中国)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 提出KBF协议,利用知识边界附近的稳定数值召回率作为指纹,低成本黑盒审计模型API,检测替代和混合路由攻击。
理解大语言模型中与语气相关的推理成本
专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究提示语气对大语言模型答案准确性及推理成本的影响,通过在MMLU数据集上对七种语气进行实验,发现输出令牌长度变化超准确性变化,不同模型在不同语气下有不同表现,揭示语气对答案质量和推理资源消耗的作用。
Comments 16 pages, 1 figure, 9-page Appendix
MixQuant:大语言模型的自适应混合精度量化
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :large language model(title);language model(title);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型量化中预算变化及层敏感度评估问题,提出MixQuant自适应框架,通过边缘化失真获与预算无关分数、校准参数并惩罚不合理分配,在多种模型上优于基线,提升准确率并降低困惑度。
Comments Preprint
通过真实世界对话机器人中的上下文感知前言生成实现低延迟轮流发言
机构 * CyberAgent(CyberAgent公司) ; The University of Osaka(大阪大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究基于LLM的对话系统响应延迟问题,提出两阶段增量框架,通过意图准备检测器和VAP模型生成并确定传递前言回复时机,经现场实验评估三种情况,揭示了不同方式在延迟上的时间权衡。
Comments 5 pages, 4 figures. Accepted at ICMI LBR 2026
HeraSys:通过细粒度端到端优化实现多个大语言模型工作流的协同服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大语言模型服务系统,HeraSys通过细粒度编排消除工作流间计算冗余,引入负载感知联合调度策略,结合资源倾斜机制等,有效减轻尾部延迟并提高吞吐量,实验证明其能显著降低延迟、提升服务吞吐量。
Comments to be published in ICML 2026
用于复杂囚禁离子架构的高效大语言模型生成的穿梭编译器
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究利用大语言模型Claude Opus 4.7和Claude Fable 5为复杂囚禁离子架构生成穿梭编译器,经实验对比,该编译器能有效减少穿梭时间步,无需人工算法工程,大幅缩短新架构开发时间。
Comments 56 pages, 6 figures, 7 tables