Neural Code Translation of Legacy Code: APL to C#
遗留代码的神经代码翻译:APL到C#
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文研究了利用大语言模型将APL翻译为C#的挑战,通过三种引导策略提升翻译质量,构建了功能等价的代码对数据集,并开发了自动化评估流程验证语法和功能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
遗留代码的神经代码翻译:APL到C#
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文研究了利用大语言模型将APL翻译为C#的挑战,通过三种引导策略提升翻译质量,构建了功能等价的代码对数据集,并开发了自动化评估流程验证语法和功能。
智能影响商(IIQ):衡量组织AI影响的框架
机构 * Inception ; G42
专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG
AI总结 本文提出IIQ框架,通过整合新颖性加权、时间衰减的token库存与使用频率等指标,量化AI在组织中的影响,区分高频低杠杆使用与自主高影响的AI应用。
提示激活二元性:通过注意力层面干预改进激活引导
机构 * Southern University of Science and Technology(南方科技大学) ; University of Notre Dame(Notre Dame 大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出GCAD方法,通过提取系统提示对自注意力的影响并应用token级门控,提升长周期连贯性与特质表达。
Comments 23 pages, 5 figures. This paper proposes GCAD, an attention-level activation steering method for more stable multi-turn behavior control
Do-Undo基准:图像生成中动作理解的可逆性
机构 * York University(约克大学) ; Vector Institute for AI(人工智能向量研究所) ; Qualcomm AI Research(高通人工智能研究)
专题命中 评测与基准 :language model(abstract);分类 cs.LG
AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。
Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/
面向AI功能开发者的IDE工具包
机构 * JetBrains
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI
AI总结 本文提出面向AI功能开发者的IDE工具包,通过集成追踪和评估功能,帮助软件工程师更高效地测试和调试AI功能,降低开发门槛。
Comments Published at IDE'26 co-located with ICSE'26
超越语言的知识:弥合多语言机器遗忘评估中的差距
机构 * GSCST, Seoul National University(首尔国立大学GSCST) ; AIIS, Seoul National University(首尔国立大学AIIS) ; Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) ; Korean Surgical Researcher Foundation, Republic of Korea(韩国外科研究员基金会)
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL
AI总结 本文提出两种新指标评估多语言信息分布,分析不同语言对间信息一致去除,为多语言机器遗忘评估提供新视角。
论点重建作为大语言模型批判性思维的监督
机构 * Carnegie Mellon University(卡内基梅隆大学) ; KAIST(韩国科学技术院) ; KIT(卡尔斯鲁厄理工学院)
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL
AI总结 本文提出GAAR引擎和Arguinas数据集,探讨通过论点重建提升大语言模型批判性思维能力,实验显示在七项任务中训练模型表现更优。
描述:距离标注的交通感知问答(DTPQA)
机构 * Department of Electronic and Computer Engineering, University of Limerick(利默尼克大学电子与计算机工程系) ; Data Driven Computer Engineering Research Centre, University of Limerick(利默尼克大学数据驱动计算机工程研究中心) ; Lero, The Irish Software Research Centre, University of Limerick(利默尼克大学Lero爱尔兰软件研究中心) ; Valeo Vision Systems(瓦莱奥视觉系统)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本文提出DTPQA基准,用于评估视觉语言模型在交通场景中的感知能力,包含合成和真实数据集,通过距离标注分析模型在远距离下的表现。
Journal ref IEEE Data Descriptions, 2026
DriveCtrl: 基于条件的仿真到现实驾驶视频生成
机构 * University of Warwick(沃里克大学) ; Northwestern Polytechnical University(西北工业大学) ; Queen Mary University of London(伦敦大学玛丽女王学院)
专题命中 评测与基准 :foundation model(abstract)
AI总结 本文提出DriveCtrl框架,通过深度条件生成逼真的驾驶视频,保留场景结构和运动模式,提升生成视频的现实感和时序一致性,同时引入可扩展的数据生成管道和Driving Video Realism Score评估指标。
MetaGEM:通过深度酶-代谢物锚定进行底-up式基因组尺度代谢网络重建
专题命中 评测与基准 :language model(abstract)
AI总结 MetaGEM通过酶作为物理锚点,将系统级网络推断转化为酶-代谢物相互作用预测,实现了基因组尺度代谢网络的高效重建,并在多个菌种中生成了功能代谢模型。
Comments 21 pages, 5 figures, 3 tables
GeRM:从物理真实到照片级的生成渲染模型
机构 * State Key Lab of CAD\&CG, Zhejiang University ; Zhejiang Lab China ; State Key Laboratory of Industrial Control Technology, Zhejiang University China ; Zhejiang University China ; Zhejiang Lab ; State Key Laboratory of Industrial Control Technology, Zhejiang University ; Zhejiang University
专题命中 评测与基准 :language model(abstract)
AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。
PVRF:通过先验调节和速度约束的修正流实现一体化的恶劣天气去除
机构 * McMaster University(麦斯特大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出PVRF框架,结合零样本软天气感知与速度约束修正流细化,提升恶劣天气去除的保真度和感知质量,具有良好的跨数据集泛化能力。
Comments 10 pages, 9 figures, and 4 tables
多步推理和工具使用中黑盒LLM的提示策略:基于经验迭代蒸馏的强化学习框架
机构 * Google Research(谷歌研究)
专题命中 效率与部署 :LLM(title_cn,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出基于经验迭代蒸馏的强化学习框架,用于训练提示策略以提升黑盒LLM的多步推理和工具使用能力,实验显示在逻辑推理和工具使用任务中性能显著提升。
Comments 10 pages and reference, appendix
多尺度去量化:通过激活分解消除去量化瓶颈以实现高效的LLM推理
机构 * Huawei(华为)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出多尺度去量化方法,通过分解高精度激活为多个低精度组件,避免权重转换,提升LLM推理效率。
为LLM服务中的推测解码开发一个可解释的延迟模型
机构 * MIT(麻省理工学院) ; Red Hat AI(红帽人工智能)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出一个可解释的延迟模型,用于LLM服务中的推测解码,通过Little定律推断有效批处理大小,并分解预填充、草稿和验证的请求需求,以解释延迟变化及系统配置影响。
Comments 10 pages, 8 figures
动态混合精度路由用于高效多步LLM交互
机构 * University of Arizona(亚利桑那大学) ; University of Pittsburgh(匹兹堡大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Central Florida(佛罗里达中央大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出动态混合精度路由框架,通过自适应选择高精度与低精度LLM,在多步决策中实现准确率与成本的平衡。
一种面向硬件的、分层的后训练量化方法用于大语言模型
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG
AI总结 本文提出了一种面向硬件的分层后训练量化方法,通过优化代码本和硬件效率,实现4.5-6位/权重的近无损精度,展示了小原子块与精心选择的精度可替代传统FP8。
Comments 21 pages
诊断LLM强化学习中的训练推断不匹配
机构 * ByteDance(字节跳动) ; The University of Virginia(弗吉尼亚大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示LLM强化学习中训练与推断阶段的不匹配问题,通过VeXact实验显示微小数值差异可能导致训练崩溃,并提出缓解措施。
XFP:面向LLM推理的质量导向自适应码本量化与稀疏异常分离
机构 * Gemini Stiftung(吉姆米基金会)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 XFP通过自适应码本量化和稀疏异常分离技术,实现高质量LLM推理,无需Hessian或校准数据,支持动态调整码本大小和异常预算,提升推理速度和精度。
Comments 17 pages, 3 figures, 17 tables, 1 algorithm. Code: https://github.com/flash7777/vllm/tree/multiquant
基于查询的测试时自我训练用于大语言模型
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) ; Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。
Comments 17 pages, 7 figures
EnergyLens: 多GPU LLM推理优化中的预测能效探索
机构 * Massachusetts Institute of Technology(麻省理工学院) ; IBM Research(IBM研究院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 EnergyLens通过einsum接口和MoE建模优化多GPULLM推理能耗,实现9.25%-13.19%的能耗预测精度,揭示配置间能效差异并推动分布式服务。
通过基于LLM的多智能体系统优化PyTorch推理
机构 * NVIDIA Corporation(NVIDIA公司) ; Microsoft Corporation(微软公司) ; Ansel et al. ( 2024 )(Ansel等人(2024)) ; Sabne ( 2020 )(Sabne(2020)) ; Kerr et al. ( 2017 )(Kerr等人(2017)) ; Tillet et al. ( 2019 )(Tillet等人(2019)) ; Spector et al. ( 2024 )(Spector等人(2024)) ; Ouyang et al. ( 2025 )(Ouyang等人(2025)) ; Lange et al. ( 2025a(Lange等人(2025a;b)) ; b )(Li等人(2025)) ; Li et al. ( 2025 )(METR(2025)) ; METR ( 2025 )(Andrews和Witteveen(2025)) ; Andrews and Witteveen ( 2025 )(Baronio等人(2025)) ; Baronio et al. ( 2025 )(Novikov等人(2025)) ; Novikov et al. ( 2025 )(Wei等人(2025)) ; Wei et al. ( 2025 )(Sharma(2025)) ; Sharma ( 2025 )
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出基于LLM的多智能体系统用于优化PyTorch推理,发现exploit策略与error-fixing智能体结合效果最佳,实现2.88倍速度提升。
GEAR:通过自蒸馏实现的粒度自适应优势重加权用于LLM智能体
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GEAR通过自蒸馏获取token和片段级信号,实现粒度自适应的优势重加权,提升长时间跨度任务中的智能体性能,实验表明在数学推理和工具使用任务中优于传统方法。
用于大型语言模型的分布校正离线数据蒸馏
机构 * George Mason University(乔治·马歇尔大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文提出一种分布校正的离线推理蒸馏框架,通过适应性强调与学生模型推理分布更一致的教师监督,提升推理准确性并保持指令遵循能力。
防御冲突:在大型语言模型中测量和解释防御冲突
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
AI总结 研究探讨了大型语言模型中防御措施的相互作用,发现顺序部署导致38.9%的防御措施在原有防护维度上加剧风险,提出基于层间冲突评分的轻量级缓解方法。
Comments Under Review
Pythia:利用工作流可预测性实现高效的智能体原生LLM服务
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文提出Pythia系统,通过在服务层简单接口捕获工作流语义,解决智能体服务中的缓存命中率低、资源竞争和队列延迟问题,提升吞吐量和任务完成时间。
通过字节级模拟解耦子词分词对语言模型训练的益处
机构 * Nous Research
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 本文通过字节级预训练流程解耦子词分词的影响,探讨其对训练效率和模型性能的贡献,揭示子词边界作为语言先验的重要性。
Comments 14 pages, 7 figures
AMiD: 基于 α-混合助手分布的大型语言模型知识蒸馏
机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院)
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AMiD框架,通过引入α-混合助手分布解决LLM知识蒸馏中的容量差距和训练不稳定问题,提供更广泛的理论基础和更稳定的训练效果。
Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)
BiSpikCLM: 一种整合无Softmax脉冲注意力和脉冲感知对齐蒸馏的脉冲语言模型
机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University, Shenzhen, China(电子工程学院,深圳研究生院,北京大学,深圳,中国) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 BiSpikCLM是首个完全二进制脉冲MatMul-free因果语言模型,通过无Softmax脉冲注意力和脉冲感知对齐蒸馏实现高效训练,显著降低计算成本。
PreFT:仅前缀微调用于高效的推理
机构 * Stanford University(斯坦福大学) ; Tilde Research(Tilde研究)
专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PreFT,通过仅在前缀阶段应用适配器以提高多适配器服务的吞吐量,实验显示其在不同任务中均优于传统PEFT。