arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 295 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2608.06620 2026-08-10 cs.SE 新提交 67%

Understanding the Energy Impact of Software Refactoring: A Workload-Aware Study of Controlled Examples and Real-World Commits

理解软件重构的能源影响:一项针对受控示例与真实提交的工作负载感知研究

Haibo Wang, Heng Li, Shin Hwei Tan

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究通过微基准与真实世界基准的大规模实证分析,发现重构的能源影响受工作负载显著影响,现有方法无法可靠识别重构引发的能源回归,需开发更准确的预测技术。

Comments This manuscript is currently under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17145 2026-08-10 cs.GR 版本更新 67%

Text2Villa: Hierarchical Generation of 3D Indoor Environments with Physics-Aware Analysis-by-Synthesis

Text2Villa:通过物理感知的合成分析进行3D室内环境的分层生成

Xiang Tang, Ruotong Li, Xiaopeng Fan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究旨在解决从自然语言生成3D室内场景的问题,提出Text2Villa框架。宏观构建数据集微调布局生成器,微观引入A-PSSG并结合碰撞检测与语义推理,有效解决相关问题,性能优于以往方法,为下游应用提供3D内容基础。

Comments 17 pages, 12 figures, Project page: https://xdlbw.github.io/Text2Villa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07435 2026-08-10 cs.CV cs.AI cs.CL 新提交 62%

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术学院) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。

Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07341 2026-08-10 cs.CL cs.AI 新提交 62%

Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination

零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解

Ruijie Hou, Yueyang Jiao, Zhao Wang, Yingming Li

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对基准测试数据泄露导致的模型评估偏差问题,提出SA-PPG指标与RailCap方法,揭示现有缓解策略的恢复效果被高估,RailCap可实现更低的污染程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06975 2026-08-10 cs.CL cs.AI 新提交 62%

PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue

PHASE-Tree:建模长回合角色扮演对话中的角色状态演化

Bo Tang, Jianan Yang, Junyi Zhu, Yiquan Wu, Rui Zhao, Zhengyu Yang, Yang Zhang, Feiyu Xiong, Zhiyu Li, Jiajun Shen

机构 * MemTensor (Shanghai) Technology(MemTensor(上海)科技) KU Leuven(鲁汶大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Sinar Mas Paper (China) Investment Co., Ltd(金光纸业(中国)投资有限公司) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 针对长回合角色扮演对话的角色状态演化问题,提出多时间尺度角色状态树模型PHASE-Tree,构建基准LongEvoRoleBench并验证其在角色生成任务上的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27853 2026-08-10 cs.CL cs.AI q-fin.CP 版本更新 62%

FinanceHarness: Autonomous Financial Deep Research Framework

FinanceHarness:自主金融深度研究框架

Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 FinanceHarness是一款端到端自动化金融深度研究的自主框架,结合自主智能体与金融专用工具,在FinanceGym基准上大幅提升了金融研究评分规则得分。

Comments FinanceHarness available at https://github.com/Yijia-Xiao/FinanceHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07463 2026-08-10 cs.CV cs.LG 新提交 57%

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

MirrorWorld:利用视频扩散模型生成镜像反射

Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. Lau

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。

Comments Project Page: https://youjunzhao.github.io/MirrorWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07370 2026-08-10 cs.CL 新提交 57%

LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering

LitTraceQA:面向科学问答的多阶段溯源与验证基准

Xuye Liu, Yimu Wang, Peng Shi, Bo Xue, Xiangrui Ke, Songcheng Cai, Kath Choi, Di Wu, Freda Shi, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Amazon(亚马逊公司) City University of Hong Kong(香港城市大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究提出LitTraceQA基准,用于科学问答的多阶段溯源与验证,提供含多类型证据的问答数据,可评估系统的论文检索、证据溯源及答案准确性,助力生成可验证的科学问答结果。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06571 2026-08-10 cs.CR cs.CL 新提交 57%

Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier

答案保留型攻击下的模型置信度:信息性-可操纵性前沿

Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对答案保留型攻击,发现视觉-语言系统的置信度信号不具备固有鲁棒性,四类防御均无效,协调攻击可大幅降低置信度门控下的接受准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-10 cs.CL 新提交 57%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07141 2026-08-10 cs.CV 新提交 50%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交 50%

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07062 2026-08-10 cs.CV 新提交 50%

Explanation Stability of Test-Time Adaptation in Computational Pathology: A Large-Scale Benchmark

计算病理学中测试时自适应的解释稳定性:大规模基准测试

R. G. Bahumanya, Harshith V. M., Shreyank N. Gowda, Anala M. R

机构 * R.V. College of Engineering(R.V.工程学院) University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究构建了计算病理学TTA的大规模基准,发现不同TTA方法对模型解释的影响差异显著,解释稳定性与自适应质量弱相关,强调了解释稳定性是TTA的重要可靠性维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06972 2026-08-10 cs.CV 新提交 50%

Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding?

生成式嵌入基准:密集嵌入中保留了多少信息?

Yun Li, Biao Yang, Peixi Wu, Yunhao Zhou, Mingzhou Jiang, Wei Yuan, Fan Yang, Wenwu Ou

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究提出Generative Embedding Benchmark(GEB),通过仅用嵌入和问题文本的解码器评估7种嵌入模型,发现生成式读出能揭示可分性评估未捕捉的信息瓶颈,视觉语言模型嵌入表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06886 2026-08-10 cs.CV 新提交 50%

HazeSpikeMamba: Coupling Spiking-Inspired and State-Space Features for Self-Supervised Real-World Dehazing

HazeSpikeMamba:结合类脉冲与状态空间特征的自监督真实图像去雾框架

Haoran Liu, Huibin Li, Mingzhe Liu, Peng Li, Guibin Zan

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究提出HazeSpikeMamba框架,结合类脉冲局部路径与注意力状态空间全局路径,采用转导式域适配,在多个真实去雾数据集上取得最优的BRISQUE与NIMA指标

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 56 篇

2608.06723 2026-08-10 cs.LG cs.AI 新提交 92%

Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

基于混合分析-机器学习预测器的大语言模型推理延迟与能耗的多级建模

Saeid Shokoufa, Mohammad Erfan Sadeghi, Mehdi Kamal, Massoud Pedram

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出混合三级框架HYMELL,结合分析建模与机器学习,在NVIDIA H100 GPU上对LLaMA 3 8B的预填充、解码阶段误差均低于5%,可实现LLM推理延迟与能耗的精准估计及能效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06867 2026-08-10 cs.CL 新提交 92%

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan, Zijie Lei, Weizhi Zhang, Kunlun Zhu, Haodong Yue, Keyang Xuan, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学帕克分校) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学) University of Illinois Chicago(芝加哥伊利诺伊大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM路由器难以公平比较和扩展的问题,研究提出LLMRouter统一基础设施,构建含多类任务的基准xRouteBench,发现学习型路由器等的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06557 2026-08-10 cs.DC cs.LG 新提交 92%

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务

Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16336 2026-08-10 cs.CR cs.AI cs.CY 版本更新 92%

On Seeding Watermarks to Detect Verbatim LLM Copy-Paste Responses

检测作业中的直接LLM复制粘贴

Aizierjiang Aiersilan, Artin Yousefi, Robert Pless

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SteganoPrompt工具,通过在作业提示中嵌入隐形指令,使LLM在响应时生成特征签名,帮助教师检测学生直接复制粘贴模型回复的行为。

Comments We are pleased to announce that this paper has been accepted by the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026). We appreciate the valuable feedback from the reviewers and look forward to sharing our findings with the community

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07419 2026-08-10 cs.LG 新提交 90%

Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

超越事后温度缩放:用于大语言模型校准的双层优化方法

Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

机构 * Dartmouth College(达特茅斯学院) University of Pennsylvania(宾夕法尼亚大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract,comments);large language model(abstract);分类 cs.LG

AI总结 针对LLM偏好对齐导致的过度自信与校准问题,提出基于双层优化的校准方法,通过最大化预测分布熵实现,在多项选择与开放式问答任务中提升了校准效果与域外泛化能力。

Comments Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07126 2026-08-10 cs.HC cs.AI 新提交 90%

PHOENIX: Fine-Tuned SLM-Powered Autonomous Satellite Lifetime Extension via Predictive Self-Healing and Multi-Agent AI Recovery

PHOENIX:通过预测性自修复与多智能体AI恢复实现的经微调小型语言模型驱动的自主卫星寿命延长

Sumaiya Islam, Harsha Kumara Moraliyage

专题命中 效率与部署 :SLM(title,summary_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 该研究针对CubeSat在轨故障无法及时修复导致寿命不足的问题,提出PHOENIX系统,利用微调SLM与多智能体AI实现自主故障修复,基于ESA基准验证了初步效果。

Comments 6 pages, 2 figures. Accepted at IEEE IRAI 2026 (International Conference on Responsible Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07091 2026-08-10 cs.HC cs.AI 新提交 90%

Human-Centered Explainable AI for TinyML Edge Devices: A Pareto-Based Selection Framework with LLM-Guided Design

面向TinyML边缘设备的以人为中心的可解释人工智能:基于帕累托的选择框架与大语言模型引导设计

Zeinab Dehghani, Dhavalkumar Thakker, Koorosh Aslansefat, Kuniko Paxton, Bhupesh Kumar Mishra, Baseer Ahmad, Rameez Raja Kureshi

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种整合LLM引导设计与帕累托优化的以人为中心XAI选择框架,用于TinyML边缘设备部署,经皮肤病变分类任务验证可识别帕累托有效权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22481 2026-08-10 cs.DC 版本更新 89%

OmniInfer: System-Wide Acceleration Techniques for Optimizing LLM Serving Throughput and Latency

OmniInfer: 通过优化LLM服务吞吐量和延迟提升系统整体加速技术

Jun Wang, Yunxiang Yao, Wenwei Kuang, Runze Mao, Zhenhao Sun, Zhuang Tao, Ziyang Zhang, Dengyu Li, Jiajun Chen, Zhili Wang, Kai Cui, Congzhi Cai, Longwen Lan, Ken Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 OmniInfer通过统一框架优化LLM服务吞吐量和延迟,减少TPOT和TTFT,提升系统整体性能。

Comments Project page: [this https URL](https://gitee.com/omniai/omniinfer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18871 2026-08-10 cs.LG cs.AI 89%

Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning

周期性异步性:一种用于加速大语言模型强化学习的在线策略方法

Jian Lu, Yi Luo

机构 * Big Data & AI Lab(大数据与人工智能实验室)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种周期性异步框架,通过分离推理与训练部署,提升LLM强化学习的训练效率,采用统一三模型架构和共享提示注意力机制,实现高效异步执行并减少冗余计算,实验显示在NPU平台实现约2倍的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07427 2026-08-10 cs.AI cs.PF 新提交 89%

A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy

一图胜千词:视觉语言模型如何在提升准确率的同时降低AI能源成本

Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出将时间序列编码为二维图的视觉语言模型,可大幅减少输入词元、降低推理能耗,同时在电信异常检测等任务中提升准确率,解决了LLM处理多维度KPI数据的低效问题。

Comments Accepted at the 14th European Conference on Renewable Energy Systems (ECRES), July 7--9, 2026, London, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10317 2026-08-10 cs.RO cs.LG 版本更新 89%

Robot guide with multi-agent control and automatic scenario generation with LLM

基于多智能体控制与大语言模型自动场景生成的机器人引导系统

Elizaveta D. Moskovskaya, Anton D. Moscowsky

机构 * National Research Center "Kurchatov Institute"(国家研究快机构"库恰托夫研究所")

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究开发了结合多智能体资源管理与LLM自动场景生成的混合社交机器人控制架构,在MENTOR-1导游机器人上验证了其能提升长期讲故事任务中机器人交互的自然性与丰富度。

Comments 14 pages, 4 figures, 4 tables, 1 demo-video and repository link. There were major changes: an introduction, a review, and a new experiment. Some tables and figures have also been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02515 2026-08-10 cs.CL cs.LG 版本更新 88%

LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference

LiveMem:在长期运行的大语言模型推理中维持记忆状态连续性

Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Yang Xu

机构 * Southern University of Science and Technology(南方科技大学) Xidian University(西安电子科技大学)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对长期运行LLM推理中上下文切换导致状态不连续的问题,提出LiveMem方法,通过引入独立于活跃上下文的持久记忆状态,实现状态连续性,在LongMemEval等测试中表现领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07279 2026-08-10 eess.SP 新提交 88%

Token Communication for Multimodal Large Language Model

多模态大语言模型的令牌通信

Jingkai Ying, Zhijin Qin, Yuan Shen, Khaled B. Letaief

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。

Comments 13 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07004 2026-08-10 cs.RO cs.SY eess.SY 新提交 88%

Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems

面向复杂动态系统反馈控制器设计的大语言模型基准测试与推理蒸馏

Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Chiba University(千叶大学) Tongji University(同济大学) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究构建了CoDyControlBench基准,评估了6种LLMs的控制器设计性能,开发的15亿参数推理蒸馏模型可实现边缘部署,在机械臂试验中成功完成目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19932 2026-08-10 cs.CL cs.SD 版本更新 87%

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

通过渐进压缩实现口语语言模型的高效模态链推理

Pengchao Feng, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Token Foundry, Alibaba Group(阿里巴巴集团淘系技术)

专题命中 效率与部署 :language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 针对口语语言模型推理能力落后问题,提出高效模态链推理(ECoM推理),通过压缩文本组件提高推理准确性,并用渐进压缩策略训练,实验显示其在口语数学问答基准测试中,增强推理且保持效率,准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏