arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2789
2609.26796 2026-09-23 cs.CL 新提交

Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs

Flash-dLLM:面向快速、内存高效的扩散大语言模型的IO感知KV缓存与并行解码

Quan Nguyen-Tri, Mukul Ranjan, Zhiqiang Shen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 Flash-dLLM提出IO感知融合KV缓存与自草拟验证并行解码,无需训练即加速扩散LLM推理,在GSM8K和HumanEval上分别比Elastic-Cache快5.1倍和11.0倍。

Comments Code available at: https://github.com/VILA-Lab/Flash-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26795 2026-09-23 cs.RO cs.CV cs.GR 新提交

ϕ-RIE: From Photorealistic Reconstruction to Interactive Environments

ϕ-RIE:从照片级真实重建到交互式环境

Runyi Yang, Deheng Zhang, Xiaoye Wang, Kanzhi Wu, Lei Sun, Ajad Chhatkuli, Kunyu Peng, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学圣克利门特奥赫里德大学INSAIT研究所) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 针对3DGS重建缺乏物理交互支持的问题,提出ϕ-RIE流水线,通过耦合资产构建与源移除,将选定对象转为可移动资产并补全背景,在ScanNet++上提升匹配F1至0.383,实现交互式场景转换。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26793 2026-09-23 cs.CV 新提交

HARMONY: Hierarchical Agentic Reasoning for MONocular Image-to-Scene Synthesis

HARMONY:用于单目图像到场景合成的分层智能体推理

Shufan Sun, Chen Wang, Enxin Song, Jiatao Gu, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出HARMONY分层智能体推理框架,结合VLM语义推理与几何基础模型,实现从单目图像到高保真3D场景的合成,优于现有重建基线。

Comments Project Page: http://cwchenwang.github.io/harmony

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26792 2026-09-23 cs.RO cs.CV 新提交

DreamStream: Towards Policy-Oriented Generative Simulation for End-to-End Driving

DreamStream:面向端到端驾驶的策略导向生成式仿真

Ziyang Leng, Sicheng Mo, Seth Z. Zhao, Haoyuan Cai, Yu Zeng, Rowan McAllister, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Toyota Research Institute(丰田研究所)

AI总结 DreamStream提出策略导向的生成式闭环仿真器,通过自回归视频模型和FDπ指标缩小仿真到真实差距,并构建Navhard-CL基准以暴露驾驶策略失败模式。

Comments Accepted to CoRL 2026. Project page: https://vail-ucla.github.io/DreamStream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26781 2026-09-23 cs.CL cs.MA 新提交

Agensh: Scaling Organizational Intelligence to 1,024 Agents

Agensh:将组织智能扩展到1,024个智能体

Zhihao Zhan, Ting Song, Li Dong, Shaohan Huang, Jianxun Lian, Yan Xia, Furu Wei

机构 * Microsoft Research(微软研究院)

AI总结 Agensh提出无中央协调器的自组织多智能体框架,通过并发协作循环将智能体扩展至1,024个,显著提升任务通过率,开辟智能体数量作为新的扩展维度。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26780 2026-09-23 cs.CL cs.AI cs.IR cs.LG 新提交

SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue

SpeakerMem-R1:面向多方对话的以说话者为中心的双轨记忆

Haobo Zheng, Tan Tang, Yan Chen, Weijie Wang, Yingcai Wu

机构 * Zhejiang University(浙江大学)

AI总结 针对多方对话中消息归因与状态重建瓶颈,提出双轨记忆框架 SpeakerMem-R1,结合逐字与结构化记忆及人物/群体视图,在多个基准上取得最优结果。

Comments Project Page: https://2022hpsk.github.io/SpeakerMemR1 , Code: https://github.com/2022hpsk/SpeakerMemR1

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26779 2026-09-23 cs.AI cs.LG cs.SE 新提交

CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents

CliffCompaction:面向长时程编码智能体的成本高效压缩

Trang Nguyen, Eulrang Cho, Bingqing Chen, Tim Dettmers

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for AI(博世人工智能中心)

AI总结 提出CliffCompaction自动压缩技术,通过仅截断不重写保持信息忠实,降低长时程编码智能体成本达50%,提升测试时扩展效率,并在KernelBench上超越专门方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26777 2026-09-23 cs.AI cs.SE 新提交

SWE-Serve: Benchmarking Agentic Engineering For Production Inference Serving

SWE-Serve:面向生产推理服务的智能体工程基准测试

Jennifer Williams, Dave Farris, Jeff Farris, Jiantao Jiao

机构 * NVIDIA(英伟达) University of California, Berkeley(加州大学伯克利分校)

AI总结 SWE-Serve是面向生产推理服务的智能体基准,含53个SGLang任务,揭示本地完成与生产正确性差距,最佳配置平均pass@1为75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26774 2026-09-23 cs.CV 新提交

StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training

StableVQ:稳定向量量化分词器训练的实用指南

Bao Tang, Jiahao Guo, Haoxiang Cao, Wenyu Liu, Changqian Yu, Kun Gai, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) KlingAI Research(可灵AI研究院) South China Normal University(华南师范大学)

AI总结 StableVQ通过解耦编码器-解码器与码本的学习目标,提出动态STE、区域VQ损失和解耦调度,在不增加参数的情况下提升VQ分词器训练的稳定性与码本利用率。

Comments Project page: https://tt-day.github.io/StableVQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26760 2026-09-23 cs.AI cs.SE 新提交

Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents

增长的是工具架,而非上下文:从无策略脚手架到可复用专家智能体

Laizhen Li, Jiarui Li, Juanjuan Zhao, Kejiang Ye, Ye Li, Cheng-zhong Xu, Xitong Gao

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) University of Macau(澳门大学)

AI总结 Growing Harness通过失败引导训练将重复控制转化为可复用代码,减少LLM调用并提升成功率,实现可复用的专家智能体。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26758 2026-09-23 cs.AI 新提交

Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It

类型安全不等于无错误:受约束的决策头遵循选项名称,而非其绑定的评分标准

Yu Sun, Junhao Xu

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

AI总结 本研究通过重命名选项名称实验,发现类型化决策模型受选项名称语义极性影响,导致决策排序逆转,但类型错误率仍为零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26756 2026-09-23 cs.CV cs.AI 新提交

FleXray: Universal Clinical X-ray Segmentation

FleXray:通用临床X射线分割

Victor Ion Butoi, Vivek Gopalakrishnan, John V. Guttag, Adrian V. Dalca, Neel Dey

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Massachusetts General Hospital(马萨诸塞总医院) Harvard Medical School(哈佛医学院)

AI总结 FleXray利用物理生成式数据引擎模拟多样X射线,训练通用模型实现全身60个解剖结构的准确分割,并支持定量分析,推动X射线定量化。

Comments 35 pages, 12 figures, 10 tables. Code, models, data, and a browser-based demo at https://flexray.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26733 2026-09-23 cs.CV 新提交

Evaluating the Semantic-to-Geometric Gap in Adversarial Defenses Against Vision-Language Model-Based Plagiarism

评估针对基于视觉-语言模型的抄袭行为的对抗性防御中的语义-几何差距

Christopher Burger, Christina Trotter, Joseph Carlisle, Charles Walter

机构 * Pelican Quantitative(鹈鹕量化) The University of Mississippi(密西西比大学)

AI总结 本研究评估了对抗性图像变换对VLM抄袭的防御效果,发现所有模型均易受扰动,视觉扰动仅作短期措施,长期需重新设计评估。

Comments 10 Pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26731 2026-09-23 cs.CV 新提交

ASTRA-SR: Atmospheric Seeing and Turbulence Restoration for Astronomical Image Super-Resolution

ASTRA-SR:用于天文图像超分辨率的大气视宁度与湍流恢复

Xining Ge, Ziteng Cui, Shuhong Liu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) The University of Tokyo(东京大学)

AI总结 ASTRA-SR是一种基于物理合成数据训练的盲单帧恢复框架,通过联合去噪、去模糊和超分辨率处理,在前景PSNR上比最强基线提升0.49 dB。

Comments 4 pages of main text plus references, 4 figures. Submitted to ICASSP 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26729 2026-09-23 cs.CV 新提交

GAD-MambaUNet: Direction-Group Mamba with Gradient-Adaptive DINOv3 Distillation for Lightweight Medical Image Segmentation

GAD-MambaUNet:基于方向组Mamba与梯度自适应DINOv3蒸馏的轻量级医学图像分割

Fang Wang, Huitao Li, Wenhan Chao, Zheng Zhuo, Xinxin Yang

机构 * Beijing Institute of Petrochemical Technology(北京石油化工学院) Beihang University(北京航空航天大学)

AI总结 本文提出GAD-MambaUNet轻量级医学图像分割网络,通过方向组图选择性扫描和梯度自适应DINOv3蒸馏,在保持高效的同时提升分割精度,并验证了各组件的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26718 2026-09-23 cs.LG cs.AI 新提交

The Sirens' Song: When Proximal Background Context Overshadows Distant Evidence

塞壬之歌:当近端背景上下文遮蔽远端证据

Xiaoyu Yang, Jie Lu, Wei Duan, En Yu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究院) University of Technology Sydney(悉尼科技大学)

AI总结 本文发现长上下文LLM的“近端陷阱”问题,提出LYRA机制重塑注意力分布以增强远端证据检索,并引入ProxBench基准,实验验证了其有效性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26708 2026-09-23 cs.LG cs.AI 新提交

Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit Reasoning

在量化模型所到之处训练:低比特推理的在线策略蒸馏

Yuanteng Chen, Zhilei Liu, Peisong Wang, Yuantian Shao, Chuangyi Li, Weining Wang, Shuang Qiu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) City University of Hong Kong(香港城市大学) NJUST(南京理工大学)

AI总结 针对低比特量化导致的长序列推理退化问题,提出在线策略蒸馏(OPD)阶段,在量化模型实际生成路径上提供教师监督,显著提升数学与代码推理性能保持率。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26704 2026-09-23 cs.CL cs.AI 新提交

Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning

超越重复采样:学习用于LLM推理的搜索策略

Ismail Labiad, Matthieu Kowalski, Marc Schoenauer, Rémi Munos, Julia Kempe

机构 * Meta FAIR Université Paris-Saclay, LISN, Inria, CNRS(巴黎-萨克雷大学,LISN,法国国家信息与自动化研究所,法国国家科学研究中心) NYU Courant Institute and CDS(纽约大学库朗数学科学研究所和数据科学中心)

AI总结 针对LLM推理中朴素重复采样探索不足的问题,提出学习可训练的语义级概念生成搜索策略,以强化学习优化小型概念生成器,提升大型冻结答案生成器在困难数学推理上的pass@k,并具有跨模型迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26702 2026-09-23 cs.CV 新提交

DIFTA-3D: Depth-Consistent Instance-Level Feature Transfer and Adaptation of DINOv3 for 3D Detection

DIFTA-3D:用于3D检测的深度一致的实例级特征迁移与DINOv3适配

Linman Wang, ZiFei Zhang, Chunran Zheng, Xiwang Dong, Jiarong Lin

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 提出DIFTA-3D,通过深度一致特征管线将DINOv3适配到IIFNet3D实例级融合,在ScanNetV2上以Conservative VAID蒸馏获得76.59/62.16 mAP,验证了受控迁移方案的有效性。

Comments 9 pages, 6 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26693 2026-09-23 cs.CL cs.AI cs.SE 新提交

Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation

测量服务栈而非模型:本地工具使用评估中的隐藏混淆因素

Lijuan Tang, Yuemeng Zheng

机构 * Northeastern University(东北大学)

AI总结 本研究揭示本地服务栈(如Ollama、vLLM等)会显著影响编码智能体工具调用评估结果,提出将服务行为纳入评估协议并给出检查清单,以避免混淆模型真实能力。

Comments 9 pages, 4 figures, 3 tables. Accepted at the 2nd Workshop for Research on Agent Language Models (REALM) @ EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26687 2026-09-23 cs.CL cs.CY 新提交

Detecting GPT-Assisted Writing Using Interpretable Stylometric Features

使用可解释风格计量特征检测GPT辅助写作

Rajesh Kumar, Nabeel Siddiqui, Alexander Fuchsberger

机构 * Bucknell University(巴克内尔大学) Susquehanna University(萨斯奎汉纳大学)

AI总结 本研究利用可解释风格计量特征和八种分类器检测GPT辅助写作,随机森林在留出集上达到0.87的ROC-AUC,证明文本内在特征可有效区分人机写作。

Comments 10 pages, 6 figures, 5 tables

Journal ref Hawaii International Conference on System Sciences (HICSS), 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26679 2026-09-23 cs.LG cs.AI 新提交

A Spectral Theory of Grokking: Weight Decay induces Feature Learning

Grokking 的谱理论:权重衰减引发特征学习

Lenz Pracher, Pascal de Jong, Oskar Lieshaus, Alan Jeffares, Steffen Rulands

机构 * Arnold-Sommerfeld-Center for Theoretical Physics(阿诺德-索末菲理论物理中心) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) University of Cambridge(剑桥大学) Standford University(斯坦福大学)

AI总结 本研究提出谱理论,揭示权重衰减驱动特征学习导致 grokking 延迟泛化,预测时间尺度由学习率与衰减乘积控制,并在模加法实验中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26672 2026-09-23 cs.RO 新提交

Imperfection for Precision: Upcycling Imperfect Data for High-Precision Robotic Manipulation

不完美成就精准:将不完美数据升级用于高精度机器人操作

Hao Wei, Yang Liu, Chao Tang, Shengbao Li, Jiangtao Chen, Jinxuan Zhu, Jiaheng Wang, Hong Yin, Zhaofeng Cao, Tingguang Li

机构 * Samsung Robotics eXperience(三星机器人体验中心) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出ε4P方法,通过将低精度目标任务数据和高精度不匹配任务数据在流匹配轨迹的不同噪声阶段分别利用,实现高精度机器人操作,性能提升达31.7个百分点,且可替代等量高质量数据,性能仅降4.2个百分点。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26638 2026-09-23 cs.CL cs.CV 新提交

Diffusion Drafts, AR Verifies: Accelerating Document OCR with Self-Speculative Decoding

扩散草稿,自回归验证:利用自推测解码加速文档OCR

Dohyun Kim, Sungjun Han, Hyungguk Kim, Yusik Kim, Jamin Shin, Paul Hongsuck Seo, Hongjoon Ahn

机构 * Trillion Labs Korea University(高丽大学) Seoul National University(首尔大学)

AI总结 针对自回归OCR推理慢的问题,提出参数共享的GravityOCR模型,结合扩散并行草稿与自回归验证,在OmniDocBench上提升精度并实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26637 2026-09-23 cs.CL cs.AI cs.CR 新提交

Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models

能力强但简洁:提取并刻画前沿模型中的隐藏思维链

Xiaoyu Luo, Tao Ren, Wenrui Yu, Xiao Li, Qiongxiu Li, Johannes Bjerva

机构 * Aalborg University(奥尔堡大学) Seafill

AI总结 本研究通过标准API诱导闭源前沿模型外部化隐藏思维链,验证其与原生推理性能相当,并揭示Astra采用令牌高效的定向推理,为理解前沿模型推理提供行为视角。

Comments 33 pages,14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26634 2026-09-23 cs.CL 新提交

Knowledge Pull Requests for Continual Document Authoring

知识拉取请求:面向持续文档撰写的框架

Alexander Martin, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出知识拉取请求(KPRs)框架,通过提取、过滤、路由声明并标记冲突,实现可解释的持续文档修订,在维基百科跨语言修订和RAGTIME报告中优于重写或重新生成,并提升问答依据。

Comments Code: https://github.com/alexmartin1722/kpr

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26631 2026-09-23 cs.LG cs.CV 新提交

Label-Efficient Learning for Ground-Based Sky-Image Classification: A Benchmark of Transfer Learning, Active Learning, and Pseudo-Labeling on GCD

基于地基天空图像分类的标签高效学习:GCD上迁移学习、主动学习与伪标签的基准研究

Esther Bou Dagher, Viktoriya Bu-Dager, Boguslaw Zegarlinski

机构 * Université Paris Dauphine-PSL(巴黎第九大学) Anglia Ruskin University(安格利亚鲁斯金大学) Polish Academy of Sciences(波兰科学院)

AI总结 本研究在GCD数据集上基准测试迁移学习、主动学习和伪标签三种策略,发现迁移学习在少量标签下即可接近全标签性能,而主动学习和伪标签增益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26629 2026-09-23 cs.CL 新提交

PERSONAWEAVER: Controllable Diversity Beyond Conventional Archetypes in Procedural Character Generation

PERSONAWEAVER:过程化角色生成中超越传统原型的可控多样性

Maan Qraitem, Kate Saenko, Bryan A. Plummer

机构 * Boston University(波士顿大学)

AI总结 针对LLM过程化角色生成中的行为同质化问题,提出PersonaWeaver,通过分离世界构建与行为规范并利用人工策划的道德与对话反应库,在多个设置中实现更广泛的道德和互动多样性。

Comments Accepted at the 1st PANDORA Workshop: Pluralistic AI and NLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26623 2026-09-23 cs.CV 新提交

A Data-Interventional Framework for Auditing Privacy and Fairness in Generative Medical Imaging

用于审计生成式医学影像中隐私与公平性的数据干预框架

Mischa Dombrowski, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院)

AI总结 本研究提出数据干预框架,利用合成解剖指纹作为探针,系统分析扩散模型在医学影像生成中的隐私与公平性张力,发现模型对稀有特征要么遗忘要么记忆,并引入指标t'揭示条件稀有性与记忆化的关系,为安全公平的数据共享提供策略。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:026

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.26620 2026-09-23 cs.CV 新提交

GeoComposer: Geometry-Grounded Photographic Composition Instruction

GeoComposer:基于几何的摄影构图指令

Shuangzhi Li, Qiaoqiao Jia, Xingxin Chen, Guile Wu, Dongfeng Bai

机构 * University of Alberta(阿尔伯塔大学) University of Waterloo(滑铁卢大学)

AI总结 本文提出GeoComposer框架,通过几何感知表示学习和混合奖励强化学习,实现基于三维几何一致性的摄影构图编辑,生成视觉美观且几何一致的构图范例。

详情

展开后加载摘要…

URL PDF HTML 收藏