arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 286 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 39 篇

2607.25579 2026-07-29 cs.CL cs.AI 新提交 87%

IRIS: Reusable Identity Representations from Frozen LLMs for Entity Alignment

IRIS:来自冻结语言模型的可重复使用身份表示用于实体对齐

Xinran Liu, Shengtao Li, Shouqian Shi, Ge Wang, Xin-Wei Yao

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究实体对齐问题,传统方法语义理解不足,基于LLM的方法未形成稳定身份空间。提出IRIS框架,从冻结LLM提取上下文表示构建实体签名,形成共享空间实现跨图谱对齐,在多个基准测试中取得良好成绩。

Comments 9 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25995 2026-07-29 cs.CR cs.AI 新提交 86%

Does Runtime Topology Context Improve LLM-Generated Kubernetes Security Patches?

运行时拓扑上下文能否改进大语言模型生成的Kubernetes安全补丁?

Farooq Shaikh

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 研究Kubernetes安全补丁问题,引入KuTIE利用实时集群上下文改进大语言模型生成补丁,通过在VulnCare平台试验,发现拓扑上下文可大幅提升拓扑相关补丁正确性,远超仅依赖扫描器上下文。

Comments Accepted at the Workshop on the Use of Large Language Models for Cybersecurity (LLMSec), co-located with ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24904 2026-07-29 cs.CV cs.CL 新提交 85%

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24762 2026-07-29 cs.AI cs.PF 新提交 85%

Kernel Forge: An Agent Harness for LLM-based Generation and Optimization of CUDA Kernels

Kernel Forge:用于基于大语言模型的CUDA内核生成与优化的代理框架

Joshua Brodsky, Dhravid Kumar, Savini Kashmira, Jayanaka Danatanarayana, Jason Mars, Krisztian Flautner, Lingjia Tang

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对机器学习模型中计算内核优化需专家手写代码的问题,提出开源端到端代理框架Kernel Forge,它支持多种工作负载,用蒙特卡洛树搜索优化路径,经实验评估,优化后的内核性能优于PyTorch即时模式。

Comments The code is available at: https://github.com/TheJoshBrod/KernelForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27628 2026-07-29 cs.AI 版本更新 85%

DSevolve: Enabling Real-Time Adaptive Scheduling on Dynamic Flexible Job Shop with LLM-Evolved Heuristic Portfolios

DSevolve:基于LLM进化启发式组合的动态车间实时自适应调度框架

XinLei Zhou, Jin Huang, Jie Yang, Xinyu Li, Liang Gao

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出DSevolve框架,通过离线进化高质量调度规则组合并在突发扰动时快速部署,优于现有AHD框架和经典调度规则,解决动态车间调度的适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25346 2026-07-29 cs.IR 新提交 85%

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

反对用于检索的生成式模型:判别式语言模型作为有效的检索器

Zhe Xu, Prachi Agrawal, Kavosh Asadi, Tianyi Chen, Carl Hu, Justin Johnson, Wuwei Lan, Mingfu Liang, Xi Liu, Tik On Lui, Oladipo Ositelu, Sandeep Pandey, Ankit Peshin, Feng Qi, Anil Ramakrishna, Kaushik Rangadurai, Frank Shyu, Luke Simon, Yang Yang, Chiyu Zhang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24788 2026-07-29 cs.AI cs.CL cs.LG 新提交 85%

GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference

GLIDE:用于高效大语言模型推理的引导式分层混合注意力机制

Vimal William, Ravi Tandon, Jyotikrishna Dass

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型推理时KV缓存瓶颈问题,提出GLIDE引导式分层混合注意力机制,通过分层自适应平衡线性循环与softmax窗口,非均匀压缩softmax占用空间,实现性能-效率权衡,降低长上下文生成延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25157 2026-07-29 cs.AI 新提交 83%

PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention

PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Jesson Wang, Siheng Wang, Guang Yang, Haoyan Xu, Chenhao Wei, Zhengqing Yuan, Youran Shen, Yanfang Ye, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Stevens Institute of Technology(史蒂文斯理工学院) University of Notre Dame(圣母大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25880 2026-07-29 cs.CR cs.AI cs.CL 新提交 81%

Stemma: Induced Decision Regions Reveal LLM Provenance

Stemma:诱导决策区域揭示大语言模型的来源

Keyu Zhang, Vadim Safronov, Andrew Martin

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型来源测试中现有黑盒方法可靠性不足的问题,引入诱导决策区域,提出Stemma方法,以稳定性等为探针选择原则,在多组源-可疑对测试中表现出色,显著优于基线,对不同部署设置具鲁棒性。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24865 2026-07-29 cs.IR cs.AI cs.LG 新提交 81%

Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems

令牌即所需:用于在推荐系统中实现大语言模型级I/O效率的双用途语义ID

Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模推荐系统的“内存墙”瓶颈,受计算机视觉数据压缩启发,提出双用途语义ID,用分层量化将连续嵌入压缩为离散语义ID执行协作身份和内容重建角色,经实验验证该方法能有效减少系统开销和数据占用,实现高效推荐。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25936 2026-07-29 cs.CR 新提交 80%

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击

Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。

Comments 17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25141 2026-07-29 cs.SE cs.LO cs.SY eess.SY 新提交 80%

Specification-Driven DevOps for Multi-Service Environments

多服务环境下基于规范驱动的DevOps

Oleg Grynets, Kyrylo Fursov, Vasyl Lyashkevych, Volodymyr Veres

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨前沿大语言模型能否利用存储库内容为多服务应用生成配置,通过对三个异构存储库评估发现生成环境虽能运行,但有遗漏,进而区分功能正确性与部署意图保真度并得出最小显式部署规范。

Comments 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25451 2026-07-29 cs.LG cs.CR 新提交 79%

Bits and Memories: Measuring Verbatim Extraction Across LLM Quantization

比特与记忆:测量大语言模型量化中的逐字提取

Akshay Sasi

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.LG

AI总结 研究语言模型量化中逐字提取情况,用Pythia模型及公共序列集,在多精度级别和模型大小下跟踪,发现量化是有选择性的遗忘器,但不足以成隐私保护手段,得出压缩非去记忆训练数据方法,从业者应关注提取的结论。

Comments 8 pages, 3 figures. Code: https://github.com/AkshaySasi/bits-and-memories. Data and results: https://huggingface.co/datasets/AkshaySasi/bits-and-memories

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25209 2026-07-29 cs.IR cs.AI 新提交 79%

VaLiDRec: Variable-Length LLM-Aligned Semantic IDs for Generative Recommendation

VaLiDRec:用于生成式推荐的可变长度大语言模型对齐语义ID

Shutong Qiao, Wei Yuan, Tong Chen, Hao Wang, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对生成式推荐中固定长度语义标识符的问题,提出VaLiDRec框架,通过令牌重要性估计等构建可变长度、大语言模型对齐语义标识符,纳入图感知软提示建模用户偏好,实验证明其性能优越,为生成式推荐提供新范式。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09611 2026-07-29 cs.CV cs.AI cs.CR 版本更新 79%

AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models

AGMark:基于注意力的动态水印技术用于大视觉-语言模型

Yue Li, Xin Yi, Dongsheng Shi, Yongyi Cui, Gerard de Melo, Linlin Wang

机构 * East China Normal University(华东师范大学) Hasso Plattner Institute(哈索普拉特纳研究所) University of Potsdam(波茨坦大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 AGMark通过动态注意力机制提升大视觉-语言模型的水印可靠性,实现高质量生成和强视觉语义保真度。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24953 2026-07-29 cs.LG cs.AI 新提交 79%

Stable FP4 Training via Transposition-Invariant Block Quantization

通过转置不变块量化实现稳定的FP4训练

Mehdi Rahimifar, Amin Darabi, Mehran Taghian Jazi, Xing Huang, Yao Wang, Zhijun Tu, Yufei Cui, Yunke Peng, Hongliang Li

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决大语言模型训练从FP8降至FP4时的不稳定性问题,提出基于2D块FP4量化的低精度训练框架,结合多种策略控制量化误差,在多个模型上评估,实现稳定的端到端FP4训练,性能与BF16相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22568 2026-07-29 cs.CV 版本更新 78%

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image: 一种基于语义优先扩散的文本到图像基础模型

Ruoyu Feng, Jinming Liu, Yuqi Wang, Xin Cheng, Boyuan Liu, Shanglin Li, Hanshen Zhu, Wenfeng Lin, Mingyu Guo, Xin Jin

机构 * SeFi Team(SeFi 团队)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 提出SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,在1B、2B和5B参数规模上训练,仅用125K A800 GPU小时(约Z-Image的10-20%计算量)即达到与Qwen-Image和Z-Image相当或更优的性能,并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03291 2026-07-29 cs.CV 版本更新 78%

DopQ-ViT: Towards Distribution-Friendly and Outlier-Aware Post-Training Quantization for Vision Transformers

DopQ-ViT:面向视觉Transformer的分布友好型和离群值感知的模型后训练量化

Lianwei Yang, Haisong Gong, Haokun Lin, Yichen Wu, Caifeng Shan, Zhenan Sun, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 效率与部署 :post-training(title,abstract)

AI总结 针对视觉Transformer高计算成本及后训练量化性能易降问题,提出DopQ-ViT方法,通过引入Tan量化器保留幂律分布、MAD引导的最优缩放因子选择,在分类和检测任务上优于先前PTQ方法。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25865 2026-07-29 quant-ph cs.AI cs.MA 新提交 77%

OmniQEC: discovering practical quantum error-correcting codes by an AI scientist

OmniQEC:通过人工智能科学家发现实用的量子纠错码

Ge Yan, Shanchuan Li, Pengyue Ma, Qixin Zhang, Pingchuan Ma, Jianping Wang, Min-Hsiu Hsieh, Yuxuan Du

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在发现实用量子纠错码,核心方法是用OmniQEC,它结合自我进化推理与慢快协同工作流程,通过代码级代理探索候选方案并经电路级评估反馈证据。贡献是发现的代码性能优且硬件友好,为大语言模型辅助量子纠错发现奠基。

Comments Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26092 2026-07-29 cs.LG cs.AI 版本更新 73%

GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization

GoQuant: 用于无乘法器二次幂变压器量化的几何正交残差投影

Maoyang Xiang, Tao Luo, Bo Wang

机构 * Information Systems Technology and Design(信息系统技术与设计) Singapore University of Technology and Design(新加坡科技设计大学) Institute of High Performance Computing (IHPC)(高性能计算研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对低比特量化中二次幂格式的低角度分辨率问题,提出几何正交残差投影量化(GoQuant),通过双基几何投影和移位加操作合成高分辨率残差格点,实现硬件高效且无需乘法器的量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25669 2026-07-29 cs.AI 新提交 70%

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配

Haoyang Huang, Wenjie Huang, Tianqi Xu, Hongyaoxing Gu, Kang Tan, Yikai Fu, Yuhao Shen, Tianyu Liu, Baolin Zhang, Jun Zhang, Xinyi Hu, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingchen Wang, Meng Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Alibaba(阿里巴巴)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25270 2026-07-29 cs.CL cs.AI cs.LG 新提交 67%

Where Steering Signals Come From: Activation Source Selection in Activation Steering

转向信号来自何处:激活转向中的激活源选择

Jiaran Ye, Lingxu Ran, Zijun Yao, Chenpeng Wang, Yong Jiang, Lei Hou, Juanzi Li, Liangming Pan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) YiXin-AILab(易信人工智能实验室)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究激活转向中转向信号的来源选择,通过实验表明改变源激活会影响转向成功率,有效转向信号来自执行边界状态,基于此提出尾部减法,揭示转向取决于模型即将做的事而非已出现的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25155 2026-07-29 eess.SY cs.SY 新提交 67%

VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge

VeraGrid-Agent:用于电网边缘分布式最优潮流的工具增强大语言模型

Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 研究针对电网边缘分布式最优潮流问题,提出工具增强大语言模型VeraGrid-Agent,通过自主编写模拟器输入、执行求解器并读取输出作答。引入VeraGrid-MCQ-150测试评估,相比无工具推理,该模型显著提升准确率,且剩余错误源于推理而非求解器执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26042 2026-07-29 cs.CV cs.LG 新提交 57%

VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening

VetClaw:一种用于兽医疾病筛查的边缘云多模态智能系统

Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid

机构 * Southern Illinois University(南伊利诺伊大学) Utah Valley University(犹他谷大学) Jazan University(吉赞大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 VetClaw是用于兽医疾病筛查的边缘云多模态智能系统,用相机模块采集图像等并发送至视觉语言模型分类。它分离智能体交互与工作流编排,超越静态图像分类,症状引导和多模态输入提升性能,将静态模型转变为多功能安全感知系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25915 2026-07-29 cs.AI 新提交 57%

Penelope: Localized Latent Recurrence for Efficient Structured Reasoning

佩内洛普:用于高效结构化推理的局部潜在循环

Yutong Chen, Shouqian Shi, Xinran Liu, Haochen Wang, Jiaying Wang, Tianxing Xu, Yuanxi Wang, Zirui Ding

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 研究复杂结构化推理任务计算问题,提出佩内洛普框架,通过局部潜在循环实现高效推理,将可见推理转移到内部循环路径,在开源基准实验中降低推理延迟,实现准确性-效率权衡。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25716 2026-07-29 cs.CL 新提交 57%

SpeechLLM Meets Federated Learning for End-to-End ASR: English and Italian Case Studies

语音语言模型与联邦学习结合实现端到端语音识别:英语和意大利语案例研究

Mohamed Nabih Ali, Daniele Falavigna, Alessio Brutti

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 研究将联邦学习应用于基于语音语言模型的端到端语音识别,设计通信高效的联邦优化策略,通过英语和意大利语单语ASR任务评估其有效性与稳定性,进行消融研究分析语音编码器架构影响,为多语言场景部署联邦SpeechLLM奠定基础。

Comments Accepted at the 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24770 2026-07-29 cs.AI cs.HC 新提交 57%

ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop

ProcAgent:一种用于边缘端人机协作的过程性任务指导的智能体框架

Azizul Zahid, Subrata Biswas, Bashima Islam, Sai Swaminathan

机构 * University of Tennessee Knoxville(田纳西大学诺克斯维尔分校) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 研究针对家具组装等过程性任务,提出ProcAgent框架,利用提议与验证架构,结合多种技术,在边缘设备上实现实时自适应指导,经多维度评估及用户研究,证明能在不牺牲可用性的情况下于边缘硬件达成自适应过程性辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25794 2026-07-29 cs.CV 新提交 50%

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

通过目标感知数据对齐实现细粒度食品图像理解

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

专题命中 效率与部署 :language model(abstract)

AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25619 2026-07-29 cs.SE cs.CR 新提交 50%

SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents

SkillGate:编码代理中经济高效的运行时恶意技能文件检测

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 效率与部署 :LLM(abstract)

AI总结 研究针对编码代理中恶意技能文件检测问题,提出SkillGate安全网关,采用混合正则表达式预过滤器+大语言模型判断管道,在SkillsBench基准测试中,检测效果好、成本低、运行时开销小,相比现有工具性能显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05899 2026-07-29 cs.CV cs.GR 版本更新 50%

HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing

HOLODECK 2.0:基于视觉-语言的3D世界生成与编辑

Zixuan Bian, Ruohan Ren, Yue Yang, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 效率与部署 :language model(abstract)

AI总结 HOLODECK 2.0通过视觉-语言模型生成高质量3D场景并支持交互式编辑,提升游戏设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏