arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-08 至 2026-06-08 共收录 275 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 64 篇

2606.06526 2026-06-08 cs.AI cs.LG 新提交 73%

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath: 众包数学研究讨论数据集

Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) San Jose State University(圣何塞州立大学) Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07219 2026-06-08 cs.CL cs.SI 新提交 70%

Adversarial Creation and Detection of AI-Generated Social Bot Content

AI生成的社交机器人内容的对抗性创建与检测

Mykola Trokhymovych, Ricardo Baeza-Yates, Alessandro Flammini, Diego Saez-Trumper, Filippo Menczer

机构 * Universitat Pompeu Fabra(庞培法拉大学) Observatory on Social Media, Indiana University(社交媒体观测站,印第安纳大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出对抗性方法模拟恶意用户冒充真人,构建多语言跨平台配对数据集,训练检测模型显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07032 2026-06-08 cs.CV cs.AI 新提交 70%

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06754 2026-06-08 cs.MA cs.CL 新提交 70%

MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring

MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分

Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17561 2026-06-08 cs.SE cs.AI cs.MA 版本更新 70%

Automated Root-Cause Subclassification and No-Code Fix Generation for Invalid Bug Reports

自动化无效bug报告的根因子类划分及无代码修复生成

Mahmut Furkan Gon, Emre Dinc, Tevfik Emre Sungur, Eray Tuzun

机构 * Department of Computer Engineering, Bilkent University(计算机工程系,比尔肯特大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究旨在引入一个标准化的根因导向的无效bug报告子类划分体系,并通过实验测试不同方法在无效子类划分和无代码修复生成中的准确性。研究还分析了不同配置在我们创建的黄金标准基准上的表现。

Comments Submitted to IEEE Transactions on Software Engineering (TSE) and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17548 2026-06-08 cs.SE cs.AI 版本更新 70%

Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review

重新思考AI时代的代码审查:面向代理代码审查的愿景

Hüseyin Özgür Kamalı, Erdem Tuna, Vahid Haratian, Eray Tüzün

机构 * Microsoft(微软) Ankara University(安卡拉大学) Bilkent University(比尔肯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了在AI时代代码审查的演变,提出了一种结合专门代理和人类控制的质量闸门的AI驱动代码审查流程,旨在提升代码审查的效率和可靠性。

Comments Submitted to ACM Transactions on Software Engineering Methodology (TOSEM). A shorter version of this work has been presented at ICSE-JAWs 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08168 2026-06-08 cs.RO cs.AI 版本更新 70%

ViVa: A Video-Generative Value Model for Robot Reinforcement Learning

ViVa:用于机器人强化学习的视频生成价值模型

Jindi Lv, Hao Li, Jie Li, Fankun Kong, Yang Wang, Pengfei Yi, Yifei Nie, Xiaofeng Wang, Zheng Zhu, Chaojun Ni, Qiuping Deng, Hengtao Li, Jiancheng Lv, Guan Huang

机构 * GigaAI Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出ViVa,利用预训练视频生成器联合预测未来本体感受和标量价值,通过时空先验实现可靠价值估计,在三个任务中取得最优结果,与RECAP结合平均成功率达80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05360 2026-06-08 cs.HC cs.AI 版本更新 70%

OGA-AID: Clinician-in-the-loop AI Report Drafting Assistant for Multimodal Observational Gait Analysis in Post-Stroke Rehabilitation

OGA-AID:用于中风后康复多模态观察性步态分析的临床医生在环AI报告起草助手

Khoi T. N. Nguyen, Nghia D. Nguyen, Hui Yu Koh, Patrick W. H. Kwong, Karen Sui Geok Chua, Ananda Sidarta, Baosheng Yu

机构 * Rehabilitation Research Institute of Singapore, Nanyang Technological University, Singapore(新加坡康复研究中心,南洋理工大学,新加坡) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光前医学院,南洋理工大学,新加坡) The Grainger College of Engineering, University of Illinois Urbana-Champaign, United States(伊利诺伊大学厄巴纳-香槟分校格雷格学院,美国) Department of Rehabilitation Sciences, The Hong Kong Polytechnic University, Hong Kong(香港理工大学康复科学系,香港) VinUni-Illinois Smart Health Center, VinUniversity, Vietnam(Vin大学Vin-伊利诺伊智能健康中心,越南) Institute of Rehabilitation Excellence, Tan Tock Seng Hospital, NHG Health, Singapore(卓越康复研究所,坦托克桑格医院,NHG健康,新加坡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OGA-AID,一种临床医生在环的多智能体大语言模型系统,通过协调三个专业智能体合成患者运动记录、运动学轨迹和临床资料,生成结构化步态评估报告,在真实患者数据上优于单次多模态基线,并展示了AI辅助分析与人类临床判断的互补关系。

Comments 2026 CV4Clinic CVPR Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07451 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 67%

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。

Comments 20 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07434 2026-06-08 cs.GT 新提交 67%

Evidence Markets

证据市场

Safwan Hossain, Gabriel Andrade, Chengqi Zang, Yiling Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出证据市场,通过动态调整流动性的对数市场评分规则,激励提交证据和信念,支持内生解决,证明有界损失、证据按市场不确定性奖励,并实现ε-DSIC策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07363 2026-06-08 cs.CR cs.SE 新提交 67%

On the Shoulders of Giants: Empowering Automated Smart Contract Auditing via the GiAnt Corpus

站在巨人的肩膀上:通过GiAnt语料库赋能自动化智能合约审计

Xiaoting Zhang, Zhipeng Gao, Yiran Lv, Xing Hu, Feifei Niu, Xin Xia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出自动化框架GiANT,从真实审计报告中提取漏洞信息构建高质量数据集GiAnt Corpus,包含7711个漏洞发现,验证了其在漏洞检测等任务中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07175 2026-06-08 cs.CV 新提交 67%

Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs

看见而不暴露:面向开放世界、上下文饥渴型MLLM的自适应隐私控制

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui Li, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究学院) Lingnan University(岭南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型在开放世界中面临不可预测敏感信息泄露的隐私挑战,提出无训练方法APD,将隐私元素漂移至语义等价替代物并锚定上下文线索,结合新基准AdaptShield实现隐私保护与上下文保留的平衡提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07171 2026-06-08 cs.CV 新提交 67%

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

当恢复至关重要时:MLLM编辑中替代隐私的盲点

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院) Lingnan University(岭南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07024 2026-06-08 cs.CV 新提交 67%

GuideCAD: A Lightweight Multimodal Framework for 3D CAD Model Generation via Prefix Embedding

GuideCAD: 基于前缀嵌入的轻量级多模态3D CAD模型生成框架

Minseong Kim, Jinyeong Park, Sungho Park, Jibum Kim

机构 * Convergence Research Center for Insect Vectors(昆虫传播载体汇聚研究中心) Incheon National University(仁川国立大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出GuideCAD框架,利用少量可训练参数通过映射网络将图像嵌入转为前缀嵌入,结合预训练大语言模型和Transformer解码器生成3D CAD模型,参数减少约4倍且训练效率提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06662 2026-06-08 cs.SE 新提交 67%

AutoPipelineAI: Context-Aware CI/CD Pipeline Generation from Natural Language

AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成

Youssef Mohamed Aboelfotoh, Mohamed Ahmed Hemdan, Mohammad El-Ramly, Khlood Hassan, Mahmoud Saleh Saad, Ahmed Mohamed Tolba, Seif Gamal Abdelmonem

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。

Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07141 2026-06-08 cs.LG cs.AI 新提交 62%

REMEDI: A Benchmark for Retention and Unlearning Evaluation in Multi-label Clinical Disease Inference

REMEDI:多标签临床疾病推断中的保留与遗忘评估基准

Anurag Sharma, Sai Teja Chunchu, Prasenjit Mitra, Sandipan Sikdar, Koustav Rudra

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Carnegie Mellon University(卡内基梅隆大学) L3S Research Center, Leibniz University Hannover(Leibniz汉诺威大学L3S研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出REMEDI基准,针对多标签临床疾病推断中的机器遗忘问题,利用MIMIC-III数据库评估现有方法在效用与遗忘性能间的权衡,并发现其不适用于多标签任务。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06983 2026-06-08 eess.IV cs.AI cs.CV 新提交 57%

DaX: Learning General Pathology Representations Across Scales

DaX: 跨尺度的通用病理学表示学习

Bokai Zhao, Yiyang Zhang, Long Bai, Tai Ma, Hanqing Chao, Minfeng Xu

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hupan Lab(虎斑实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出病理视觉基础模型DaX,通过改进DINOv3自监督学习,结合连续放大训练、跨尺度组织视图等设计,在44个公开数据集的161项临床任务上取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07020 2026-06-08 cs.CL 新提交 57%

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei

机构 * Huawei(华为)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06923 2026-06-08 cs.AI cs.SE 新提交 57%

Declarative Skills for AI Agents in Knowledge-Grounded Tool-Use Workflows

知识驱动工具使用工作流中AI代理的声明式技能

M. Danish Lim, I. Danial Bin Sharudin, Wen Han Chen, Cedric Lim, Laura Wynter

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出声明式代理(通过自然语言技能文件控制流程)在知识密集型客服工作流中优于命令式状态机和无脚手架基线,但检索质量是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06397 2026-06-08 cs.LG 版本更新 57%

The Post-GCN Decade Revisited: Curvature-Stratified Evaluation of Relational Learning

后GCN十年回顾:曲率分层的关联学习评估

Shuo Wang, Xiangyu Wang, Quanxin Wang, Bailin Wu, Bokui Wang, Shunyang Huang, Boyan Deng, Haonan Liu, Ruiyi Fang, Zhenxiang Xu, Boyu Wang, Zhao Kang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学) Western University(西方大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对关联学习中统一基准掩盖几何依赖性性能的问题,提出曲率分层评估框架,通过将数据集按曲率正负零分区,揭示模型性能本质上是几何依赖的,并给出更可靠的评估协议。

Comments Comments: Suggestions and comments are welcomed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03559 2026-06-08 cs.LG math.OC stat.ML 版本更新 57%

Analytical Evaluation of DCA Convergence Properties for Minimizing Prediction Functions of Gaussian RBF Support Vector Regression

高斯RBF支持向量回归预测函数最小化的DCA收敛性分析评估

Yohei Kakimoto, Yuto Omae, Hirotaka Takahashi

机构 * Nihon University(日本大学) Tokyo City University(东京城大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对以训练好的高斯RBF核支持向量回归(RBF-SVR)预测函数为目标函数的非凸优化问题,利用RBF核的解析结构构造显式DC分解,推导出DC分量强凸参数下界μ和子问题梯度Lipschitz常数上界L的闭式表达式,并通过数值实验表明特征量Cαρ主导DCA的收敛性和初始点依赖性。

Comments 29 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07496 2026-06-08 cs.RO 版本更新 50%

PathPainter: Transferring the Generalization Ability of Image Generation Models to Embodied Navigation

PathPainter:将图像生成模型的泛化能力迁移至具身导航

Yijin Wang, Yuru Tian, Xijie Huang, Weiqi Gai, Mo Zhu, Xin Zhou, Yuze Wu, Fei Gao

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出利用鸟瞰图作为全局先验的导航系统,通过图像生成模型理解自然语言意图并生成可通行掩码,结合跨视图定位消除里程计漂移,在无人机平台上完成160米室外长距离导航。

Comments Work in the progress. 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 49 篇

2606.07116 2026-06-08 cs.LG cs.AI cs.CL 新提交 92%

OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

OffQ:通过偏移驯服LLM量化中的结构化异常值

Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

机构 * School of Computer and Communication Sciences, EPFL, Switzerland(瑞士联邦理工学院计算机与通信科学学院) Huawei, Switzerland(华为公司) Swiss Data Science Center, ETHZ & EPFL, Switzerland(瑞士数据科学中心,苏黎世联邦理工学院与联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OffQ方法,通过top-1 PCA识别异常值子空间、旋转集中异常值通道并转换为共享偏移,实现LLM的低比特均匀量化,在W4A4KV4下提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07098 2026-06-08 cs.CL cs.LG 新提交 92%

SigmaScale: LLM Compression with SVD-based Low-Rank Decomposition and Learned Scaling Matrices

SigmaScale: 基于SVD低秩分解和学习缩放矩阵的LLM压缩

Ernests Lavrinovics, Marco Letizia, Roy Janco, Shai Segal, Johannes Bjerva, Maurizio Pierini

机构 * Department of Computer Science, Aalborg University Copenhagen(奥尔堡大学哥本哈根分校计算机科学系) MaLGa-DIBRIS, University of Genoa(热那亚大学MaLGa-DIBRIS) INFN, Sezione di Genova(国家核物理研究所热那亚分部) European Organization for Nuclear Research (CERN)(欧洲核子研究中心) Ceva, Inc.(Ceva公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SigmaScale方法,通过学习辅助缩放矩阵优化截断SVD的LLM压缩,降低权重矩阵有效秩,在Llama 3.1 8B和Qwen3-8B上达到竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07472 2026-06-08 cs.LG cs.NI 版本更新 92%

Scalable Joint Resource Allocation for SLO-Constrained LLM Inference in Heterogeneous GPU Clouds

异构GPU云中SLO约束的LLM推理的可扩展联合资源分配

Jiaming Cheng, Duong Tung Nguyen

机构 * Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对异构GPU云中LLM推理的SLO约束,提出可扩展框架,通过约束感知启发式算法(GH和AGH)实现联合资源分配,在秒级内生成可行解并接近最优,显著降低成本和SLO违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08692 2026-06-08 cs.LG cs.CL 版本更新 91%

AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

AAAC: 面向4位LLM权重量化的激活感知自适应码本

Beshr IslamBouli, David Jin

机构 * University of Waterloo(滑铁卢大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出AAAC方法,通过每层两个小型学习码本(64字节)替代固定标量码本,以激活加权重建误差最小化选择码本,实现零额外存储开销的4位权重量化,在3-30分钟内完成量化,精度优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00369 2026-06-08 cs.LG cs.AI 版本更新 91%

InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees

InvEvolve:通过具有性能保证的大语言模型进化白盒库存策略

Chenyu Huang, Jianghao Lin, Zhengyang Tang, Bo Jiang, Ruoqing Jiang, Benyou Wang, Lai Wei

机构 * Shanghai University of Finance and Economics(上海财经大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Boston College(波士顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出InvEvolve框架,利用强化学习训练的大语言模型,结合置信区间认证,在线生成具有统计安全保证的白盒库存策略,在合成和真实零售数据上优于经典和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05682 2026-06-08 cs.AI cs.LG 版本更新 90%

Beyond Output Matching: Preserving Internal Geometry in NVFP4 LLM Distillation

超越输出匹配:在NVFP4 LLM蒸馏中保留内部几何结构

Fangbo Tu, Junhua Zhao, Chi Liu, Xin Chen, Haifeng Wu, Jian Wan, Srinivasan Manoharan

机构 * Fangbo Tu(图方波) Junhua Zhao(赵俊华) Chi Liu(刘驰) Xin Chen(陈新) Haifeng Wu(吴海峰) Jian Wan(万健) Srinivasan Manoharan(曼纳哈兰)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对NVFP4低精度量化蒸馏中仅输出匹配导致内部表示退化的问题,提出CKA-QAD方法,通过CKA引导的层间Gram矩阵对齐保留内部几何结构,提升推理和编码任务准确率。

Comments 13 pages,1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07335 2026-06-08 cs.CR 新提交 90%

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics

通过流形轨迹动力学防御大语言模型的越狱攻击

Hangtao Zhang, Yucheng Zhao, Sishun Liu, Ziqi Zhou, Zeyu Ye, Wei Wan, Minghui Li, Shengshan Hu, Yanjun Zhang, Yi Liu, Leo Yu Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。

Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00603 2026-06-08 cs.CY 版本更新 89%

Toward Agentic Governance: What Shapes LLM-Agent Intervention in Public Forums?

走向代理治理:什么决定了LLM代理在公共论坛中的干预?

Luyang Zhang, Yi-Yun Chu, Ramayya Krishnan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 研究LLM代理在公共论坛中干预行为的变化,发现四个部署选择(模型版本、权重开放状态、服务提供商、系统提示策略)独立影响响应率,且开放权重与封闭权重模型在可见挑战上的拒绝倾向存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏