arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 166 篇

2606.20999 2026-06-23 cs.RO cs.LG 新提交 57%

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20889 2026-06-23 cs.LG stat.ML 新提交 57%

Temporal Causal Prior-Data Fitted Networks for Panel Data with Learned Reliability Signals

面向面板数据的时间因果先验数据拟合网络及其学习到的可靠性信号

Shravan Talupula, Saurabh Sharma

机构 * ProfitOps Inc.(ProfitOps公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出TCPFN,一种零样本时间因果发现基础模型,通过因果判断头联合预测多种因果属性,结合混合训练先验和离散令牌面板数据架构,实现工业规模推理,在多个基准上达到竞争性性能。

Comments 42 pages, 6 figures, 9 tables. Code and pretrained checkpoint to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05469 2026-06-23 cs.LG cs.IT math.IT 版本更新 57%

Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

逐步测量信息:超越情绪的AI评估

Zachary Robertson, Sanmi Koyejo

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。

Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16494 2026-06-23 cs.LG eess.SP 57%

Manifold Learning for Personalized and Label-Free Detection of Cardiac Arrhythmias

基于流形学习的个性化和无标签心律失常检测

Amir Reza Vazifeh, Jason W. Fleischer

机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, 08544, New Jersey, USA(电气与计算机工程系,普林斯顿大学) Princeton Precision Health, Princeton University, Princeton, 08544, New Jersey, USA(普林斯顿精准健康,普林斯顿大学) Omenn-Darling Bioengineering Institute, Princeton University, 35 Ivy Lane, Princeton, 08540, New Jersey, USA(Omenn-Darling生物工程研究所,普林斯顿大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文提出利用非线性降维方法在无监督条件下检测心律失常,通过MIT-BIH数据库验证,NLDR能有效区分正常与异常心跳,实现高准确率分类。

Journal ref Informatics in Medicine Unlocked 64 (2026) 101770

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12911 2026-06-23 cs.CL 版本更新 57%

ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

ViMedCSS:越南语医学术语代码转换语音数据集与基准

Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen, Duy Mai Hoang, Chien Dinh Huynh, Inigo Jauregi Unanue, Massimo Piccardi, Wray Buntine, Dung D. Le

机构 * College of Engineering and Computer Science(工程与计算机科学学院) Center for AI Research(人工智能研究中心) College of Health Sciences(健康科学学院) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 针对越南语医学术语代码转换问题,构建了34小时语音数据集ViMedCSS,评估多种ASR模型并探索微调策略,发现越南语优化模型与多语言预训练结合效果最佳。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11454 2026-06-23 cs.CV cs.AI 57%

HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation

HumaniBench: 一种以人为中心的大型多模态模型评估框架

Shaina Raza, Aravind Narayanan, Vahid Reza Khazaie, Ashmal Vayani, Ahmed Y. Radwan, Mukund S. Chettiar, Amandeep Singh, Mubarak Shah, Deval Pandya

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文提出HumaniBench框架,通过32000个专家验证的图像-问题对评估大型多模态模型在公平性、伦理、包容性等人类中心原则上的对齐情况,揭示了不同模型在伦理、推理和共情方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 评测与基准 :language model(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21351 2026-06-23 q-bio.PE 新提交 50%

Surveying the adaptive landscapes of 10,000 antibodies

调查10000种抗体的适应度景观

Daniel PGH Wong, Aleksandra M. Walczak, Thierry Mora

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出无参数群体遗传框架,通过分析公共克隆型中趋同亲和成熟信号,识别超过10000种抗体的有益突变位点及其适应度效应,揭示突变流行度与适应度效应间的权衡,并用于基准测试抗体语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22890 2026-06-23 cs.CV 新提交 50%

PHOEBI: An Open-World Benchmark for Bacterial Identification in Phase-Contrast Microscopy

PHOEBI:用于相差显微镜细菌识别的开放世界基准

Aaditya Baranwal, Md Jahid Hasan, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出PHOEBI数据集(12万张相差显微镜图像,6种杆状菌的40种组合),通过留出组合评估协议模拟开放世界场景,发现聚合器存在系统性开放世界识别失败,并设计基于锚点的轻量化解码器在未见组合上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交 50%

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22487 2026-06-23 cs.CV 新提交 50%

FetSelect: Task-Specific Architectures and Self-Supervised Learning for Automated Fetal Ultrasound Frame Selection

FetSelect: 面向自动化胎儿超声帧选择的任务特定架构与自监督学习

Mahmood Alzubaidi, Raden Muaz, Uzair Shah, Mohammed Ammar, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学科学与工程学院) LIST Laboratory Department of Electrical Systems Engineering, University of Boumerdes(布迈德斯大学电气系统工程系LIST实验室) Sidra Medicine(锡德拉医学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出FetSelect框架,结合冻结视觉基础骨干与混合多头设计(任务门控分类头+检测派生质量头),通过BYOL自监督预训练,在四个胎儿测量目标上实现高AUROC与质量相关性。

Comments Accepted in 30th Conference on Medical Image Understanding and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22476 2026-06-23 cs.CV 新提交 50%

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

CVSBench:跨视角空间推理与想象的全面基准

Ruixun Liu, Lingyu Zhang, Lanxuan Xue, Kaiyu Li, Bowen Fu, Xiangyong Cao

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 提出CVSBench基准,通过卫星-街景对评估视觉语言模型的跨视角空间推理能力,发现模型在视角剧变下难以保持物体与布局一致性,引入3D场景想象管道可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22339 2026-06-23 cs.CV 新提交 50%

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

T-IMPACT:面向上下文图像-文本操纵的严重性感知基准

Gagandeep Singh, Aaditya Yadav, Priyanka Singh

机构 * The University of Queensland(昆士兰大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22211 2026-06-23 cs.HC 新提交 50%

Open AI in the Wild: Adoption and Adaptation of Open Models on r/LocalLLaMA

野生的开放AI:r/LocalLLaMA社区中开放模型的采纳与适应

Woohyeuk Lee, James Howison, Min Kyung Lee, Hanlin Li

专题命中 评测与基准 :foundation model(abstract)

AI总结 通过对r/LocalLLaMA社区的实证研究,揭示用户对开放模型的实用主义理解,包括可靠性、本地控制、隐私和适应能力,并分析采纳动机与障碍,以及共享资源如何支撑开放AI生态。

Comments Accepted at FAccT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 50%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 评测与基准 :language model(abstract)

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21108 2026-06-23 cs.CV 新提交 50%

SARIF: Segment Anything for Robust Image Forensics

SARIF: 用于鲁棒图像鉴别的 Segment Anything

Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee

机构 * Department of Electrical and Computer Engineering, Inha University(仁荷大学电气与计算机工程系)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出SARIF框架,利用Segment Anything Model的提示架构和泛化能力,通过反馈引导掩码解码器和双编码器设计提取伪造痕迹,实现自动伪造定位,在跨数据集和图像退化下表现鲁棒。

Comments Accepted to ECCV 2026. Equal contribution: Dong-Hyun Moon and Ju-Hyeon Nam. Corresponding author: Sang-Chul Lee. Code: https://github.com/Inha-CVAI/SARIF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20736 2026-06-23 cs.CV 新提交 50%

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估

Tengjie Lin, Yutao Sun, Jingwei Ni, Shuhan Ge, Hao-Xuan Ma, Yanting Miao, Wangyue Lu, Mingshuai Chen, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) University of Waterloo(滑铁卢大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20697 2026-06-23 cs.CV 新提交 50%

AEF-Econ: Toward Plug-and-Play Socioeconomic Foundation Embeddings from AlphaEarth for Urban Remote Sensing

AEF-Econ:面向城市遥感的即插即用社会经济基础嵌入

Shuyang Hou, Ziqi Liu, Haoyue Jiao, Lutong Xie, Yaxian Qing, Xiaopu Zhang, Qingyang Xu, Zhangyan Xu, Xuefeng Guan, Huayi Wu

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping, and Remote Sensing(测绘遥感信息工程国家重点实验室)

专题命中 评测与基准 :pretraining(abstract)

AI总结 针对AlphaEarth基础模型在社会经济任务中即插即用受限的问题,提出容量自适应重构方法,通过多流解码器缓解高维流对低维流的抑制,在跨区域和跨层级评估中R²分别提升至0.848和0.693。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 50%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23729 2026-06-23 cs.CV 版本更新 50%

DynProto: Dynamic Prototype Evolution for Out-of-Distribution Detection

DynProto: 动态原型进化用于分布外检测

Yanqi Wu, Xinhua Lu, Runhe Lai, Qichao Chen, Jia-Xin Zhuang, Wei-Shi Zheng, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(诺丁汉马来西亚大学) Hong Kong University of Science and Technology(香港科学与技术大学) Key Laboratory of Machine Intelligence and Advanced Computing(智能与先进计算关键实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 DynProto通过动态学习分布内信息生成原型,提升分布外检测性能,减少FPR95并提升AUROC。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16809 2026-06-23 cs.DC cs.PF 50%

PICO: Performance Insights for Collective Operations

PICO:集体操作的性能洞察

Saverio Pasqualoni, Tommaso Bonato, Lorenzo Piarulli, Torsten Hoefler, Marco Canini, Daniele De Sensi

专题命中 评测与基准 :LLM(abstract)

AI总结 PICO框架通过解耦实验设置与平台执行,提供跨MPI和NCCL的参数选择接口,记录系统配置以实现可重复比较,并通过诊断证据揭示拓扑敏感的算法选择,优化集体操作性能,减少训练时间达44%。

Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19925 2026-06-23 eess.IV cs.CV 版本更新 50%

ReconMIL: Synergizing Latent Space Reconstruction with Bi-Stream Mamba for Whole Slide Image Analysis

ReconMIL: 协同潜在空间重建与双流Mamba的全切片图像分析

Lubin Gan, Jing Zhang, Heng Zhang, Xin Di, Zhifeng Wang, Wenke Huang, Xiaoyan Sun

机构 * USTC(中国科学技术大学) NUDT(南京理工大学) SCNU(华南师范大学) NTU(南洋理工大学) Anhui Province Key Laboratory of Biomedical Imaging and Intelligent Processing(安徽省生物医学成像与智能处理重点实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出ReconMIL框架,通过潜在空间重建模块适配任务特定特征,并设计双流架构(Mamba全局流+CNN局部流)平衡全局与局部特征,有效抑制背景噪声并定位细粒度诊断区域,在多个基准上超越现有方法。

Comments This paper has been withdrawn by the authors due to identified issues in the evaluation protocol in Section Exp. , which may affect the interpretation of the experimental results. The authors are preparing a substantially revised version addressing these issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04205 2026-06-23 cs.CV 版本更新 50%

Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild

Real5-OmniDocBench:面向野外鲁棒文档解析的全尺度物理重建基准

Changda Zhou, Ziyue Gao, Xueqing Wang, Tingquan Gao, Cheng Cui, Jing Tang, Yi Liu

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :language model(abstract)

AI总结 提出首个对OmniDocBench v1.5进行全尺度一对一物理重建的基准Real5-OmniDocBench,覆盖扫描、弯曲、屏幕摄影、光照和倾斜五种真实场景,通过完整真值映射实现性能退化的因子级归因,揭示文档解析中的“现实鸿沟”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15651 2026-06-23 q-bio.QM cond-mat.dis-nn 版本更新 50%

From Scarce Functional Labels to Label-Aware Generation in Homologous Protein Families

从同源蛋白家族中的稀缺功能标签到标签感知生成

Lorenzo Rosset, Martin Weigt, Francesco Zamponi

专题命中 评测与基准 :language model(abstract)

AI总结 研究两阶段轻监督策略,比较不同序列表示在有限监督下预测功能标签,并利用推断标签训练标签感知RBM进行条件生成,揭示稀缺标签在准确传播下可支持标签感知设计。

Comments 13 pages, 4 figures + SI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 133 篇

2606.23136 2026-06-23 cs.NI cs.AI cs.LG 新提交 92%

LLM-Aided A* Search in Non-Geometric Network Graphs

LLM辅助的非几何网络图中的A*搜索

Nouf Alabbasi, Esraa Ghourab, Omar Alhussein

机构 * KU 6G Research Centre, Department of Computer Science, Khalifa University, Abu Dhabi, UAE(KU 6G研究中心,计算机科学系,哈利法大学,阿布扎赫德,阿联酋)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对非几何网络图最短路径问题,提出LLM辅助A*算法,利用LLM生成中间路标点引导搜索,结合路标距离作为启发式,减少约50%扩展节点,路径成本略有增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23003 2026-06-23 cs.CR 新提交 92%

VCT: A Verifiable Transcript System for LLM Conversations

VCT: 一种用于LLM对话的可验证转录系统

Ruilin Xing, Feihong Li, Jiayue Liu, Jiali Zheng, Wei Liu, Wanzhi Xie

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对LLM对话非线性演化(如重提示、回复再生、会话删除等)导致传统日志无法保证完整性的问题,提出VCT系统,通过三层密码学数据结构(分支级哈希链、会话级Merkle树、账户级Merkle根)和带删除屏障的状态转换协议,实现账户级对话记录的完整性、一致性、可验证共享和不可否认性。

Comments 58 pages, 14 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23030 2026-06-23 cs.CL 新提交 92%

Have You Ever Seen Them? Entity-level Membership Inference through Interrogating Large Language Models

你见过它们吗?通过审问大型语言模型进行实体级成员推断

Yiran Zhu, Ziqi Yang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出实体级成员推断任务,通过语义特征分析从LLM生成文本中判断实体信息是否用于训练,形式化约束并设计五种审问策略,在人物实体上AUC达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19725 2026-06-23 cs.SE cs.AI cs.MA 新提交 92%

Library-Aware Doubles and Iterative Repair for Large Language Model-Generated Unit Tests in OpenSIL Firmware

面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复

Ma Toan Bach, Yuchi Zheng, Haingo Razafindranto, Tanvir Alam, Aric Leather, Ranveer Sandhu, Jitesh Arora

机构 * School of Software Design and Data Science(软件设计与数据科学学院) Seneca Polytechnic(森纳学院) Advanced Micro Devices Canada(加拿大先进微器件公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。

Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21316 2026-06-23 hep-ph 新提交 92%

Large Language Model-Assisted Framework for BSM Model Building

大型语言模型辅助的BSM模型构建框架

Shaikh Saad

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 提出bsm_agent框架,结合确定性物理后端与LLM聊天接口,通过自然语言指定新场量子数,自动构建可重整拉氏量、检查规范反常、导出对称性破缺条件与质量矩阵,确保结果可重复。

Comments 49 pages. Includes a Python package for BSM model building via LLM chat from user-specified particle quantum numbers. Code: https://github.com/saad-hep/bsm_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13007 2026-06-23 cs.LG cs.AI 新提交 92%

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序

Ping Xu, Pengjiang Li, Tian Du, Zaitian Wang, Jiawei Gu, Zhiyuan Ning, Ziyue Qiao, Pengfei Wang, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏