arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-22 至 2026-05-22 共收录 333 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 19 篇

2605.22414 2026-05-22 cs.CV cs.AI 57%

Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence

迈向具有空间定位病变证据的临床可解释性眼科VQA

Xingyue Wang, Bo Liu, Meng Wang, Zhixuan Zhang, Chengcheng Zhu, Huazhu Fu, Jiang Liu

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文提出FundusGround基准,通过空间定位病变证据提升眼科VQA的临床可解释性,通过三阶段流程收集标注病变的视网膜影像,并评估多种视觉语言模型在答案准确性和病变层面推理上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 15 篇

2605.21726 2026-05-22 cs.CL cs.AI 91%

Probabilistic Attribution For Large Language Models

基于概率的大型语言模型归因

Shilpika Shilpika, Carlo Graziani, Bethany Lusch, Venkatram Vishwanath, Michael E. Papka

机构 * Argonne Leadership Computing Facility(阿贡领导计算设施) Argonne National Laboratory(阿贡国家实验室) Mathematics and Computer Science Division(数学与计算机科学 division) Department of Computer Science(计算机科学系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出了一种模型无关的概率性token归因度量,通过贝叶斯法则反向计算下一个token的对数概率,以捕捉模型对token序列分布的内部表示,从而提高大型语言模型的可解释性。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22007 2026-05-22 cs.CL 84%

Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

幻觉作为承诺失败:更大的LLM在知道答案的情况下仍会出错

Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science(数据科学研究生院) Department of Rural Systems Engineering(农村系统工程系) Electrical Engineering and Computer Science(电子工程与计算机科学) Department of Aerospace Engineering(航空航天工程系)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);instruction tuning(abstract);分类 cs.CL

AI总结 本文研究了大型LLM在知道正确答案的情况下仍出现幻觉的现象,发现模型在生成答案时,正确概念的概率分布方式决定了幻觉的发生,而非是否包含正确概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22679 2026-05-22 cs.CV cs.LG 79%

Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models

将嵌入概念化:面向视觉-语言模型的稀疏解缠

Piotr Kubaty, Patryk Marszałek, Łukasz Struski, Adam Wróbel, Jacek Tabor, Marek Śmieja

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(雅盖隆大学数学与计算机科学学院) Doctoral School of Exact and Natural Sciences, Jagiellonian University(雅盖隆大学精确与自然科学博士学校) Centre for Credible AI, Warsaw University of Technology(华沙技术大学可信人工智能中心)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出CEDAR方法,通过稀疏解缠技术在不增加维度的情况下揭示预训练嵌入的组成结构,从而提升视觉-语言模型的可解释性和与人类感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15151 2026-05-22 cs.SD cs.AI 79%

Exploring How Audio Effects Alter Emotion with Foundation Models

探索音频效果如何通过基础模型改变情感

Stelios Katsis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文研究音频效果如何通过基础模型影响情感,探讨了基础模型在分析音频效果与情绪关系中的作用,揭示了声音设计技术对感知影响的模式。

Comments https://github.com/stelioskt/audioFX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21801 2026-05-22 cs.LG cs.CL 79%

Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

为何语义熵失效:面向策略优化的几何感知与校准不确定性

Zheyuan Zhang, Kaiwen Shi, Han Bao, Zehong Wang, Tianyi Ma, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的策略优化框架GCPO,通过几何感知措施捕捉语义分歧,并利用基于奖励的校准对齐不确定性与学习信号强度,从而更准确地跟踪梯度变化并提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16362 2026-05-22 cs.LG cs.AI 73%

When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search

当秩-1引导廉价时是什么情况?几何学、粒度和预算化搜索

John T. Robertson, Jianing Zhu, Haris Vikalo, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了秩-1引导在不同概念上的有效性差异,提出粒度和几何学是影响引导成本的关键因素,并介绍了GRACE框架来高效优化引导过程。

Comments Updated Abstract metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10009 2026-05-22 cs.AI cs.HC 70%

Discovering High Level Patterns from Simulation Traces

从仿真轨迹中发现高层次模式

Sean Memery, Kartic Subr

机构 * University of Edinburgh(爱丁堡大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种通过程序合成进行无监督学习的方法,将仿真轨迹转换为稀疏的高层次模式表示,以提升大语言模型对物理系统的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22333 2026-05-22 cs.CR 67%

A First Measurement Study on Authentication Security in Real-World Remote MCP Servers

对现实世界远程MCP服务器认证安全性的首次测量研究

Huijun Zhou, Xiaohan Zhang, Haozhe Zhang, Haoyang Zhang, Mi Zhang, Min Yang

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本研究首次测量了现实世界远程MCP服务器的认证安全性,发现40.55%的服务器未进行认证,OAuth是主要的授权机制,但存在新的攻击面,识别出9种具体漏洞类型,并通过负责任的披露获得了9个CVE ID。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04217 2026-05-22 cs.LG cs.CL 62%

Jordan-RoPE: Non-Semisimple Relative Positional Encoding via Complex Jordan Blocks

Jordan-RoPE: 通过复Jordan块实现非半单相对位置编码

Yaobo Zhang

机构 * School of Physics, Ningxia University(宁夏大学物理学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种非半单相对位置编码Jordan-RoPE,通过复旋转特征和Nilpotent响应在同一缺陷Jordan块中实现距离调制的相位基,从而生成振荡-多项式特征,如e^{-γd}cos(ωd)、e^{-γd}sin(ωd)等,并在语言模型中验证了其有效性。

Comments 15 pages, 4 figures, 6 tables; code available at https://github.com/ybzhang-nxu/jordan_rope

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01332 2026-05-22 cs.LG cs.AI 62%

A Mechanistic Explanatory Strategy for XAI

为XAI的解释性策略机制

Marcin Rabiza

机构 * Institute of Philosophy and Sociology, Polish Academy of Sciences(哲学与社会学院,波兰科学院) Institute for Philosophy, Leiden University(哲学研究所,莱顿大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于机制的解释性策略,旨在通过分解、定位和重组来揭示深度学习系统功能组织的机制,从而改进可解释人工智能的理论基础和实践应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22377 2026-05-22 cs.LG 57%

Towards Explainability of SLMs by investigating Token Level Activation

通过研究token层面激活实现SLMs的可解释性

Sayantani Ghosh, Rajashik Datta, Amit Kumar Das, Amlan Chakrabarti

机构 * Information Technology(信息技术) A.K. Choudhury School of Information Technology(A.K. Choudhury 信息技术学院) Computer Science & Engineering(Artificial Intelligence)(计算机科学与工程(人工智能)) Institute of Engineering & Management(工程与管理学院) Computer Science & Engineering(计算机科学与工程) University of Calcutta(加尔各答大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种轻量且通用的框架,通过BERT第8层隐藏状态的激活强度量化token层面的表示重要性,揭示了语义信息在激活强度上的集中分布,为将BERT从黑箱模型转变为更透明的玻璃箱模型提供了可解释且计算高效的替代方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22719 2026-05-22 cs.LG 57%

Interpreting and Steering State-Space Models via Activation Subspace Bottlenecks

通过激活子空间瓶颈解释和操控状态空间模型

Vamshi Sunku Mohan, Kaustubh Gupta, Aneesha Das, Chandan Singh

机构 * Microsoft Research, Redmond(微软研究院(红mond)) Independent Researcher(独立研究员)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 本文通过识别Mamba家族状态空间模型中的激活子空间瓶颈,提出了一种在测试时通过乘以标量来操控激活的干预方法,从而在多个模型和基准测试中提升了性能,并验证了这些瓶颈对性能的阻碍作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17385 2026-05-22 cs.AI 57%

Dataless Weight Disentanglement in Task Arithmetic via Kronecker-Factored Approximate Curvature

通过克罗内克-因子近似曲率进行任务算术中的无数据权重解耦

Angelo Porrello, Pietro Buzzega, Felix Dangel, Thomas Sommariva, Riccardo Salami, Lorenzo Bonicelli, Simone Calderara

机构 * University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米利亚大学) Vector Institute(向量研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种无数据的方法,通过将表示漂移正则化问题框架化为曲率矩阵近似问题,以解决任务算术中任务向量的交叉任务干扰问题,实现了任务加法和否定的最新成果。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16258 2026-05-22 cs.CV cs.AI cs.RO 57%

IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation

IVGT:隐式视觉几何变换器用于神经场景表示

Yuqi Wu, Tianyu Hu, Wenzhao Zheng, Yuanhui Huang, Haowen Sun, Jie Zhou, Jiwen Lu

机构 * Intelligent Vision Group, Tsinghua University(清华大学智能视觉组)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出IVGT,一种隐式视觉几何变换器,通过无姿态多视角图像隐式建模连续且一致的几何结构,从而实现神经场景表示,支持在任意3D位置进行连续空间查询,以预测签名距离和颜色,并在多个任务中表现出色。

Comments Code: https://github.com/wzzheng/IVGT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22777 2026-05-22 cs.CV 50%

DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders

DecQ:用于增强表示自编码器中重建和生成的细节压缩查询

Tianhang Wang, Yitong Chen, Wei Song, Zuxuan Wu, Min Li, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出DecQ框架,通过引入轻量级细节压缩查询,有效缓解了表示自编码器中重建与生成之间的权衡问题,提升了重建质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他LLM 17 篇

2605.22058 2026-05-22 cs.SE cs.CR 91%

Finding Missing Input Validation in TEEs via LLM-Assisted Symbolic Execution

通过LLM辅助符号执行寻找TEE中的缺失输入验证

Chengyan Ma, Jieke Shi, Ruidong Han, Ye Liu, Yuqing Niu, David Lo

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(comments)

AI总结 本文提出SymTEE,一种利用LLM辅助符号执行检测TEE应用中缺失输入验证问题的框架,通过AST分析提取可能缺乏充分输入验证的代码片段,并利用LLM生成轻量级mock环境进行符号分析,实验表明其在检测漏洞方面具有高精度和召回率。

Comments Accepted by 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03271 2026-05-22 cs.LG cs.AI 91%

Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary

决策潜力面:大型语言模型决策边界的理论与实用近似

Zi Liang, Zhiyao Wu, Haoyang Shang, Yulin Jin, Qingqing Ye, Huadi Zheng, Peizhao Hu, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Macau(澳门大学) Shanghai Jiaotong University(上海交通大学) Huawei(华为) Rochester Institute of Technology(罗切斯特理工学院) PolyU Research Centre for Privacy and Security Technologies in Future Smart Systems(PolyU未来智能系统隐私与安全技术研究中心)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出决策潜力面(DPS)作为一种新的分析大型语言模型决策性质的方法,通过K-DPS算法以有限样本近似决策边界,理论推导了误差上限,展示了误差与采样次数的权衡。

Comments Source code: https://github.com/liangzid/DPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11650 2026-05-22 physics.chem-ph cs.AI 90%

Large Language Model Agent for User-friendly Chemical Process Simulations

面向用户友好的化学过程模拟的大语言模型代理

Jingkang Liang, Niklas Groll, Gürkan Sin

机构 * Process and System Engineering Center(过程与系统工程中心) Department of Chemical and Biochemical Engineering(化学与生物化学工程系) Technical University of Denmark(丹麦技术大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于大语言模型的代理,通过Model Context Protocol与AVEVA Process Simulation集成,实现自然语言交互进行化学过程模拟,提升非专业用户对复杂过程设计、仿真和优化的访问能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22365 2026-05-22 cs.DM cs.LG 89%

Towards Solving the Gilbert-Pollak Conjecture via Large Language Models

通过大语言模型解决吉尔伯特-波拉克猜想

Yisi Ke, Tianyu Huang, Yankai Shu, Di He, Jingchu Gai, Liwei Wang

机构 * School of EECS, Peking University(北京大学电子工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(北京大学通用人工智能国家重点实验室) Carnegie Mellon University, Machine Learning Department(卡内基梅隆大学机器学习系)

专题命中 其他LLM :large language model(title);language model(title);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出一种新的AI系统,通过生成受规则约束的几何引理并构建专用函数,以获得更紧的Steiner比下界,展示了大语言模型在高级数学研究中的强大潜力。

Comments 44 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21943 2026-05-22 cs.SE 80%

Deterministic vs. Probabilistic Summarisation: An Empirical Trade-off Study in Design Pattern Centric Java Code

确定性与概率性摘要:设计模式导向Java代码中的经验性权衡研究

Najam Nazar, Christoph Treude

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 本文通过对比确定性(基于启发式)和概率性(基于LLM)管道在面向意图的设计模式Java代码摘要中的表现,研究了摘要方法的权衡问题,发现概率性摘要在语义对齐和上下文覆盖上更优,而确定性方法在简洁性和可重复性上更胜一筹。

Comments 20 pages, 1 figure, 8 Tables, ESEM conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19329 2026-05-22 cs.CV cs.AI 79%

RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding

RE-VLM:事件增强的视觉-语言模型用于场景理解

Hanqing Liu, Mingjie Liu, Luoping Cui, Endian Lin, Donghong Jiang, Chuang Zhu

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 本文提出RE-VLM,一种结合RGB图像和事件流的双流视觉-语言模型,旨在提升在正常和恶劣条件下对场景的理解能力。通过事件相机提供的高时间分辨率和宽动态范围的数据,RE-VLM在场景描述和视觉问答任务中优于现有模型。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22654 2026-05-22 cs.CL cs.CV 70%

Seeing the Poem: Image-Semantic Detection of AI-Generated Modern Chinese Poetry with MLLMs

看见诗歌:基于大语言模型的AI生成现代汉语诗歌的图像-语义检测

Shanshan Wang, Fengying Ye, Hanjia Lyu, Caiwen Gou, Junchao Wu, Jingming Yao, Chengzhong Xu, Jiebo Luo, Derek F. Wong

机构 * Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) University of Rochester(罗切斯特大学) Sichuan University(四川大学) Department of Portuguese, Faculty of Arts and Humanities, University of Macau(澳门大学人文学院葡萄牙语系)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种图像-语义引导的诗歌检测方法,通过整合图像内容与诗歌文本信息,提升大语言模型在检测现代汉语诗歌中的性能,实验结果表明该方法在多个数据集上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06428 2026-05-22 cs.SE cs.AI 70%

Walking the Tightrope of LLMs for Software Development: A Practitioners' Perspective

在软件开发中平衡LLMs的绳子:从业者视角

Samuel Ferino, Rashina Hoda, John Grundy, Christoph Treude

机构 * Faculty of Information Technology, Monash University(墨尔本大学信息科技学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从软件开发者视角出发,研究LLMs对软件开发的影响及管理方法,通过22次访谈和STGT4DA分析方法,揭示了LLMs在个体、团队、组织和社会层面的利弊,并提出了缓解挑战的可行建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08064 2026-05-22 cs.LG cs.AI cs.CL 67%

SiameseNorm: Breaking the Barrier to Reconciling Pre/Post-Norm

SiameseNorm: 突破预规范与后规范之间的障碍

Tianyu Li, Dongchen Han, Zixuan Cao, Haofeng Huang, Mengyu Zhou, Ming Chen, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang, Gao Huang

机构 * Leap Lab, Tsinghua University(清华大学 Leap 实验室) Qwen Large Model Application Team, Alibaba(阿里巴巴 Qwen 大模型应用团队) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学研究院)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SiameseNorm,一种双流架构,通过共享残差块将预规范和后规范结合,从而在保持训练稳定性的同时提升模型性能,适用于多种架构和模态。

Comments Accepted to ICML 2026; camera-ready version; revised presentation and added additional experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02112 2026-05-22 cs.LG cs.AI cs.CL 67%

Unifying Masked Diffusion Models with Various Generation Orders and Beyond

统一多种生成顺序及超越的掩码扩散模型

Chunsan Hong, Sanghyun Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国延世大学人工智能研究生院)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Order-Expressive Masked Diffusion Model (OeMDM)和Learnable-Order Masked Diffusion Model (LoMDM),统一了不同生成顺序的扩散生成过程,并通过单目标学习生成顺序和扩散骨干,提升了文本生成性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22821 2026-05-22 cs.CL cs.LG 62%

Tokenisation via Convex Relaxations

基于凸松弛的分词

Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

机构 * ETH Zurich(苏黎世联邦理工学院) Kensho Technologies(Kensho科技公司)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于凸松弛的分词方法ConvexTok,通过将分词构建问题转化为线性规划并利用凸优化工具求解,改进了分词指标和语言模型的bits-per-byte性能,并提升了下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21724 2026-05-22 cs.LG cs.AI 62%

TBP-mHC: full expressivity for manifold-constrained hyper connections through transportation polytopes

TBP-mHC: 通过运输多面体实现 manifold-constrained 超连接的全表达性

Anton Lyubinin

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 TBP-mHC,通过运输多面体参数化实现 manifold-constrained 超连接的全表达性,解决了超连接中无约束混合导致的训练不稳定性问题,并在语言模型预训练中展示了竞争性性能和改进的稳定性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22526 2026-05-22 cs.SE 50%

"Refactoring Runaway": Understanding and Mitigating Tangled Refactorings in Coding Agents for Issue Resolution

重构失控:理解并缓解编码代理中交织的重构

Zhao Tian, Zifan Zhang, Tao Xiao, Dong Wang, Masanari Kondo, Junjie Chen, Yasutaka Kamei

专题命中 其他LLM :LLM(abstract_cn)

AI总结 本文研究了编码代理在问题解决中交织重构的现象,通过实证分析发现代理重构的频率和强度低于人类开发者,提出了一种重构感知的精炼方法以提高编译性并解决未解决的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22492 2026-05-22 cs.CV 50%

Training-Free Fine-Grained Semantic Segmentations in Low Data Regimes: A FungiTastic Baseline

无需训练的细粒度语义分割在低数据环境下:一个FungiTastic基线

Sebastian Cavada, Francesco Pelosin, Lapo Faggi

机构 * Covision Lab(Covision实验室)

专题命中 其他LLM :prompting(abstract)

AI总结 本文提出了一种无需训练的两阶段框架,用于在低数据环境下实现细粒度语义分割,通过宏分类提示生成蘑菇掩码,并利用嵌入空间中的原型匹配进行细粒度标签分配,提高了可扩展性和分割成本。

Comments Accepted at the 13th Workshop on Fine-Grained Visual Categorization, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏