arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11211 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 917 篇

2606.09165 2026-06-09 cs.AI 新提交 70%

Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

从可靠到表达:面向遵循评分标准的安全评判员的课程学习

Yongtaek Lim, Hyeji Choi, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种结合动态评分标准和从可靠到表达的课程学习策略,训练安全评判员在多种评分标准下稳定评估,12B模型准确率达94.12-94.88%,跨标准方差仅0.76。

Comments Accepted to ICML 2026 Workshop on AIWILDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09068 2026-06-09 cs.CL 新提交 70%

Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

由谄媚诱导的突现性失调可通过对齐门控逆转

Sicheng Wang, Xiangyang Zhu, Han Wang, Zongrui Wang, Yuan Tian, Kaiwei Zhang, Kaiyuan Ji, Qi Jia, Guangtao Zhai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 发现谄媚微调(被动同意用户错误观点)可诱导广泛且严重的突现性失调,并提出对齐门控方法,通过插入可学习门控来识别并抑制不安全表示,从而高效逆转失调。

Comments Code is available at https://github.com/stay1to0/Sycophancy_Emergent_Misalignment_and_Gated_attention_FT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08578 2026-06-09 cs.LG 新提交 70%

Lost in the Non-convex Loss Landscape: How to Fine-tune the Large Time Series Model?

迷失在非凸损失景观中:如何微调大型时间序列模型?

Xu Zhang, Peang Wang, Wei Wang

机构 * Shanghai Key Laboratory of Data Science(上海市数据科学重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对预训练大型时间序列模型微调时因非凸损失景观导致过拟合的问题,提出平滑全微调(SFF)方法,通过随机初始化辅助模型插值平滑损失景观,提升可训练性,在八个代表性模型上取得一致改进。

Comments This paper has been accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026). The code is available at the link \url{https://github.com/Meteor-Stars/SFF}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14403 2026-08-17 cs.CV 新提交 67%

CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets

CRAFT:无需组合目标的主题个性化的注意力微调约束奖励

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Jaeyeul Kim, Han Zou, Zhenpeng Zhan, Yan Zhang, Sunghoon Im

机构 * DGIST(大邱科技研究院) Baidu, Inc.(百度公司) KAIST(韩国科学技术院)

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。

Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06965 2026-08-10 cs.RO 新提交 67%

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

面向相机鲁棒性的视觉-语言-动作策略的跨视图动作一致性

Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

机构 * Tsinghua University(清华大学) Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学研究所) Faculty of Science, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学理学院)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本研究针对视觉-语言-动作策略的相机鲁棒性问题,提出跨视图动作一致性正则化方法,在LIBERO-Plus数据集及真实机器人任务上均显著提升了相机扰动下的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06862 2026-08-10 cs.CR 新提交 67%

SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains

SynChain:诱导计算机使用智能体系统构建自身攻击链

Fuyao Zhang, Jiaming Zhang, Che Wang, Boyang Chen, Yurong Hao, Xiongtao Sun, Guowei Guan, Blaise Delattre, Yang Cao, Wei Yang Bryan Lim

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02068 2026-08-04 cs.CV 新提交 67%

GIFT: Geometry-Invariant Fine-Tuning for Non-Lambertian Monocular Depth Estimation

GIFT:面向非朗伯单目深度估计的几何不变微调方法

Xianghui Fan, Zhaoyu Chen, Bingqian Wu, Dayu Li, Xin Zeng, Huanran Cui, Guangzhen Xu, Xiangru Huang, Hang Yang

专题命中 指令微调 :foundation model(abstract);post-training(abstract)

AI总结 针对单目深度基础模型在非朗伯表面易产生深度幻觉的问题,提出无需深度标签的参数高效微调框架 GIFT,通过几何不变性抑制幻觉,在提升镜子与透明物体深度预测的同时保留基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29412 2026-08-03 cs.CV 新提交 67%

Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs

注意力头中的角色断裂:理解和检测视觉语言模型中的幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Nan Duan, Tong Jia, Chaoran Luo, Ying Li

专题命中 指令微调 :language model(abstract,abstract_cn)

AI总结 该研究提出注意力头的角色断裂现象,构建无需微调的轻量级线性检测器,在6个VLMs和4个基准上平均AUROC达93.23,可检测VLM幻觉并支持干预操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 67%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 指令微调 :language model(abstract);foundation model(abstract)

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28658 2026-08-03 cs.CL cs.AI cs.LG 新提交 67%

Evaluating Federated Pre-Training: On the Reliability of Downstream Fine-Tuning and Intrinsic Evaluation

联邦预训练评估:下游微调与内在评估的可靠性研究

Claudia Grosser, Maike Heuer, Denis Krompass, Thomas A. Runkler

机构 * Technical University Munich(慕尼黑工业大学) Siemens AG(西门子公司)

专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究对比联邦预训练的下游微调(含全量、仅头部等变体)与GLUE文本下一个词预测的评估效果,发现后者与预训练测试困惑度相关性更强,提示仅下游微调易产生误导,需关注更接近预训练目标的评估信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22078 2026-07-27 cs.CV 新提交 67%

CommandLM: Data driven behavior level descriptor for ego vehicles

CommandLM:用于自动驾驶车辆的数据驱动行为级描述符

Boris Tokic, Constantin Selzer, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对自动驾驶系统中可解释行为级决策需求,提出多模态大语言模型CommandLM,通过融合多传感器数据生成行为描述,经特定训练和适配器处理,实验表现优于基线,人工评估显示其输出可助力行为审计,实现高效透明的行为级理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20389 2026-07-23 cs.CV 新提交 67%

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

PercepCap:具有结构化时空感知的视频字幕生成器

Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang

机构 * Nanjing Univerisity(南京大学) Kuaishou Technology(快手科技) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 研究视频字幕生成问题,提出PercepCap框架,遵循感知-描述生成链,设计两阶段训练策略及相关数据构建方法,在评估中优于基线,提升视频字幕生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17079 2026-07-21 eess.AS 新提交 67%

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

SALMONN-2:利用自监督表示提升通用听力能力

Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究探索自监督学习音频表示能否为音频大语言模型提供基础,提出基于统一SSL编码器的SALMONN-2,用多层特征融合适配器,还探索多模态上下文学习。实验表明通用SSL编码器性能良好,SALMONN-2达先进水平,且特定训练可获多模态上下文学习能力。

Comments Disclaimer: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16939 2026-07-21 astro-ph.SR 新提交 67%

Constraining the radial decay timescale of solar surface magnetic field through a comparative study of data-assimilative 2D surface flux transport and 3D dynamo models

通过二维数据同化表面通量传输和三维发电机模型的对比研究约束太阳表面磁场的径向衰减时间尺度

Soumyadeep Chatterjee, Gopal Hazra

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 该研究通过对比二维表面通量传输模型和三维发电机模型,对太阳表面磁场径向衰减时间尺度进行自洽估计,经数据同化模拟及参数选择,得出使两模型表面动力学一致的$\tau$值,并发现其对不同角模式的影响。

Comments 13 pages, 6 figures. Submitted to ApJ. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15081 2026-07-17 cs.CR 新提交 67%

DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment

DataShield:通过共识子空间对齐揭示跨语言模型的风险微调数据

Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对LLMs微调数据存在安全风险及现有方法局限性,提出DataShield框架,通过共识子空间对齐识别风险微调样本和响应段,经实验对比,该方法能有效降低误识率,还保留下游效用并避免特定模型风险计算。

Comments 24 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15004 2026-07-17 cs.RO 新提交 67%

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

机构 * Autel Robotics(大疆创新科技有限公司) Northeast Normal University(东北师范大学) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 指令微调 :pretraining(abstract);SFT(abstract)

AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 67%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13926 2026-07-16 cs.RO 新提交 67%

S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving

S平方-VLA:自动驾驶视觉-语言-动作模型中语义与空间流的解耦

Jianguo Yu, Rukang Wang, Duanfeng Chu, Chen Wang, Renju Feng, Liping Lu

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机电工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院)

专题命中 指令微调 :language model(abstract);SFT(abstract)

AI总结 研究针对自动驾驶中视觉语言模型生成低级控制动作的局限,提出S平方-VLA解耦语义和空间流,语义流用于意图推理,空间流保留空间特征并赋予先验,双流规划适配器融合二者,在基准测试中取得新的最先进水平,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交 67%

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10147 2026-07-14 cs.CV 新提交 67%

REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation

REVA-PO:用于胸部X光报告生成的稳定强化学习

Li Guo, Anas M. Tahir, Z. Jane Wang

机构 * University of British Columbia(英属哥伦比亚大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对胸部X光报告生成中强化学习训练不稳定等问题,提出REVA-PO框架,通过响应加权正则化和验证锚定策略重置稳定训练,采用三阶段管道,实验证明该框架在语言质量和临床准确性上达新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05810 2026-07-08 cs.SE 新提交 67%

SCOPE: Leveraging Subgoal Critiques for Code Generation

SCOPE:利用子目标批判进行代码生成

Yueke Zhang, Yifan Zhang, Zihan Fang, Kevin Leach, Wei Zhang, Yu Huang

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型代码生成不可靠问题,提出SCOPE方法,利用证明器初始化子目标批判,结合监督微调、强化学习等,通过两个互补奖励改进代码生成,实验显示在多个数据集上优于基线,优势集中在有语义约束任务,代码修正更局部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04612 2026-07-07 cs.GR cs.CV 新提交 67%

StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation

StructuredEdit:通过可微参数传播实现约束感知的平面设计编辑

Veeramanohar Avudaiappan, Ritwik Murali

机构 * Department of Electrical and Electronics Engineering, Amrita School of Engineering, Coimbatore, Amrita Vishwa Vidyapeetham India(电子与电子工程系,阿米特拉工程学院,科伊巴托尔,阿米特拉世界学院,印度) Department of Computer Science and Engineering, Amrita School of Computing, Coimbatore, Amrita Vishwa Vidyapeetham India(计算机科学与工程系,阿米特拉计算学院,科伊巴托尔,阿米特拉世界学院,印度)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对平面设计编辑在严格约束下操作难的问题,提出StructuredEdit将设计编辑转为参数操作,核心方法是可微参数传播,贡献是提升了约束满意度等指标,还减少了用户编辑时间和校正迭代次数。

Comments 3 page poster short paper.2 Figures, 2 Tables. Planned to submit to SIGGRAPH Asia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05321 2026-07-07 cond-mat.mtrl-sci physics.comp-ph 新提交 67%

Data-driven atomistic modelling of hybrid halide perovskite passivation

混合卤化物钙钛矿钝化的数据驱动原子模型

Laura-Bianca Paşca, Henry J. Snaith, Volker L. Deringer

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究混合卤化物钙钛矿表面缺陷分子钝化的原子机制,用类似大语言模型连续微调的多步骤训练管道,结合两个数据集进行原子建模和计算实验,揭示相关相互作用随分子表面覆盖度的演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 67%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 指令微调 :language model(abstract);post-training(abstract)

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01737 2026-07-03 cs.CV 新提交 67%

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

ReQuest:基于重新思考的问题感知帧选择用于长视频问答

Minkuk Kim, Suyong Yun, Young Tae Kim, Jinyoung Moon, Jinwoo Choi, Seong Tae Kim

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 提出ReQuest,一种不确定性驱动的、问题自适应的关键帧选择方法,通过轻量级选择器、重新思考路由和不确定性引导的NMS,在固定token预算下提升长视频问答准确率。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02454 2026-07-03 hep-th 新提交 67%

Boundary observables in string field theory

弦场论中的边界可观测量

Klaus Kaja, Carlo Maccaferri, Ulisses Portugal, Jakub Vošmera

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文从自由弦场论的规范不变作用量出发,定义了类似Brown-York荷的边界可观测量,并给出了开弦和闭弦场论中的例子。

Comments 32 pages, 2 appendices, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01120 2026-07-03 cs.DC 新提交 67%

Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents

下一代智能体强化学习系统实现自进化智能体

Ran Yan, Wei Fu, Jiale Li, Shusheng Xu, Zhiyu Mei, Jiaxuan Gao, Jiarui Zhang, Wentai Zhang, Hao Dai, Xujie Shen, Chuyi He, Zhen Pu, Jun Mei, Zhiyao Lin, Haitao Wang, Zhiqiang Ding, Jiawei Zhang, Huaijie Wang, Ruida Xu, Honghua Dong, Youhe Jiang, Yi Wu, Tongkai Yang, Binhang Yuan

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 针对企业级大规模智能体服务中自进化部署的瓶颈,提出智能体在线强化学习系统需在轨迹数据协议、数据代理和进化控制平面三方面进行协同设计,并通过AReaL2.0实例化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00416 2026-07-02 cs.CV 新提交 67%

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble

DroneIQA-VLE:基于视觉-语言集成的多任务无人机图像质量评估

Wei Sun, Weixia Zhang, Hongjian Zhan, Mingkai Lu, Yixuan Gao, Guangtao Zhai

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 提出DroneIQA-VLE框架,通过集成SigLIP2视觉编码器与多任务回归头以及LoRA微调的Qwen3.5-9B多模态大模型,联合预测全局、目标和背景质量分数,在ICME 2026无人机图像质量评估挑战赛中获得第二名。

Comments The model achieves 2nd place in ICME 2026 Drone-IQA Grand Challenge on Target-aware Image Quality Assessment for Low-altitude UAV Images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28077 2026-06-29 cs.CV 新提交 67%

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

TextDS: 分布偏移下场景文本检测的参数高效表示对齐

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang

机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)

专题命中 指令微调 :foundation model(abstract);pretraining(abstract)

AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。

Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25475 2026-06-25 math.DS 新提交 67%

A Krieger Embedding Theorem for Near Markov Sofic Shifts

近马尔可夫索菲克平移的克里格嵌入定理

Brian Marcus, Tom Meyerovitch, Chengyu Wu

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文推广了Krieger嵌入定理,给出了将子平移嵌入到混合(不可约)近马尔可夫索菲克平移的充要条件,并证明了当被嵌入子平移为不可约索菲克时,条件可有限判定。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏