arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 430 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 430 篇

2605.20237 2026-06-23 cs.CV 版本更新 50%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03156 2026-06-18 cs.CV 版本更新 50%

CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator

CAMEO: 一种条件感知与质量驱动的多智能体图像编辑编排器

Yuhan Pu, Hao Zheng, Ziqian Mo, Zirui Pang, Hill Zhang, Tianyi Fan, Shuhong Wu, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen University(深圳大学) Claremont McKenna College(克莱蒙特麦肯纳学院) Research Institute of Petroleum Exploration and Development, CNPC(石油勘探开发研究院,中石油)

专题命中 指令微调 :prompting(abstract)

AI总结 提出CAMEO多智能体框架,将条件图像编辑重构为质量感知的反馈驱动过程,通过分解编辑阶段、嵌入评估循环,在异常插入和人体姿态切换任务中平均胜率提升20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20436 2026-06-11 cs.CV 版本更新 50%

Lighting-aware Unified Model for Instance Segmentation

考虑光照的实例分割统一模型

Qisai Liu, Alloy Das, Zhanhong Jiang, Joshua R. Waite, Aditya Balu, Adarsh Krishnamurthy, Soumik Sarkar

机构 * Iowa State University(爱荷华州立大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出了一种考虑光照的实例分割统一模型,通过开发Lighting Convolutional-Attention模块,在不微调重型主干网络的情况下提升分割鲁棒性,实验结果表明该方法能有效解决光照变化带来的领域差距问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05203 2026-06-11 cs.RO 版本更新 50%

SIL: Symbiotic Interactive Learning for Language-Conditioned Human-Agent Co-Adaptation

SIL: 语言条件的人机协同适应的共生交互学习

Linus Nwankwo, Bjoern Ellensohn, Christian Rauch, Elmar Rueckert

机构 * Technical University of Leoben(莱博恩技术大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出共生交互学习(SIL)框架,实现人类与智能体在共享潜在任务空间中的双向协同适应,通过联合信念状态、FM空间推理和记忆架构,在指令跟随等任务中达到90.4%完成率和0.83信念对齐分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08195 2026-06-11 cs.CV 版本更新 50%

UI2Code^N: UI-to-Code Generation as Interactive Visual Optimization

UI2Code^N: 将UI到代码生成视为交互式视觉优化

Zhen Yang, Wenyi Hong, Mingde Xu, Xinyue Fan, Weihan Wang, Jiale Cheng, Xiaotao Gu, Jie Tang

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :language model(abstract)

AI总结 提出将UI截图转代码任务重构为交互式视觉优化问题,采用基于偏好的强化学习方法RVPO优化视觉排名,在UI起草、润色和编辑任务上达到SOTA。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13446 2026-06-10 cs.RO 版本更新 50%

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力

Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

机构 * University of California Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 指令微调 :language model(abstract)

AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29569 2026-06-09 cs.CR 版本更新 50%

LoRA-Key: User-Centric LoRA Watermarking for Text-to-Image Diffusion Models

LoRA-Key:面向用户的文本到图像扩散模型LoRA水印

Yaopeng Wang, Qingliang Wang, Zhibo Wang, Huiyu Xu, Jiacheng Du, Qiu Wang, Jia-Li Yin, Kui Ren

专题命中 指令微调 :foundation model(abstract)

AI总结 提出LoRA-Key框架,通过可重用的用户特定水印LoRA实现版权保护,无需重新训练或修改目标LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05478 2026-06-09 eess.AS 版本更新 50%

AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning

AQA-TTRL:音频问答中的测试时强化学习自适应

Haoyu Zhang, Jiaxian Guo, Dong Yang, Yusuke Iwasawa, Yutaka Matsuo

专题命中 指令微调 :language model(abstract)

AI总结 提出AQA-TTRL框架,通过测试时强化学习利用无标签数据实现音频语言模型的在线自适应,采用多数投票生成伪标签、置信度加权和多次采样策略,在MMAU等基准上显著提升性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17870 2026-06-09 cond-mat.mtrl-sci 版本更新 50%

General Learning of the Electric Response of Inorganic Materials

无机材料电响应的通用学习

Bradley A. A. Martin, Alex M. Ganose, Venkat Kapil, Tingwei Li, Keith T. Butler

专题命中 指令微调 :foundation model(abstract)

AI总结 提出MACE-Field场感知等变势,通过精确微分获得极化、玻恩有效电荷和极化率,实现跨化学体系的铁电与介电响应预测。

Comments 22 pages, 12 figures, 43 equations

Journal ref PRX Intelligence 1, 013006 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11890 2026-06-08 cs.SE 版本更新 50%

QUARE: Quality-Aware Requirements Analysis through Multi-Agent Dialectical Negotiation

QUARE:通过多智能体辩证协商进行质量感知的需求分析

Haowei Cheng, Milhan Kim, Foutse Khomh, Teeradaj Racharak, Nobukazu Yoshioka, Naoyasu Ubayashi, Hironori Washizaki

专题命中 指令微调 :LLM(abstract)

AI总结 QUARE通过多智能体辩证协商解决需求质量分析中的多属性冲突,生成高质量需求规格,提升合规性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏