arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-20 至 2026-05-20 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 32 篇

2605.18474 2026-05-20 cs.CR cs.AI cs.CL cs.LG 92%

Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation

Prompt2Fingerprint: 通过文本到权重生成实现即插即用的LLM指纹生成

Sixu Chen, Xiang Chen, Hongyao Yu, Jiaxin Hong, Hao Fang, Shuoyang Sun, Bin Chen, Shu-Tao Xia

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) South China University of Technology, Guangzhou, China(华南理工大学,中国广州) Harbin Institute of Technology, Shenzhen, Shenzhen, China(哈尔滨工业大学深圳校区,中国深圳)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Prompt2Fingerprint框架,将LLM指纹生成重新定义为条件参数生成任务,通过专用生成器将文本描述直接映射到低秩参数增量,实现无需进一步模型微调的即插即用LLM指纹注入,显著降低计算开销,提供可扩展且即时的LLM所有权管理解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18808 2026-05-20 cs.LG cs.AI cs.CL 92%

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

在指令微调的LLM中构建组合文学原语:跨架构SAE特征用于自我、风格和情感

Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira

机构 * Federal University of Goias(戈亚斯联邦大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过稀疏自编码器研究了指令微调的LLM中组合文学原语的架构,发现四种特征类别,并通过跨架构SAE特征验证了自我、风格和情感的表达能力。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10614 2026-05-20 cs.LG cs.AI 91%

Fine-tuning Large Language Model for Automated Algorithm Design

微调大语言模型用于自动化算法设计

Fei Liu, Rui Zhang, Xi Lin, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文探讨了微调大语言模型以提升其在自动化算法设计中的性能,提出了一种多样性感知的排名策略和直接偏好优化方法,通过实验验证了任务特定微调在不同算法设计任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18868 2026-05-20 cs.CR cs.AI cs.CV cs.LG 91%

DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models

DarkLLM: 利用大语言模型学习语言驱动的对抗攻击

Ye Sun, Xin Wang, Jiaming Zhang, Yifeng Gao, Yixu Wang, Yifan Ding, Qixian Zhang, Henghui Ding, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出DarkLLM,一种基于大语言模型的对抗攻击框架,通过将自然语言攻击指令转换为潜在攻击向量,生成有效的对抗扰动,统一了多种攻击类型并实现了灵活可控的对抗生成。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04998 2026-05-20 cs.LG cs.AI cs.CL 90%

Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning

学习率至关重要:Vanilla LoRA可能足以用于LLM微调

Yu-Ang Lee, Ching-Yun Ko, Pin-Yu Chen, Mi-Yen Yeh

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院) Academia Sinica(台湾“学术院”)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。

Comments Project page: https://github.com/yuang-lee/lr-matters-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19147 2026-05-20 cs.CR cs.AI cs.LG 88%

Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks

仁者重写:通过重写实现良性投影以防御大语言模型数据中毒攻击

John T. Halloran, Noopur S. Bhatt

机构 * Leidos University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于重写的良性投影方法(OBBR),通过利用开放书本的良性样本来提高大语言模型对数据中毒攻击的防御能力,实验表明OBBR在多种已知攻击模式中表现出更高的安全性能,并且在计算效率和模型性能方面具有优势。

Comments 15 pages, 2 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18822 2026-05-20 cs.LG cs.AI 88%

Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

Hybrid-LoRA: 桥接全微调与低秩适应以实现训练后优化

Chengqian Zhang, Wei Zhu, Kyumin Lee

机构 * Worcester Polytechnic Institute(沃斯特理工学院) University of Hong Kong(香港大学)

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hybrid-LoRA框架,通过选择性地对部分模块进行全微调,其余模块使用LoRA进行适应,从而在训练后优化中实现高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19523 2026-05-20 cs.CL cs.AI cs.CV 87%

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

探究跨模态技能注入:场景、方法与超参数

Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) WeChat AI, Tencent Inc., China(腾讯公司,中国) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16353 2026-05-20 cs.CV cs.AI 85%

StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs

StrLoRA: 向流式连续视觉指令微调迈进以适应大规模多模态语言模型

Chang Che, Ziqi Wang, Hui Ma, Cheems Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出StrLoRA,一种流式连续视觉指令微调方法,旨在解决动态任务流中模型持续学习的问题,通过任务感知的专家路由框架提升模型在不断变化的数据流中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19394 2026-05-20 cs.CL cs.AI 82%

EmbGen: Teaching with Reassembled Corpora

EmbGen:利用重组语料库进行教学

Arun K Lenin, Kai Rouse, Andrea Nicastro, Anna Leontjeva

机构 * Commonwealth Bank of Australia(澳大利亚联邦银行)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EmbGen,一种通过重组语料库生成合成数据的pipeline,旨在提高在不同语义异质性数据集上指令微调模型的性能,通过实体-描述对的分解、基于嵌入相似性的重组以及基于聚类的采样生成问题-答案对,从而在固定token预算下提升二元准确率。

Comments 8 pages, 4 images (32 pages with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09872 2026-05-20 cs.LG cs.AI 82%

WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions

WARC-Bench:基于网络存档的GUI子任务执行基准

Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi

机构 * Uniphore

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出WARC-Bench,一个基于网络存档的GUI子任务执行基准,通过438个任务评估多模态AI代理在子任务上的能力,实验表明SFT和RLVR方法在提升子任务执行效果上取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18832 2026-05-20 cs.LG cs.AI 82%

Precision Tracked Transformer via Kalman Filtering, Kriging and Process Noise

通过卡尔曼滤波、克里格法和过程噪声的精确跟踪变压器

Bo Long, Deepak Agarwal, Jelena Markovic-Voronov, Yi Wang, Liuqing Li

机构 * LinkedIn Core AI(LinkedIn核心AI)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于贝叶斯滤波的变压器(BFT),通过引入精度权重的克里格法、自适应卡尔曼更新和动态模型,解决了传统变压器在处理不确定性方面的不足,提升了序列推荐和大语言模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18795 2026-05-20 cs.LG cs.AI 82%

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

机构 * Department of Computer Science and Technlogy(计算机科学与技术系) Tsinghua University(清华大学) School of Computer Science and Technlogy(计算机科学与技术系) Xi’an Jiaotong University(西安交通大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 指令微调 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08879 2026-05-20 cs.RO 82%

Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT

通过保守监督微调在流匹配视觉-语言-动作中保持基础能力

Tianyi Zhang, Shaopeng Zhai, Haoran Zhang, Fuxian Huang, Qi Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(title,abstract)

AI总结 本文提出保守监督微调(ConSFT)方法,旨在通过动态调整学习信号来减少流匹配视觉-语言-动作模型在微调过程中对预训练能力的损害,从而在不依赖先验数据或架构开销的情况下提升模型在目标分布上的适应性和能力保留。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18739 2026-05-20 cs.LG stat.ML 81%

Discrete Tilt Matching

离散倾斜匹配

Yuyuan Chen, Shiyi Wang, Peter Potaptchik, Jaeyeon Kim, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) Kempner Institute(凯姆纳研究所)

专题命中 指令微调 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种无需概率模型的离散倾斜匹配方法,用于改进扩散大语言模型的微调,通过局部解掩码后验的状态级匹配来提高训练稳定性并防止模式崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04588 2026-05-20 cs.CL 81%

ZeroSearch: Incentivize the Search Capability of LLMs without Searching

ZeroSearch: 无需搜索即可激励大语言模型的搜索能力

Hao Sun, Zile Qiao, Jiayan Guo, Xuanbo Fan, Yingyan Hou, Yong Jiang, Pengjun Xie, Yan Zhang, Fei Huang, Jingren Zhou

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出ZeroSearch框架,通过模拟搜索提升大语言模型的搜索能力,解决真实搜索引擎文档质量不可控和API成本高的问题,实验表明其在不同参数规模的模型上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18792 2026-05-20 cs.IR cs.CL 81%

Trust or Abstain? A Self-Aware RAG Approach

信任还是弃权?一种自感知RAG方法

Xi Zhu, Ziqi Wang, Kai Mei, Wujiang Xu, Minghao Guo, Bangji Yang, Jiajun Fan, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种自感知RAG方法SABER,通过构建知识冲突基准并引入自感知信念估计器,提升RAG在冲突场景下的准确性和可靠性,同时在弃权策略上实现风险与覆盖的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06462 2026-05-20 cs.CL cs.LG 81%

Diffusion-State Policy Optimization for Masked Diffusion Language Models

扩散状态策略优化用于掩码扩散语言模型

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Diffusion-State Policy Optimization(DiSPO),一种用于掩码扩散语言模型的插件信用分配层,通过直接优化中间填充决策来改进生成过程,实验表明其在数学和规划基准测试中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23747 2026-05-20 cs.CV cs.AI cs.LG 79%

Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

Spatial-MLLM: 提升基于视觉的空域智能的MLLM能力

Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Spatial-MLLM,一种基于纯2D观测的视觉空域推理框架,通过双编码器架构和空间感知帧采样策略提升空域理解能力,实验表明其在多种视觉空域任务中达到SOTA性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19956 2026-05-20 cs.CV 78%

Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models

迈向细粒度鲁棒性:面向视觉-语言模型的注意力引导测试时提示调优

Jia-Wei Hai, Yijun Wang, Xiu-Shen Wei

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications(新一代人工智能技术及其交叉应用重点实验室) Southeast University(东南大学) School of Intelligence Science and Engineering(智能科学与工程学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出了一种注意力引导的测试时提示调优方法(A-TPT),旨在解决视觉-语言模型在对抗攻击下的鲁棒性问题,通过改进的梯度注意力机制和空间变化的增强强度来提升模型在细粒度场景下的表现。

Comments Accepted by ICML 2026, Project Page: this https, URL Code URL: this https URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19690 2026-05-20 cs.RO 78%

D-CLING: Prior-Preserving Depth-Conditioned Fine-Tuning for Navigation Foundation Models

D-CLING: 保留先验知识的深度条件细调方法用于导航基础模型

Shintaro Nakaoka, Takayuki Kanai, Kazuhito Tanaka

机构 * Frontier Research Center, Toyota Motor Corporation(丰田电机公司前沿研究中心)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出了一种新的细调方法,通过利用大规模预训练同时高效学习新环境或相机配置等新设置,从而在保留预训练知识的同时提升导航模型的鲁棒性和准确性。

Comments This paper has been accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026), which will be held in Vienna, Austria, from June 1 to 5, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19020 2026-05-20 cs.CV 78%

A Systematic Failure Analysis of Vision Foundation Models for Open Set Iris Presentation Attack Detection

对用于开放集虹膜呈现攻击检测的视觉基础模型系统性失败分析

Rahul Anand, Siddharth Singh, Dileep A D, Mahadeva Prasanna, Raghavendra Ramachandra

机构 * Indian Institute of Technology, Dharwad, India(印度德瓦德理工学院) Indian Institute of Information Technology Dharwad, India(印度德瓦德信息学院) SAFE Center, Norwegian University of Science and Technology (NTNU)(挪威科学技术大学(NTNU)的安全中心)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文系统分析了视觉基础模型在开放集虹膜呈现攻击检测中的表现,发现其在面对未见过的攻击设备和跨光谱转移时表现不佳,强调了需要更鲁棒的虹膜检测表示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20005 2026-05-20 cs.LG 77%

Fine-Tuning Without Forgetting via Loss-Adaptive Learning Rates

通过损失自适应学习率实现无遗忘的微调

Parjanya Prajakta Prashant, Jiongli Zhu, Aldan Creo, Babak Salimi

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种损失自适应学习率调度方法FINCH,通过动态调整学习率来减少微调过程中的遗忘现象,同时保持任务性能,从而在知识获取、科学和低资源语言适应等基准测试中显著提升了模型表现。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13652 2026-05-20 cs.LG cs.AI cs.CL 75%

Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training

超越困惑度:低秩预训练的几何与谱研究

Namrata Shivagunde, Vijeta Deshpande, Sherin Muckatira, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过几何和谱分析研究低秩预训练方法,揭示其与全秩训练在模型性能和解空间上的差异,发现低秩方法在不同模型规模下表现各异,且困惑度不能完全反映下游任务性能。

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09023 2026-05-20 cs.RO 75%

TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation

TwinRL: 基于数字孪生的强化学习用于真实世界机器人操作

Qinwen Xu, Jiaming Liu, Rui Zhou, Shaojun Shi, Nuowei Han, Zhuoyang Liu, Chenyang Gu, Shuo Gu, Yang Yue, Gao Huang, Wenzhao Zheng, Sirui Han, Peng Jia, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出TwinRL框架,通过数字孪生与真实世界协同训练,提升视觉-语言-动作模型在真实世界中的探索效率和收敛速度,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19799 2026-05-20 cs.CV cs.AI 74%

Synergistic Foundation Models for Semi-Supervised Fetal Cardiac Ultrasound Analysis: SAM-Med2D Boundary Refinement and DINOv3 Semantic Enhancement

协同基础模型用于半监督胎儿心脏超声分析:SAM-Med2D边界细化与DINOv3语义增强

Tonghao Zhuang, Shanglong Hu, Yongsheng Luo, Zhiqi Zhang, Yu Li

机构 * Zhuhai College of Science and Technology(珠海科技学院)

专题命中 指令微调 :foundation model(title);分类 cs.AI

AI总结 本文提出了一种半监督框架,用于胎儿心脏超声图像的联合分割和分类,结合SAM-Med2D进行边界细化和DINOv3进行语义增强,有效提升了胎儿先天性心脏病筛查的性能。

Comments Accepted to the ISBI 2026 Fetal HearT UltraSound Segmentation and Diagnosis (FETUS) Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18225 2026-05-20 cs.CV cs.AI 70%

Is SAM3 ready for pathology segmentation?

SAM3是否准备好进行病理分割?

Qiuyu Kong, Shakiba Sharifi, Yiming Wang, Marco Cristani, Zanxi Ruan

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) University of Verona(威尼斯大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 指令微调 :prompting(abstract,abstract_cn);分类 cs.AI

AI总结 本文评估了SAM3在病理图像分割中的能力,发现文本提示效果有限,视觉提示类型和预算对性能影响显著,少样本学习有提升但鲁棒性不足,且提示基于方法与任务训练适配方法之间存在显著差距。

Comments accept to icip2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19516 2026-05-20 cs.CL cs.AI cs.LG 67%

Base Models Look Human To AI Detectors

基础模型对AI检测器看起来很像人类

Yixuan Even Xu, Ziqian Zhong, Aditi Raghunathan, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现基础模型生成的文本在AI检测器中常被误判为人类生成,提出HIP方法通过迭代改写提升检测器规避能力,揭示当前检测器更关注指令调优和局部上下文而非通用机器生成文本特征。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19833 2026-05-20 cs.SD cs.AI cs.CL cs.MM eess.AS 62%

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

Mega-ASR: 通过扩大现实世界声学模拟实现野外语音识别

Zhifei Xie, Kaiyu Pang, Haobin Zhang, Deheng Ye, Xiaobin Hu, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Mega-ASR,一种统一的野外语音识别框架,结合可扩展的复合数据构建与渐进的声学到语义优化,通过在7种经典声学现象和54种物理上合理的复合场景上训练,显著提升了在恶劣环境下的语音识别性能。

Comments Project page: https://xzf-thu.github.io/Mega-ASR/. Code, models, and dataset will be released. A robust ASR framework targeting in-the-wild and compositional acoustic scenarios where conventional ASR systems fail

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19869 2026-05-20 cs.CV cs.AI 57%

Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification

通过基于人设的对抗性链式思考视觉语言模型验证实现被动施工现场安全监控

Ananth Sriram, Neel Mokaria, Rajveer Singh

机构 * Department of Computer Science, University of Maryland, College Park, MD, USA(大学马里兰学院计算机科学系,马里兰州科利尔帕克,MD,美国)

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 本文提出了一种被动的施工现场安全监控方法,通过三阶段架构处理视频数据,结合细调的YOLO11、SAM 3和Qwen3-VL-8B-Instruct模型,利用基于人设的对抗性链式思考协议提高合规性验证和幻觉控制,主要贡献是第三阶段提示设计,提升了12%的精度。

Comments 10 pages, 4 figures. First place, Ironsite.ai Spatial Intelligence Hackathon, University of Maryland, February 2026. Code available at https://github.com/ananthsriram1/ironsite-hackathon-project-safety_assistant

详情

展开后加载摘要…

URL PDF HTML 收藏