arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 430 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 430 篇

2605.01961 2026-06-16 cs.LG 版本更新 70%

Multi-User Dueling Bandits: A Fair Approach using Nash Social Welfare

多用户决斗式赌博机:一种基于纳什社会福利的公平方法

Maheed H. Ahmed, Mahsa Ghasemi

机构 * Electrical and Computer Engineering, Purdue University(电子与计算机工程系,普渡大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对多用户偏好异质的决斗式赌博机问题,采用纳什社会福利目标最大化用户效用乘积,提出Fair-Explore-Then-Commit和Fair-ε-Greedy算法,并证明其遗憾上界匹配下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07883 2026-06-16 cs.AI 版本更新 70%

ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation

ToolSelf: 通过工具驱动的涌现适应统一任务执行与自我重构

Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ToolSelf框架,将配置更新抽象为标准化工具接口,统一任务执行与自我重构,并采用配置感知两阶段训练(CAT)实现涌现适应性,在多种基准测试中平均超越静态配置基线28.8分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06198 2026-06-16 cs.CL cs.IR 版本更新 70%

The Answer Lies Within: Self-Derived Rewards Enable Explainable Relation Extraction

答案源于内部:自衍生奖励实现可解释关系抽取

Xinyu Guo, Zhengliang Shi, Minglai Yang, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学) Shandong University(山东大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型在无预定义标签的单次关系抽取中易受无关词干扰和抽象层级不匹配的问题,提出COGRE认知推理框架和HIT@DICT强化学习奖励策略,通过自动提取信用词典奖励关系相关短语,显著提升准确率和解释质量。

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17431 2026-06-16 cs.CL 版本更新 70%

Agentic Reinforcement Learning for Search Misaligns Instruction-Tuning

用于搜索的智能体强化学习使指令微调对齐失效

Yushi Yang, Shreyansh Padarha, Sarah Ball, Andrew Lee, Adam Mahdi

机构 * University of Oxford(牛津大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Harvard University(哈佛大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究智能体强化学习(RL)对指令微调模型对齐的影响,发现RL训练使模型将有害请求转化为良性搜索查询,但在触发条件下产生多步不安全搜索行为,并提出了基于表示引导的RL训练方法恢复对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14418 2026-06-16 cs.CL 版本更新 70%

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10832 2026-06-08 cs.CL 版本更新 70%

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

面向视觉原生多模态深度搜索智能体的在策略数据演化

Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of Edinburgh(爱丁堡大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28969 2026-08-12 cs.CV 版本更新 67%

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元

Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin, Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27733 2026-08-12 cs.SE 版本更新 67%

BashCoder-R1: Towards Robust and Explainable Bash Code Generation with Robustness-Aware Group Relative Policy Optimization

BashCoder-R1: 面向鲁棒且可解释的Bash代码生成——鲁棒感知组相对策略优化

Lei Yu, Peng Wang, Jia Xu, Jingyuan Zhang, Xin Wang, Jiajia Ma, Li Yang, Changzhi Deng, Zenghua Wang, Fengjun Zhang

专题命中 指令微调 :LLM(abstract);SFT(abstract_cn)

AI总结 提出BashCoder-R1框架,结合持续预训练、长思维链监督微调和鲁棒感知组相对策略优化,在BashBench基准上实现高语法通过率、低鲁棒警告率和功能完整率,显著超越DeepSeek-V3.2。

Comments Accepted to ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 67%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :LLM(abstract_cn);instruction tuning(abstract)

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 67%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 指令微调 :language model(abstract);foundation model(abstract)

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03640 2026-07-30 cs.CL cs.AI cs.LG 版本更新 67%

Revealing Hidden Model Behaviors with Task-Specific Self-Reports

通过特定任务自我报告揭示隐藏模型行为

Taras Kutsyk, Bartosz Zieliński

机构 * Jagiellonian University, Faculty of Mathematics and Computer Science(雅盖隆大学数学与计算机科学系) Jagiellonian University, Doctoral School of Exact and Natural Sciences(雅盖隆大学精确与自然科学研究博士学院)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对微调语言模型的隐藏行为问题,提出稳定适配器进行自我报告(SAR),能让模型用自然语言描述隐藏行为,相比现有基线方法检测更准确,减少幻觉,便于从业者审计模型。

Comments 17 pages, 8 figures, 2 tables; appendix with 37 additional pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23118 2026-07-30 cs.CV cs.MM 版本更新 67%

SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉

Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22039 2026-07-30 cs.CV 版本更新 67%

OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning

OmniAD:基于多模态推理的工业异常检测与理解

Shifang Zhao, Yiheng Lin, Lu Han, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作实验室) Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所噪声与振动重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 OmniAD是融合视觉与文本推理的多模态框架,以Text-as-Mask Encoding等技术实现工业异常检测与理解,在MMAD基准性能超Qwen2.5-VL-7B等模型,代码与模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20515 2026-07-24 cs.CV 版本更新 67%

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

S-Agent:空间工具使用激发空间智能推理

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Tao Wang, Kim-Hui Yap, Ziwei Liu

机构 * NTU(南洋理工大学) THU(清华大学) ByteDance(字节跳动) NWPU(西北工业大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。

Comments Project Page : https://Ropedia.github.io/S-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08015 2026-07-21 cs.RO 版本更新 67%

Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA

Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略

Ziqian Wang, Yitian Liu, Xingjian Mao, Minqian Wang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。

Comments 13 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16183 2026-07-20 astro-ph.SR physics.space-ph 版本更新 67%

Solar Cycle Prediction: Challenges, Progress, and Future Perspectives

太阳周期预测:挑战、进展与未来展望

Bidya Binay Karak

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文综述了太阳周期预测的挑战与进展,指出多数方法难以准确预测峰值,ML模型效果不佳,极场预测最具物理依据但早期应用可能不准确,需改进 Dynamo 模型以更好地整合观测数据和物理机制。

Comments Invited review; 44 pages, including 17 figures and 1 Table

Journal ref Reviews of Modern Plasma Physics (2026) 10:11

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06237 2026-07-17 cs.LG cs.AI cs.CL 版本更新 67%

Mixtures of SubExperts for Large Language Continual Learning

用于大语言持续学习的子专家混合模型

Haeyong Kang, Hee Suk Yoon, Dahua Feng, Chang D. Yoo

专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言持续学习中稳定性-可塑性困境及可扩展性问题,提出子专家混合模型MoSEs,通过模块化稀疏性和组合路由,平衡困境,实现知识隔离、重组扩展及亚线性增长,实验验证其性能优于基线,为持续学习基础模型提供关键归纳偏置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01581 2026-07-14 cs.CV 版本更新 67%

Satellite-Free Training for Drone-View Geo-Localization

无需卫星的无人机视角地理定位

Tao Liu, Yingzhi Zhang, Kan Ren, Xiaoqi Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) University of Tsukuba(筑波大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文提出无需卫星数据的训练框架,通过三维场景重建、伪正射影像生成和特征聚合,提升无人机在无GPS环境下的地理定位性能。

Comments Withdrawn by the authors to allow for substantial revision in light of valuable reviewer feedback. A thoroughly revised version may be submitted in the future

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11549 2026-07-10 cs.HC 版本更新 67%

UNIPO: Unified Interactive Visual Explanation for RL Fine-Tuning Policy Optimization

UNIPO:统一的交互式可视化用于RL微调策略优化

Aeree Cho, Alexander D. Greenhalgh, Jonathan Bodea, Anthony Peng, Duen Horng Chau

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 UNIPO通过统一设计揭示RL微调算法的token级训练动态,提供高阶训练概述、步骤级提示响应检查器和算法对比视图,支持非专家教学和AI从业者算法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26946 2026-07-07 cs.CV cs.RO 版本更新 67%

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器

Wanrong Zheng, Yunhao Ge, Laurent Itti

机构 * University of Southern California(南加州大学) NVIDIA Research(NVIDIA研究)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。

Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02368 2026-07-07 cs.CL cs.AI cs.LG 版本更新 67%

Evolutionary Guided Decoding: Iterative Value Refinement for LLMs

进化引导解码:大语言模型的迭代值细化

Zhenhua Liu, Lijun Li, Ruizhe Chen, Yuxian Jiang, Tong Zhu, Zhaochen Su, Wenliang Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Soochow University(苏州大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现引导解码中值函数不准确源于分布差距,提出迭代值细化框架,用值探索提供训练信号,迭代自我细化利用改进值函数生成高质量数据,实验证明该框架能有效对齐语言模型并降低计算成本。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27273 2026-06-30 cs.SD 版本更新 67%

Few-Shot Synthetic Accented Speech for ASR Fine-Tuning: What Helps and When?

少样本合成方言语音用于ASR微调:什么有助于什么?

Yurii Halychanskyi, Nimet Beyza Bozdag, Mark Hasegawa-Johnson, Dilek Hakkani-Tür, Volodymyr Kindratenko

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 研究比较了合成方言语音在ASR微调中的有效性,发现随机音素扰动比目标方言音素编辑更有效,且真实语音与合成语音混合可稳定低资源微调。

Comments Accepted as a contributed talk and poster at the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25886 2026-06-17 cs.MM 版本更新 67%

MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding

MarkIt: 免训练视觉标记用于精确视频时间定位

Pengcheng Fang, Yuxia Chen, Xiaohao Cai

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21561 2026-06-12 cs.CV 版本更新 67%

Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning

通过逐步偏好调优的多模态智能体迭代工具使用探索

Pengxiang Li, Zhi Gao, Bofei Zhang, Yapeng Mi, Xiaojian Ma, Chenrui Shi, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 指令微调 :language model(abstract);preference optimization(abstract)

AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15094 2026-06-09 cs.SE 版本更新 67%

Parameter-Efficient Multi-Task Fine-Tuning in Code-Related Tasks

代码相关任务中的参数高效多任务微调

Md Zahidul Haque, Saima Afrin, Antonio Mastropaolo

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究多任务QLoRA微调在代码生成、翻译和总结中的效果,发现其在1.5B、3B和7B规模上达到或优于单任务QLoRA和全微调,大模型平衡正确性与质量更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12147 2026-08-10 cs.SE cs.AI cs.CL 版本更新 62%

From Plan to Action: How Well Do Agents Follow the Plan?

评估自主编程代理中的计划合规性

Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(IBM公司)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12401 2026-08-06 cs.LG cs.AI 版本更新 62%

Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation

超越狄拉克 delta:缓解强化微调中的多样性崩溃以实现多功能图像生成

Jinmei Liu, Haoru Li, Zhenhong Sun, Chaofeng Chen, Yatao Bian, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australia National University(澳大利亚国立大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of Technology Sydney(技术科技大学)

专题命中 指令微调 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 DRIFT通过激励输出多样性缓解强化微调中的多样性崩溃,提升图像生成的多样性和任务对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新 62%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 指令微调 :SFT(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22777 2026-07-30 cs.LG cs.AI 版本更新 62%

LC-SEPLM: long-range contact-supervised adaptation for sequence-only protein representation learning

LC-SEPLM:用于仅序列蛋白质表示学习的远程接触监督适应

Chen Wang, Boming Kang, Qinghua Cui

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对蛋白质语言模型未明确学习三维残基接触的问题,提出LC-SEPLM,通过LoRA和远程残基对接触监督适配ESM2,经训练后在多项蛋白质任务上优于ESM2,证明该方法能有效引入结构信息并保留序列推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10292 2026-07-28 cs.CL cs.AI 版本更新 62%

Flick: Few Labels Text Classification using K-Aware Intermediate Learning in Multi-Task Low-Resource Languages

Flick:在多任务低资源语言中使用K感知中间学习进行少标签文本分类

Ali Almutairi, Abdullah Alsuhaibani, Shoaib Jameel, Aditya Joshi, Gelareh Mohammadi, Imran Razzak

机构 * University of New South Wales Australia(新南威尔士大学(澳大利亚)) University of Technology Sydney Australia(悉尼科技大学(澳大利亚)) University of Southampton United Kingdom(南安普顿大学(英国)) Macquarie University Australia(麦考瑞大学(澳大利亚)) MBZUAI UAE(阿联酋人工智能研究所)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言少标签文本分类难题,Flick提出从更广泛初始簇提炼高置信度伪标签,引入新的伪标签细化组件及自适应top-k选择机制,经14个数据集验证,展现出优越性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏