arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11211 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 917 篇

2608.10333 2026-08-12 cs.LG 新提交 70%

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07565 2026-08-11 cs.CV cs.AI 新提交 70%

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议

Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du, Xiaolin Fang, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) Southeast University(东南大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06146 2026-08-07 cs.AI 新提交 70%

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

PaDoc:基于布局的文档并行解码方法

Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出PaDoc,一种基于布局的文档并行解码解析器,在OmniDocBench Full数据集上取得优异性能,且在A800 GPU上显著提升端到端文档解析的吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06057 2026-08-07 cs.AI 新提交 70%

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

当历史失效:在误导性多轮历史下评估与改进工具使用

Xiaoqing Wu, Xingyu Fan, Feifei Li, Wenhui Que

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多轮历史误导导致的工具调用智能体决策问题,提出可靠状态策略迁移方法,构建配对基准bench,在Qwen3模型上实现了优于多种基线的工具使用准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05790 2026-08-07 cs.AI cs.CR 新提交 70%

ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution

ChainClaw:一种用于可靠链上执行的分层智能体框架

Jiacheng Wei, Zhaoxin Fan, Xin Wen, Yuqin Lan, Dongrun Li, Wenjun Wu, Faguo Wu, Xiao Zhang

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学未来区块链与隐私计算高精尖创新中心) Beihang University(北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院) Zhongguancun Laboratory(中关村实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChainClaw是基于OpenClaw的分层区块链原生智能体框架,通过三层架构解决链上执行的反应性、不可逆性和可观测性缺口,在自建基准上的安全性和任务完成度均优于代表性基线。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05102 2026-08-06 cs.AI 新提交 70%

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

ABSeeker:通过答案回溯信用分配训练长程搜索智能体

Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出答案回溯信用分配框架,训练ABSeeker智能体,在BrowseComp等数据集上性能优于同规模模型,接近30B级大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04347 2026-08-06 cs.LG 新提交 70%

Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

镜像审视:微调引发的副作用对齐偏差内省

Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto, Yuji Naraki, Ryotaro Shimizu, Wenya Wang

机构 * Institute of Science Tokyo(东京科学大学) ZOZO Research(ZOZO研究所) Stanford University(斯坦福大学) Waseda University(早稻田大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对微调引发的副作用对齐偏差问题,提出了Delta感知内省适配器(DAIA),构建了对应数据集,实验显示DAIA性能优于现有内省适配器且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03275 2026-08-05 cs.CL 新提交 70%

MoEGen: Mixture-of-Experts for Instance-Adaptive LoRA Generation

MoEGen:用于实例自适应LoRA生成的混合专家模型

Yiming Zeng, Lei Lu, Zexin Li, Zhuochun Li, Shuoqiu Li, Shuyi Liao, Xidong Wu, Zeyu Zhang, Minmei Wang, Yu Zhao, Tingting Yu, Shangqian Gao

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MoEGen是一种将MoE-based PEFT从专家选择转向专家条件参数生成的框架,通过将专家表示为可学习向量,解耦专家容量与适配器存储,在8个常识推理基准及医学、法律领域适配中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02276 2026-08-04 cs.AI 新提交 70%

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1:从智能体失败轨迹中学习编辑可执行运行时管控程序

Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Harness-R1是首个基于智能体失败轨迹学习编辑可执行运行时管控程序的方法,经WebShop等基准测试,可提升Qwen3.5-9B智能体成功率,为管控程序与智能体协同进化提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01904 2026-08-04 cs.AI 新提交 70%

CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents

CoEvoKG:用自演进搜索智能体协同演进知识图谱

Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai, Ping Jiang, Haoyu Wu, Minghui Wu, Chenxu Zhao, Jie Song, Guannan He

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29601 2026-08-03 cs.LG 新提交 70%

The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs

部分之和大于整体:用于高效训练多策略大语言模型的自动任务排序

Jiajia Tang, Sizhe Yuen, Francisco Gomez Medina, Yali Du, Adam Sobey

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对多策略大语言模型训练中共享优化空间的干扰问题,提出自动多策略PEFT框架,通过任务分组排序组织独立QLoRA路径,在TRACE基准取得44.78的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29250 2026-08-03 cs.CL 新提交 70%

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile:面向函数调用数据生成的可扩展开源框架

Goutham Ramakrishnan, Megha Sharma

机构 * Amazon AGI(亚马逊AGI)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 该研究提出开源框架Data Turnstile,可基于用户定义API规范生成高质量函数调用合成训练数据,经其微调的小型语言模型在BFCL、τ²-bench等基准上性能大幅提升,缩小了与更大规模模型的差距。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28449 2026-07-31 cs.CL 新提交 70%

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差

Yecheng Wu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27699 2026-07-31 cs.CV cs.AI 新提交 70%

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:视觉反馈驱动的图像转SVG生成强化学习

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

机构 * Shenzhen University(深圳大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。

Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26928 2026-07-30 cs.CL 新提交 70%

Latent-IM: Latent Interaction Management for Speech LLMs

Latent-IM:面向语音大语言模型的潜在交互管理

Adar Avsian, Atahan Dokme, Tony Woo, Larry Heck

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对语音大语言模型提出Latent-IM框架,将对话动作控制分为选择与实现两个耦合问题,可提升对话动作准确率12.5个百分点,性能与微调相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24570 2026-07-28 cs.CV cs.AI 新提交 70%

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

视觉瓶颈:用于联合时空视频定位的多模态大语言模型的稀疏帧适配

Jiameng Zhang, Srikanth Madikeri

机构 * University of Zurich(苏黎世大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型在视频定位中训练与部署条件不匹配问题,通过实验表明视觉特征提取是稀疏帧输入瓶颈,提出适配特定层及边界感知采样策略,证明训练策略对稀疏帧视频定位比模型规模更关键。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22035 2026-07-27 cs.LG 新提交 70%

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

DCS:用于跨模态版权侵权检测的统一条件敏感度框架

Xiafeng Man

机构 * Fudan University(复旦大学)

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 研究针对基础模型版权侵权检测问题,提出统一的DCS框架,将侵权证据视为反事实条件分布转移,通过条件差分隐私形式化,创建双分支并结合多种因素界定敏感度,还定义校准统计量,适用于多种模型并以不同方式评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21978 2026-07-27 cs.CL 新提交 70%

MoE$^2$-LoRA: When MoE Models Meet MoE-style Low-Rank Adaptation

MoE$^2$-LoRA:当专家混合模型遇上专家混合风格的低秩自适应

Qingyu Yang, Haonan He, Minglei Li, Jingqi Ye, Tao Chen, Lei Bai, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) KTH Royal Institute of Technology(瑞典皇家理工学院) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探索MoE模型的参数高效微调方法,提出MoE$^2$-LoRA,通过双通道RCP模块耦合预训练专家专业化与任务适应性,引入全局专家池,在多MoE主干上评估,能保持通用能力并实现最优下游精度。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21680 2026-07-27 cs.LG 新提交 70%

Encoding Invisible Causation for Bridge Diagnostic Agents: Triple-Guided Retrieval-Augmented Fine-Tuning with QLoRA

为桥梁诊断代理编码无形因果关系:基于QLoRA的三重引导检索增强微调

Takato Yasuno

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对桥梁损伤原因难以肉眼察觉及专家诊断依赖隐性知识的问题,提出基于QLoRA的三重引导检索增强微调方法(含知识三元组提取等组件),能在消费级硬件上实现内存高效、高精度的桥梁诊断代理。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20581 2026-07-24 cs.CR cs.AI 新提交 70%

Geometric Configurations of Perturbed Jailbreak Prompts

受扰动越狱提示的几何配置

Lynn Delcon, Andres Algaba, Vincent Ginis

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究Qwen和Llama系列小权重模型中受扰动越狱输入的内部表示,选两个表示空间,在拒绝主导答案集中两空间均无行为超平面,仅特定模型的个别token与合规答案有关联。

Comments 21 pages, 9 figures, 7 tables, 2nd Workshop on Safe AI (SafeAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20472 2026-07-24 cs.AI 新提交 70%

Robust Critics: Defending LLMs Against Multi-Turn Attacks

鲁棒评论家:防御大语言模型免受多轮攻击

Roman Belaire, Arunesh Sinha, Pradeep Varakantham

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18271 2026-07-22 cs.AI 新提交 70%

Using LLMs for Explainable, Data-Driven Insight Generation from Time Series

使用大语言模型从时间序列中生成可解释的、数据驱动的见解

Ria Mundhra, Gustavo Sato dos Santos, Michael Benedikt

机构 * University of Oxford(牛津大学) Vortexa

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对时间序列预测中解释生成难且易幻觉的问题,提出领域无关框架,含提取解释因素、基于证据生成解释及可扩展评估三组件,经案例研究验证,该框架能大规模实现有根据的解释生成,无需特定领域微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16412 2026-07-21 cs.AI 新提交 70%

Interactive Task Alignment as a POMDP

作为部分可观测马尔可夫决策过程的交互式任务对齐

Andy Dai, Zexue He, Zhenyu Zhang, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11862 2026-07-14 cs.CV cs.AI 新提交 70%

Evidence-Backed Video Question Answering

有证据支持的视频问答

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) Brown University, Providence, RI, USA(布朗大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 70%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09259 2026-07-13 cs.CR cs.AI 新提交 70%

Blockchain-Linked Auditable Decision Management for Telecom/IoT Fraud-Control Requests

用于电信/物联网欺诈控制请求的区块链关联可审计决策管理

Saviz Changizi, Nasibeh Mohammadzadeh, Mohammad Shojafar, Rahim Tafazolli

机构 * G Innovation Centre, Institute for Communication Systems, University of Surrey, UK(Surrey大学6G创新中心,通信系统研究所)

专题命中 指令微调 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 研究针对电信/物联网欺诈控制请求,将其重构为区块链关联可审计决策管理。采用QLoRA调整大语言模型分支及多种方法评分、决策,经实验验证不同方法效果,分析区块链遥测数据,揭示相关指标差异原因。

Comments 16 pages, 5 figures, 10 tables, IEEE Transaction Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08877 2026-07-13 cs.RO cs.LG 新提交 70%

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

FlowDAgger:在潜在空间中对生成式机器人策略进行人工参与的自适应调整

Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 研究针对预训练生成式机器人策略在实际部署中出现的问题,提出FlowDAgger方法,通过动作反转从人工干预获取监督,在模拟及现实操纵中评估,该方法优于基线且能保留预训练技能,为机器人基础模型自适应调整提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04395 2026-07-07 cs.LG 新提交 70%

NKI-Agent: Domain-Specific Fine-Tuning and Agentic Tool Use for Neuron Kernel Generation

NKI-Agent:用于神经元内核生成的特定领域微调与智能体工具使用

Junjie Tang, Jun Huan, Hao Zhou, Yuhao Zhang, Lin Wang

机构 * AWS Neuron Team(亚马逊云科技神经元团队) Amazon Web Services(亚马逊云科技)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.LG

AI总结 针对新兴AI加速器,介绍NKI-Agent系统,结合特定领域监督微调与编译验证修复智能体循环生成NKI内核,适配框架、构建基准并评估,显示工具使用关键及不同模型表现,为强化学习奖励设计提供指导。

Comments 7 pages. Accepted at DL4C @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04242 2026-07-07 cs.AI 新提交 70%

Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning

面向进度和可靠性的智能体强化学习组策略优化

Mingxuan Fan, Peiyang Liu

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于组的强化学习,针对步级优势估计对组形成方式敏感的问题,提出ProGPO方法,通过精确前缀动作比较及结合语义扩展与逆方差融合估计势,在任务中改进了基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03530 2026-07-07 cs.AI 新提交 70%

MentalThink: Shaping Thoughts in Mental SVG World

MentalThink:在心理SVG世界中塑造思想

Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 介绍MentalThink视觉符号推理范式,核心是think-with-SVG管道,通过两阶段训练框架实例化,在空间理解和推理基准测试中性能优越,为动态视角获取等提供可视化工作区。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏