arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2602.11128 2026-02-12 cs.LG 77%

Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards

可验证奖励下的强化学习中不对称提示加权

Reinhard Heckel, Mahdi Soltanolkotabi, Christos Thramboulidis

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出不对称提示加权方法,用于提升可验证奖励强化学习中低成功率提示的训练效率,尤其在从头开始的强化学习中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06763 2026-02-09 cs.CL 77%

R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging

R-Align: 通过以推理为中心的元判断增强生成奖励模型

Yanlin Lai, Mitt Huang, Hangyu Guo, Xiangfeng Wang, Haodong Li, Shaoxiong Zhan, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Chun Yuan, Zheng Ge, Xiangyu Zhang, Daxin Jiang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 R-Align通过引入黄金判断和明确监督推理对齐,提高生成奖励模型的推理一致性,从而增强RLHF的性能。

Comments Github: https://github.com/lyn22333/R-Align Huggingface: https://huggingface.co/collections/lyn22333/r-align

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06554 2026-02-09 cs.AI 77%

SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees

SeeUPO:具有收敛保证的序列级代理强化学习

Tianyi Hu, Qingxu Fu, Yanxi Chen, Zhaoyang Liu, Bolin Ding

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SeeUPO通过逆向归纳实现多轮交互的单调改进和收敛,显著提升训练稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02463 2026-02-05 cs.AI 77%

Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation

通过可验证的多选改写扩展RLVR以应对开放性任务

Mengyu Zhang, Siyu Ding, Weichong Yin, Yu Sun, Hua Wu

机构 * Baidu Ernie Team(百度文心团队)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VMR-RLVR方法,通过将开放性任务数据转化为可验证的多选格式,提升LLM在无明确真实值情况下开放性任务的推理能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07464 2026-02-05 cs.CV cs.AI 77%

DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO

DeepVideo-R1: 通过难度感知的回归GRPO实现视频强化微调

Jinyoung Park, Jeehye Na, Jinyoung Kim, Hyunwoo J. Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Korea University(韩国大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 DeepVideo-R1通过回归GRPO和难度感知数据增强,提升视频大语言模型的推理能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 77%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15795 2026-02-03 cs.CL 77%

Reverse Engineering Human Preferences with Reinforcement Learning

通过强化学习逆向工程人类偏好

Lisa Alazraki, Tan Yi-Chern, Jon Ander Campos, Maximilian Mozes, Marek Rei, Max Bartolo

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过强化学习逆向工程人类偏好,利用LLM作为评判者框架提升评估效果,方法隐蔽且具有跨模型泛化能力。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23596 2026-01-30 cs.CL 77%

Think Twice: Branch-and-Rethink Reasoning Reward Model

再思两次:分支与再思考推理奖励模型

Yizhu Jiao, Jiaqi Zeng, Julien Veron Vialard, Oleksii Kuchaiev, Jiawei Han, Olivier Delalleau

机构 * NVIDIA(NVIDIA公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 BR-RM通过两轮次的分支与再思考机制,改进奖励模型的判断准确性与敏感性,实现更精确的推理能力。

Comments Source Code: https://github.com/yzjiao/BR-RM. Model Checkpoints: https://huggingface.co/nvidia/Qwen3-Nemotron-14B-BRRM and https://huggingface.co/nvidia/Qwen3-Nemotron-8B-BRRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01027 2026-01-30 cs.LG 77%

DBellQuant: Breaking the Bell with Double-Bell Transformation for LLMs Post Training Binarization

DBellQuant: 通过双铃变换打破贝尔限制以实现LLMs预训练后二值化

Zijian Ye, Wei Huang, Yifei Yu, Tianhe Ren, Zhongrui Wang, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 DBellQuant通过双铃变换实现LLMs预训练后量化,显著提升压缩性能与模型效果。

Comments 19 pages; Appendix added

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20439 2026-01-29 cs.CL 77%

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL:多跳工具使用中的计划探索与自适应强化学习

Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

机构 * Institute of Information Engineering, China(信息工程研究所,中国) School of Cyber Security, University of Chinese Academy of Sciences, China(中国科学院大学网络安全学院,中国)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PEARL通过两阶段方法提升LLM在多跳工具使用中的规划与执行能力,实现ToolHop 56.5%的成功率。

Comments Accepted to PRICAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20162 2026-01-29 cs.CL 77%

Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced Interaction

Me-Agent:一种具有两级用户习惯学习的个性化移动代理以增强交互

Shuoxin Wang, Chang Liu, Gowen Loo, Lifan Zheng, Kaiwen Wei, Xinyi Zeng, Jingyuan Zhang, Yu Tian

机构 * Yunnan University(云南大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Southeast University(东南大学) Chongqing University(重庆大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Me-Agent通过两级用户习惯学习方法,提升移动代理在个性化交互中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22323 2026-01-27 cs.CL 77%

Advancing Expert Specialization for Better MoE

推动专家专业化以提升MoE

Hongcan Guo, Haolang Lu, Guoshun Nan, Bolun Chu, Jialin Zhuang, Yuan Yang, Wenhao Che, Xinye Cao, Sicong Leng, Qimei Cui, Xudong Jiang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出正交性损失和方差损失,提升MoE模型专家专业化,显著提高性能并保持负载平衡。

Comments 33pages, 6figures(Accepted by Neurips 2025 Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08521 2026-01-23 cs.LG 77%

Your Group-Relative Advantage Is Biased

你的组相对优势存在偏差

Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun Yin, Wei Lin, Shuai Ma, Fuzhen Zhuang, Deqing Wang, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出HA-DW方法,通过修正组相对优势估计的偏差,提升基于组的强化学习在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12748 2026-01-21 cs.CL 77%

Towards Robust Process Reward Modeling via Noise-aware Learning

通过噪声感知学习实现鲁棒的过程奖励建模

Bin Xie, Bingbing Xu, Xueyun Tian, Yilin Chen, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 77%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12294 2026-01-21 cs.AI cs.SE 77%

ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents

ToolPRMBench: 评估和推进用于工具使用智能体的过程奖励模型

Dawei Li, Yuguang Yao, Zhen Tan, Huan Liu, Ruocheng Guo

机构 * Arizona State University(亚利桑那州立大学) Intuit AI Research(Intuit人工智能研究)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ToolPRMBench通过构建大规模基准评估工具使用智能体的过程奖励模型,揭示PRM有效性差异并展示专用PRMs的潜力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02618 2026-01-14 cs.CL 77%

Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation

通过交互蒸馏缓解判别奖励建模中的注意力黑客问题

Jianxiang Zang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出交互蒸馏方法,通过优化注意力机制提升判别奖励建模的稳定性与通用性,缓解注意力黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06403 2026-01-13 cs.CL 77%

Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding

超越助手的引导模型:通过对比解码控制系统提示强度

Yijiang River Dong, Tiancheng Hu, Zheng Hui, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10008 2026-01-13 cs.AI 77%

RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement Learning

RIPRAG:通过强化学习攻击基于检索增强生成的黑盒问答系统

Meng Xi, Sihan Lv, Yechen Jin, Guanjie Cheng, Naibo Wang, Ying Li, Jianwei Yin

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RIPRAG通过强化学习攻击黑盒RAG系统,提升污染攻击成功率0.72,揭示LLM安全防御的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04736 2026-01-09 cs.CL 77%

AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs

AM$^3$Safety: 向多模态多轮安全对齐的数据高效方法

Han Zhu, Jiale Chen, Chengkun Cai, Shengjie Sun, Haoran Li, Yujin Zhou, Chi-Min Chan, Pengcheng Wen, Lei Li, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhongshan School of Medicine, SUN YAT-SEN UNIVERSITY(中山医学院,孙中山大学) University of Edinburgh(爱丁堡大学) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 AM$^3$Safety通过结合冷启动拒绝阶段和组相对策略优化,有效提升多模态多轮对话的安全性,降低攻击成功率并增强模型的无害与帮助维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04277 2026-01-09 cs.LG 77%

Unlocking the Pre-Trained Model as a Dual-Alignment Calibrator for Post-Trained LLMs

解封预训练模型作为后训练LLMs的双对齐校准器

Beier Luo, Cheng Wang, Hongxin Wei, Sharon Li, Xuefeng Du

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出Dual-Align方法,通过双对齐策略校正后训练LLMs的置信度漂移和过程漂移,提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03608 2026-01-08 cs.IR cs.LG 77%

Shielded RecRL: Explanation Generation for Recommender Systems without Ranking Degradation

屏蔽的推荐强化学习:无需降级的推荐系统解释生成

Ansh Tiwari, Ayush Chauhan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 Shielded RecRL通过双塔架构和复合奖励信号,在不降低推荐准确性的情况下,提升推荐系统个性化解释的质量和用户交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24818 2026-01-05 cs.LG 77%

Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback

零和博弈中的无正则化线性收敛性:从偏好反馈出发

Shulun Chen, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) HKUST(香港科技大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种无正则化的OMWU算法,证明其在零和博弈中实现线性收敛,无需假设纳什均衡的唯一性,提升了对实例依赖常数的依赖性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24693 2026-01-01 cs.CL 77%

MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models

MUSIC: 多步指令对比用于多轮奖励模型

Wenzhe Li, Shujian Zhang, Wenxuan Zhou, John Lambert, Chi Jin, Andrew Hard, Rajiv Mathews, Lun Wang

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03142 2026-01-01 cs.LG 77%

Not All Tokens Are Meant to Be Forgotten

并非所有标记都旨在被遗忘

Xiangyu Zhou, Yao Qiang, Saleh Zare Zade, Douglas Zytko, Prashant Khanduri, Dongxiao Zhu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出TIF框架,通过目标信息标识符和偏好优化方法,解决LLM过度遗忘问题,提升去学习效果并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23430 2025-12-30 cs.CL 77%

C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMs

C2PO:诊断和解构大语言模型中的偏见捷径

Xuan Feng, Bo An, Tianlong Gu, Liang Chang, Fengrui Hao, Peipeng Yu, Shuai Zhao

机构 * Jinan University(济南大学) Nanyang Technological University(南洋理工大学) Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心) Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 C2PO通过因果对比偏好优化框架,解决大语言模型中的偏见问题,同时保持推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22631 2025-12-30 cs.CL 77%

Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs

评估GRPO和DPO在LLM中的忠实链式推理能力

Hadi Mohammadi, Tamas Kozak, Anastasia Giachanou

机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16565 2025-12-19 math.OC cs.LG 77%

Non-Asymptotic Global Convergence of PPO-Clip

PPO-Clip算法的非渐近全局收敛性

Yin Liu, Qiming Dai, Junyu Zhang, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) School of Mathematical Sciences, Peking University(北京大学数学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11838 2025-12-16 cs.LG 77%

D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space

D-STEER - 通过偏好对齐技术学习行为而非信念 -- 在表象之下,DPO作为激活空间中的低秩引导机制

Samarth Raina, Saksham Aggarwal, Aman Chadha, Vinija Jain, Amitava Das

机构 * IIIT Delhi(印度理工学院德里分校) Microsoft(微软) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, K. K. Birla Goa Campus(普拉吉亚实验室,比斯科大学,K.K. 布尔拉果阿校区)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 D-STEER研究揭示DPO通过引导激活空间中的低秩机制实现行为对齐,而非改变模型内部信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19296 2025-12-09 cs.LG cs.AR cs.PL 77%

QiMeng-SALV: Signal-Aware Learning for Verilog Code Generation

QiMeng-SALV:面向Verilog代码生成的信号感知学习

Yang Zhang, Rui Zhang, Jiaming Guo, Lei Huang, Di Huang, Yunpu Zhao, Shuyao Cheng, Pengwei Jin, Chongxiao Li, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 QiMeng-SALV通过信号感知学习提升Verilog代码生成的准确性与性能,采用信号级优化解决功能奖励不足问题。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏