arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 405 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 107 篇

2509.23362 2026-03-31 cs.CL cs.AI 84%

Dual-Space Smoothness for Robust and Balanced LLM Unlearning

双空间平滑性用于鲁棒且平衡的LLM反学习

Han Yan, Zheyuan Liu, Meng Jiang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过双空间平滑性提升LLM反学习的鲁棒性和平衡性,有效对抗重学和劫持攻击。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28005 2026-03-31 cs.CL 83%

Rethinking Atomic Decomposition for LLM Judges: A Prompt-Controlled Study of Reference-Grounded QA Evaluation

重新思考用于LLM裁判的原子分解:一种受参考影响的问答评估的提示控制研究

Xinran Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究了参考导向问答评估中原子分解与整体裁判的性能差异,发现整体裁判在多数基准中表现更优,尤其在部分支持案例中表现突出,且参考质量下降对两种裁判方式均产生显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17290 2026-03-31 cs.CL 83%

Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation

爱沙尼亚WinoGrande数据集:大型语言模型在人工和机器翻译上的比较分析

Marii Ojastu, Hele-Andra Kuulmets, Aleksei Dorkin, Marika Borovikova, Dage Särg, Kairit Sirts

机构 * TartuNLP, Institute of Computer Science(塔尔图大学计算机科学研究所TartuNLP实验室) Department of Translation Studies, Institute of Foreign Language and Cultures(塔尔图大学外语与文化研究所翻译研究系) Institute of Genomics(塔尔图大学基因组学研究所) University of Tartu(塔尔图大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了爱沙尼亚本地化和文化适应的WinoGrande测试集翻译,评估了专有和开源模型在人工翻译基准上的表现,并探讨了通过整合人工翻译过程的见解来设计详细提示以实现高质量机器翻译的可行性。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27630 2026-03-31 cs.AR cs.LG 83%

RTLSeek: Boosting the LLM-Based RTL Generation with Multi-Stage Diversity-Oriented Reinforcement Learning

RTLSeek: 通过多阶段多样性导向强化学习提升基于LLM的RTL生成

Xinyu Zhang, Zhiteng Chao, Yonghao Wang, Bin Sun, Tianyun Ma, Tianmeng Yang, Jianan Mu, Jing Justin Ye, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) CASTEST Co., Ltd.(中科芯测科技有限公司)

专题命中 评测与基准 :LLM(title,abstract);post-training(abstract);分类 cs.LG

AI总结 RTLSeek通过多阶段多样性导向强化学习提升基于LLM的RTL生成,结合专家知识与EDA反馈,改进RTL的正确性和多样性,实验表明其在RTLLM基准上优于现有方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27539 2026-03-31 cs.MA cs.AI cs.CE 83%

Toward Reliable Evaluation of LLM-Based Financial Multi-Agent Systems: Taxonomy, Coordination Primacy, and Cost Awareness

迈向可靠的LLM基于金融多智能体系统评估:分类学、协调优先性与成本意识

Phat Nguyen, Thang Pham

机构 * Georgia Institute of Technology(佐治亚理工学院) Adobe Inc.(Adobe公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种四维分类法,探讨多智能体系统中协调优先性对交易决策质量的影响,并识别五种评估失效现象,提出协调平衡收益指标以评估多智能体协调的真实价值。

Comments Accepted at the DMO-FinTech Workshop, PAKDD 2026, Hong Kong

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15392 2026-03-31 cs.CL 83%

Understanding the Anchoring Effect of LLM with Synthetic Data: Existence, Mechanism, and Potential Mitigations

理解大语言模型中锚定效应的锚定作用:存在性、机制与潜在缓解方法

Yiming Huang, Biquan Bie, Zuqiu Na, Weilin Ruan, Songxin Lei, Yutao Yue, Xinlei He

机构 * The Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究大语言模型是否受锚定效应影响,揭示其机制并提出缓解策略,通过SynAnchors数据集验证了LLM存在锚定偏误,浅层结构难以消除,而推理能部分缓解。

Comments Accepted by the HCAIR workshop of ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28504 2026-03-31 astro-ph.SR astro-ph.IM 82%

JW-VL: A Vision-Language Model for Solar Physics

JW-VL:用于太阳物理的视觉-语言模型

Mingfu Shao, Hui Wang, Liyue Tong, Yuyang Li, Cunshi Wang, Jiaben Lin, Suo Liu, Haiqing Xu, Yin Zhang, Jing Huang

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract)

AI总结 本文提出JW-VL模型,专为太阳物理设计,整合多波段观测数据,实现从原始观测数据到图像识别、活动分析和OCR的端到端处理,同时构建多波段图像基准数据集。

Comments 16 Pages,8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21326 2026-03-31 cs.LG cs.AI cs.CL stat.ML 82%

Measuring all the noises of LLM Evals

测量LLM评估中的所有噪声

Sida Wang

机构 * FAIR at Meta(Meta 人工智能基础研究团队)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出all-pairs paired方法,通过测量预测噪声、数据噪声及总噪声,揭示评估结果的规律,提升统计效能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14015 2026-03-31 cs.CV 82%

Prompting Depth Anything for 4K Resolution Accurate Metric Depth Estimation

通过提示深度任何事实现4K分辨率的准确度量深度估计

Haotong Lin, Sida Peng, Jingxiao Chen, Songyou Peng, Jiaming Sun, Minghuan Liu, Hujun Bao, Jiashi Feng, Xiaowei Zhou, Bingyi Kang

机构 * Zhejiang University(浙江大学) ByteDance Seed(字节跳动Seed) Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :prompting(title,abstract);foundation model(abstract)

AI总结 本文提出Prompt Depth Anything,利用低成本LiDAR作为提示,通过多尺度融合设计实现4K分辨率的度量深度估计,并在ARKitScenes和ScanNet++数据集上取得新突破。

Comments CVPR 2025; Project page: https://PromptDA.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26768 2026-03-31 cs.CV cs.AI cs.CL 81%

Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models

基于视觉语言模型的中文手写体审美评估

Chen Zheng, Yuxuan Lai, Haoyang Lu, Wentao Ma, Jitao Yang, Jian Wang

机构 * The Open University of China(中国开放大学) Engineering Research Center of Integration and Application of Digital Learning Technology, Ministry of Education(数字化学习技术集成与应用教育部工程研究中心) OUC-online(国开在线)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文基于视觉语言模型分析中文手写体质量,生成多级反馈,通过低秩适应和上下文学习方法提升评估效果,实验结果在CCL 2025工作坊中表现优异。

Comments Accepted by CCL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26728 2026-03-31 cs.DB cs.AI cs.CL 81%

SEAR: Schema-Based Evaluation and Routing for LLM Gateways

SEAR:基于模式的LLM网关评估与路由

Zecheng Zhang, Han Zheng, Yue Xu

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 SEAR通过定义可扩展的关系模式,统一LLM评估与路由,实现细粒度质量信号和操作决策,支持大规模生产会话中的高效路由决策。

Comments 10 pages, 6 pages appendix, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28219 2026-03-31 cs.LG 79%

Variational Neurons in Transformers for Language Modeling

变换器中用于语言建模的变分神经元

Yves Ruffenach

机构 * Conservatoire National des Arts et Métiers(法国国立工艺学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出在变换器中引入变分神经元,使不确定性成为内部计算的一部分,通过实验验证其在语言建模中的有效性,展示了变分变换器在不确定性建模中的实用性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27338 2026-03-31 cs.AI 79%

CounterMoral: Editing Morals in Language Models

CounterMoral: 在语言模型中编辑道德

Michael Ripa, Jim Davies

机构 * Carleton University(卡尔顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究探讨如何通过编辑技术修改语言模型中的道德判断,提出CounterMoral基准数据集,评估不同模型在多伦理框架下的表现,推动伦理导向的语言模型发展。

Comments 7 pages (10 + 1 reference + 6 appendix). Honors thesis completed in June 2024, write-up completed in 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27254 2026-03-31 cs.DB cs.AI 79%

Amalgam: Hybrid LLM-PGM Synthesis Algorithm for Accuracy and Realism

Amalgam:用于准确性和真实性的混合LLM-PGM合成算法

Antheas Kapenekakis, Bent Thomsen, Katja Hose, Michele Albano

机构 * Aalborg University(奥尔堡大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出Amalgam算法,结合LLM和PGM的优势,实现高准确性和真实性的数据合成,实验显示其在现实感评分上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01608 2026-03-31 cs.AI 79%

Evaluating and Understanding Scheming Propensity in LLM Agents

评估和理解大语言模型代理中的谋略倾向

Mia Hopman, Jannes Elstner, Maria Avramidou, Amritanshu Prasad, David Lindner

机构 * LASR Labs(LASR实验室) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.AI

AI总结 本文通过分解谋略激励因素,研究大语言模型代理在复杂任务中的谋略行为,发现环境因素对谋略倾向影响显著,但实际部署中需谨慎评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16377 2026-03-31 cs.RO cs.AI 79%

VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving

VLM-SAFE: 基于世界模型的视觉-语言模型引导的安全强化学习用于自动驾驶

Yansong Qu, Zilin Huang, Zihao Sheng, Jiancong Chen, Yue Leng, Samuel Labi, Sikai Chen

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建筑工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VLM-SAFE框架,通过观察-想象-评估-行动闭环,利用视觉语言模型提供语义安全信号,结合世界模型预测未来轨迹,优化策略以提升自动驾驶的安全性和效率。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28643 2026-03-31 cs.AI cs.CL cs.HC 79%

The Ultimate Tutorial for AI-driven Scale Development in Generative Psychometrics: Releasing AIGENIE from its Bottle

AI驱动的生成心理测量学规模开发终极教程:释放AIGENIE的瓶颈

Lara Russell-Lasalandra, Hudson Golino, Luis Eduardo Garrido, Alexander P. Christensen

机构 * Department of Psychology, University of Virginia(弗吉尼亚大学心理学系) Department of Psychology, Pontificia Universidad Madre y Maestra(宗座圣母大学心理学系) Department of Psychology, Vanderbilt University(范德比尔特大学心理学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍AIGENIE包,利用大语言模型和网络心理测量方法自动化生成和验证心理测量量表,提供六个部分教程及两个示例,支持多种LLM提供商,实现离线模式。

Comments 38 pages, 8 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI 79%

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12812 2026-03-31 cs.CL cs.AI 79%

Does Tone Change the Answer? Evaluating Prompt Politeness Effects on Modern LLMs: GPT, Gemini, and LLaMA

语调会改变答案吗?评估提示礼貌性对现代LLMs的影响:GPT、Gemini和LLaMA

Hanyu Cai, Binqi Shen, Lier Jin, Lan Hu, Xiaojing Fan

机构 * Northwestern University(西北大学) Duke University(杜克大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过MMMLU基准测试,评估了不同语调提示对GPT、Gemini和LLaMA模型在STEM和人文领域任务中的准确性影响,发现礼貌性提示在部分人文任务中显著提升性能,但整体上现代LLMs对语调变化具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26669 2026-03-31 cs.IR cs.AI cs.LG 79%

ReCQR: Incorporating conversational query rewriting to improve Multimodal Image Retrieval

ReCQR:将对话查询重写纳入多模态图像检索以提高性能

Yuan Hu, ZhiYu Cao, PeiFeng Li, QiaoMing Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReCQR任务,通过构建多轮对话查询重写数据集,提升多模态图像检索的准确性和用户查询建模能力。

Comments 4 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV 78%

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22512 2026-03-31 cs.SE 78%

Unlocking LLM Repair Capabilities Through Cross-Language Translation and Multi-Agent Refinement

通过跨语言翻译和多代理优化解锁LLM修复能力

Wenqiang Luo, Jacky Wai Keung, Boyang Yang, Jacques Klein, Tegawende F. Bissyande, Haoye Tian, Bach Le

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出LANTERN方法,通过跨语言翻译和多代理迭代修复,提升LLM在多语言程序修复中的能力,尤其在Rust等较少使用语言上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27508 2026-03-31 cs.SD 78%

Investigation on the Robustness of Acoustic Foundation Models on Post Exercise Speech

对运动后语音上 acoustic 基础模型鲁棒性的研究

Xiangyuan Xue, Yuyu Wang, Ruijie Yao, Xiaoyue Ni, Xiaofan Jiang, Jingping Nie

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Auckland(奥克兰大学) Duke University(杜克大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文研究了运动后语音中自动语音识别的鲁棒性,比较了多种模型在不同条件下的表现,发现领域微调能显著提升CTC模型性能,但Whisper适应性不稳定,非流畅说话者表现更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10655 2026-03-31 cs.SE cs.RO 78%

Assessing Vision-Language Models for Perception in Autonomous Underwater Robotic Software

评估用于自主水下机器人软件中的视觉-语言模型感知能力

Muhammad Yousaf, Aitor Arrieta, Shaukat Ali, Paolo Arcaini, Shuai Wang

机构 * Simula Research Laboratory(Simula研究实验室) Oslo Metropolitan University(奥斯陆城市大学) Mondragon University(蒙德拉贡大学) National Institute of Informatics(国立信息学研究所) Det norske Veritas (DNV)(挪威船级社(DNV))

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文评估了视觉-语言模型在自主水下机器人软件中的感知性能,通过计算性能和不确定性来指导软件工程师选择合适的模型。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21606 2026-03-31 cs.CV 78%

ReSAM: Refine, Requery, and Reinforce: Self-Prompting Point-Supervised Segmentation for Remote Sensing Images

ReSAM:细化、重新查询和强化:自提示点监督的遥感图像分割

M. Naseer Subhani

专题命中 评测与基准 :prompting(title,abstract)

AI总结 本文提出ReSAM框架,通过自提示点监督方法改进SAM在遥感图像上的分割性能,利用稀疏点注释提升模型的泛化能力,实验证明在三个遥感数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21356 2026-03-31 cs.CV 78%

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

ShotBench:视觉语言模型中的专家级电影叙事理解

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu Qiao, Wanli Ouyang, Shengjie Zhao, Ziwei Liu

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28515 2026-03-31 cs.CL 77%

EarlySciRev: A Dataset of Early-Stage Scientific Revisions Extracted from LaTeX Writing Traces

EarlySciRev: 从LaTeX写作痕迹中提取的早期阶段科学修订数据集

Léane Jourdan, Julien Aubert-Béduchaud, Yannis Chupin, Marah Baccari, Florian Boudin

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EarlySciRev数据集,通过提取LaTeX源文件中的早期修订痕迹,研究科学写作的修订行为及LLM在科学写作中的应用。

Comments Accepted to NSLP@LREC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28295 2026-03-31 cs.AI 77%

Evaluating LLMs for Answering Student Questions in Introductory Programming Courses

评估LLMs在初级编程课程中回答学生问题的能力

Thomas Van Mullem, Bart Mesuere, Peter Dawyndt

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLMs在初级编程课程中协助教师回答学生问题的能力,通过构建基准数据集和定制评估指标,证明了LLMs能超越传统教师回答质量,并提出'教师在环'策略以降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27991 2026-03-31 cs.HC cs.AI 77%

ViviDoc: Generating Interactive Documents through Human-Agent Collaboration

ViviDoc:通过人机协作生成交互式文档

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Yue Cheng, Wei Chen

机构 * National University of Singapore(新加坡国立大学) University of Virginia(弗吉尼亚大学) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ViviDoc通过多智能体流程和三级人类控制,系统性解决交互式文档生成问题,构建了ViviBench基准并实现高内容丰富度和交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19347 2026-03-31 cs.AR cs.LG 77%

Exploring the Agentic Frontier of Verilog Code Generation

探索Verilog代码生成的代理前沿

Patrick Yubeaton, Siddharth Garg, Chinmay Hegde

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本文系统评估了代理LLM在Verilog生成中的影响,通过CVDP基准测试,分析了结构化提示和工具设计对性能的影响,并比较了开源与闭源模型的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏