arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-06 至 2026-04-06 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2604.03174 2026-04-06 cs.CL cs.AI 91%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02754 2026-04-06 cs.SE 90%

An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models

基于小型语言模型的提示驱动测试脚本生成的实证研究

Pragati Kumari, Novarun Deb

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本文通过HumanEval基准和适应性提示变体,实证分析小型语言模型在测试脚本生成中的环境与性能权衡,揭示提示结构与模型选择对环境和性能的影响。

Comments 6 pages. arXiv admin note: substantial text overlap with arXiv:2602.18012

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01589 2026-04-06 cs.LG cs.AI 90%

SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

SafeSci: 科学领域及更广泛场景下大型语言模型的安全性评估

Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang, Zicheng Zhang, Chunyi Li, Kaiyuan Ji, Dongrui Liu, Zijian Chen, Lu Sun, Renrui Zhang, Yan Teng, Jing Shao, Wei Sun, Xia Hu, Yu Qiao, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) ECNU(华东师范大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSci框架,通过SafeSciBench和SafeSciTrain评估和提升科学领域LLM的安全性,发现现有模型存在关键漏洞,并展示微调提升安全对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03216 2026-04-06 cs.CL 89%

BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence

BAS:一种基于决策理论的评估大语言模型置信度的方法

Sean Wu, Fredrik K. Gustafsson, Edward Phillips, Boyan Gao, Anshul Thakur, David A. Clifton

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出BAS,一种基于决策理论的评估方法,用于评估大语言模型置信度在不同风险偏好下的决策支持能力,揭示置信度与决策可靠性之间的关系,并展示如何通过干预提升置信度可靠性。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01444 2026-04-06 cs.CR 89%

Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models

制造风险:在大型语言模型中基准测试和降低食品安全风险

Weidi Luo, Xiaofei Wen, Tenghao Huang, Hongyi Wang, Zhen Xiang, Chaowei Xiao, Kristina Gligorić, Muhao Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出FoodGuardBench基准,用于评估大型语言模型在食品安全领域的安全性和鲁棒性,发现现有模型存在对食品相关领域安全对齐不足、生成有害指令及防护措施失效等问题,并提出FoodGuard-4B作为改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10656 2026-04-06 cs.SE 89%

Precision or Peril: A PoC of Python Code Quality from Quantized Large Language Models

精度与危险:从量化大语言模型中Python代码质量的证明概念

Eric L. Melin, Adam J. Torek, Nasir U. Eisty, Casey Kennington

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了小型LLM的代码生成性能及量化影响,发现生成代码存在质量和可维护性问题,强调在软件项目中需谨慎验证LLM生成的代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV 88%

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02617 2026-04-06 cs.AI cs.CR cs.IR cs.LG cs.SI 87%

AutoVerifier: An Agentic Automated Verification Framework Using Large Language Models

AutoVerifier:基于大语言模型的代理自动化验证框架

Yuntao Du, Minh Dinh, Kaiyuan Zhang, Ninghui Li

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoVerifier框架,利用大语言模型自动化验证技术性声明,通过构建知识图谱实现六层递进验证,展示其在量子计算领域的应用效果。

Comments Winner of 2025-2026 Radiance Technologies Innovation Bowl

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02527 2026-04-06 cs.LG cs.AI 86%

Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits

先发优势还是虚假开端?基于LLM初始化的多臂老虎机的理论与实证评估

Adam Bayley, Xiaodan Zhu, Raquel Aoki, Yanshuai Cao, Kevin H. Wilson

机构 * Queen’s University(女王大学) RBC Borealis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM生成的偏好在存在噪声和系统性偏差时对多臂老虎机性能的影响,发现30%以内噪声下初始化有效,40%后效果下降,50%后性能劣化。系统性偏差下,LLM初始化可能比冷启动更差,通过理论分析得出LLM初始化优于冷启动的充分条件。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02359 2026-04-06 cs.CL cs.AI 86%

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis

利用LLM作为法官/陪审团推进模型响应用户表现精神病的可扩展、临床验证的安全性评估

May Lynn Reese, Markela Zeneli, Mindy Ng, Jacob Haimes, Andreea Damien, Elizabeth Stade

机构 * Apart Research Odyssean Institute London School of Economics and Political Science(伦敦政治经济学院) Stanford Institute for Human-Centered AI(斯坦福大学以人为本人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM作为法官或陪审团评估模型响应用户精神病表现的方法,开发了七项临床验证的安全标准,并展示了LLM作为法官在临床验证中的有效性。

Comments published at IASEAI 2026, preliminary work presented at GenAI4Health workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02666 2026-04-06 cs.AI math.OC 85%

Let's Have a Conversation: Designing and Evaluating LLM Agents for Interactive Optimization

让我们交谈:设计和评估用于交互优化的LLM代理

Joshua Drossman, Alexandre Jacquillat, Sébastien Martin

机构 * Operations Research Center and Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院运筹学研究中心和斯隆管理学院) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种可扩展的评估方法,通过对话评估优化代理,展示交互优化代理在解决学校调度问题时能获得更高质量的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19108 2026-04-06 cs.SE 85%

A Multi-Language Perspective on the Robustness of LLM Code Generation

多语言视角下的大型语言模型代码生成鲁棒性研究

Fazle Rabbi, Zishuo Ding, Jinqiu Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文从多语言角度评估了代码生成模型的鲁棒性,通过扰动文档字符串、函数名、语法和格式等关键提示部分,发现不同语言和扰动类型对模型性能影响不同,且增大模型规模并不能显著提升鲁棒性。

Comments 50 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00799 2026-04-06 cs.CV cs.CL cs.LG 84%

Multimodal Language Models Cannot Spot Spatial Inconsistencies

多模态语言模型无法发现空间不一致性

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校) Shell(壳牌) TU Delft(代尔夫特理工大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03141 2026-04-06 cs.CL 83%

Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation

超越精确度:面向长文本LLM生成的事实性评估中的重要性感知召回

Nazanin Jafari, James Allan, Mohit Iyyer

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种综合衡量精确度与召回的框架,通过外部知识源构建参考事实,并引入基于相关性和显著性的权重方案,揭示当前LLM在长文本生成中事实性不完整的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02669 2026-04-06 cs.CL 83%

Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments

转向而非移除:任务依赖性刻板印象揭示了LLM对齐的局限

Divyanshu Kumar, Ishita Gupta, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

机构 * Enkrypt AI

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究通过任务依赖性刻板印象分析,揭示LLM对齐的局限性,指出单一基准测试无法全面反映模型偏见,且对齐实践可能掩盖而非减轻代表性伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15323 2026-04-06 cs.CL 83%

Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling

通过输出预填充改进多选问答中的LLM首词预测

Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学与雷焦艾米利亚大学) University of Pisa(比萨大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Brown University(布朗大学) Meta

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出预填充攻击,通过在模型输出前添加结构化自然语言前缀,提升多选问答中LLM首词预测的准确性与可靠性。

Comments 23 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03199 2026-04-06 cs.CL cs.CR cs.LG 81%

Learning the Signature of Memorization in Autoregressive Language Models

在自回归语言模型中学习记忆的签名

David Ilić, Kostadin Cvejoski, David Stanojević, Evgeny Grigorenko

机构 * JetBrains Research(JetBrains研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种可转移的学习攻击方法,通过训练变压器模型来检测记忆签名,实现了在不同架构和数据集上的高准确率。

Comments Preprint. 10 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02893 2026-04-06 cs.CV cs.AI cs.LG 81%

Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models

迈向人工通用教师:基于视觉-语言模型的程序几何数据生成与视觉语义

Hai Nguyen-Truong, Alper Balbay, Tunga Bayrak

机构 * Freya

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究几何教育中的视觉解释问题,提出通过程序生成几何图示数据,结合视觉-语言模型进行领域特定微调,提升几何元素分割性能,并引入几何感知的评估指标。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02718 2026-04-06 cs.LG cs.CL 81%

Generative Frontiers: Why Evaluation Matters for Diffusion Language Models

生成前沿:为何评估对扩散语言模型至关重要

Patrick Pynadath, Jiaxin Shi, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了扩散语言模型评估方法的局限性,提出生成前沿作为评估生成质量的原理性方法,分析了生成困惑度和熵在KL散度中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02502 2026-04-06 cs.CV cs.AI 79%

An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis

具有自适应PID-Tversky损失的可解释视觉-语言模型框架用于腰椎管狭窄症诊断

Md. Sajeebul Islam Sk., Md. Mehedi Hasan Shawon, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种可解释视觉-语言模型框架,通过空间补丁交叉注意模块和自适应PID-Tversky损失,提升腰椎管狭窄症诊断的准确性与解释性,实现高分割Dice分数和CIDEr评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09192 2026-04-06 cs.SE cs.AI 79%

ReDef: Do Code Language Models Truly Understand Code Changes for Just-in-Time Software Defect Prediction?

ReDef:代码语言模型真的能理解代码变更用于即时软件缺陷预测吗?

Doha Nam, Taehyoun Kim, Duksan Ryu, Jongmoon Baik

机构 * Jeonbuk National University(全北国立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 ReDef通过高置信度的函数级修改数据集评估代码语言模型对代码变更的理解,发现紧凑的diff编码在所有模型中表现最佳,但反事实测试显示性能稳定,表明模型依赖于表面线索而非真实语义理解。

Comments Accepted to FSE 2026; An anonymous link containing the dataset, construction scripts, and experimental code is publicly available for reproducibility: https://figshare.com/s/4f202bc0921e26b41dc2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02578 2026-04-06 cs.MA cs.AI cs.CL cs.GT 79%

High Volatility and Action Bias Distinguish LLMs from Humans in Group Coordination

高波动性和行动偏差区分LLMs与人类在群体协调中的表现

Sahaj Singh Maini, Robert L. Goldstone, Zoran Tiganj

机构 * Department of Computer Science, Indiana University Bloomington(印第安纳大学布卢明顿分校计算机科学系) Cognitive Science Program, Indiana University Bloomington(印第安纳大学布卢明顿分校认知科学项目) Department of Psychological and Brain Sciences, Indiana University Bloomington(印第安纳大学布卢明顿分校心理与脑科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过群体二进制搜索游戏比较LLMs与人类在群体协调中的表现,发现LLMs在适应性和稳定性上不如人类,且反馈信息对人类影响大而对LLMs影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21064 2026-04-06 cs.LG cs.AI 79%

Textual Equilibrium Propagation for Deep Compound AI Systems

文本平衡传播用于深度复合人工智能系统

Minghui Chen, Wenlong Deng, James Zou, Han Yu, Xiaoxiao Li

机构 * Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出文本平衡传播(TEP),通过局部学习原理解决长周期工作流中文本梯度爆炸和消失问题,提升深度复合AI系统的准确性和效率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02905 2026-04-06 cs.CV 78%

UniSpector: Towards Universal Open-set Defect Recognition via Spectral-Contrastive Visual Prompting

UniSpector:通过频谱-对比视觉提示实现通用开放集缺陷识别

Geonuk Kim, Minhoi Kim, Kangil Lee, Minsu Kim, Hyeonseong Jeon, Jeonghoon Han, Hyoungjoon Lim, Junho Yim

机构 * LG Energy Solution(LG新能源)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 UniSpector通过设计语义结构化的提示拓扑,解决工业检测中开放集缺陷识别的问题,其在AP50b和AP50m上优于基线19.7%和15.8%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02742 2026-04-06 eess.IV cs.CV 78%

Task-Guided Prompting for Unified Remote Sensing Image Restoration

基于任务引导的统一遥感图像修复

Wenli Huang, Yang Wu, Xiaomeng Xin, Zhihong Liu, Jinjun Wang, Ye Deng

机构 * School of Electronic and Information Engineering, Ningbo University of Technology(宁波工程学院电子与信息工程学院) University of Exeter(埃克塞特大学) Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(西南财经大学计算机与人工智能学院)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 本文提出TGPNet框架,通过任务引导提示策略统一处理多种遥感图像退化问题,实现单框架多任务修复,实验表明在多任务和复合退化场景中优于专用模型。

Comments 17 pages, 11 figures

Journal ref IEEE TRANSACTIONS ON GEOSCIENCE AND REMOTE SENSING, VOL. 64, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17722 2026-04-06 cs.CV 78%

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02423 2026-04-06 cs.CL cs.CY 77%

SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy

SWAY:一种反事实计算语言学方法用于衡量和缓解谄媚倾向

Joy Bhalla, Kristina Gligorić

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出SWAY,一种无监督的计算语言学指标,用于衡量和缓解大语言模型的谄媚倾向。通过反事实提示机制,识别模型在正负语言压力下的同意变化,发现谄媚倾向随认知承诺增加而增强,并提出基于反事实的CoT缓解策略,有效降低谄媚倾向而不影响对真实证据的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02403 2026-04-06 econ.EM cs.CL stat.ME 77%

Measuring What Cannot Be Surveyed: LLMs as Instruments for Latent Cognitive Variables in Labor Economics

无法测量之物的测量:LLMs作为劳动经济学中潜在认知变量的测量工具

Cristian Espinal Maya

机构 * Universidad EAFIT(EAFIT大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用LLMs测量劳动经济学中无法通过现有调查工具精确描述的职业任务认知内容,通过四个条件验证LLMs生成分数的有效性,并应用于Augmented Human Capital Index,展示其高收敛效度和判别效度。

Comments Working paper. 13 pages, 7 figures, 6 references. Part of the Cognitive Factor Economics research program. Code: https://github.com/Cespial/cognitive-factor-economics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24591 2026-04-06 cs.HC 75%

Vibe Coding XR: Accelerating AI + XR Prototyping with XR Blocks and Gemini

Vibe Coding XR: 通过XR Blocks和Gemini加速AI+XR原型设计

Ruofei Du, Benjamin Hersh, David Li, Nels Numan, Xun Qian, Yanhe Chen, Zhongyi Zhou, Xingyue Chen, Jiahao Ren, Robert Timothy Bettridge, Xiang 'Anthony' Chen, Faraz Faruqi, Steve Toh, David Kim

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出XR Blocks框架和Vibe Coding XR工作流,利用LLM将高阶提示转化为功能混合现实应用,通过模拟现实环境减少设备测试摩擦,提供60个原型数据集和自动化评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02729 2026-04-06 cs.SE cs.AI cs.CL 73%

IndustryCode: A Benchmark for Industry Code Generation

IndustryCode: 一个用于行业代码生成的基准

Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndustryCode基准,涵盖125个工业挑战和579个子问题,支持多种编程语言,评估大模型在工业场景中的代码生成能力。

Comments 37 pages, 28 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏