GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 15 pages, 8 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 15 pages, 8 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 13 pages, 3 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments CVPR 2023 Camera Ready Version
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to AIED Late Breaking Results 2023 - to be published in their proceedings
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 43 pages, 3 figures. To be published in IUI 2023
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG;foundation model(comments)
Comments Accepted at NeurIPS 2024 Workshop on Adaptive Foundation Models
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Data, Code, & Benchmark: www.llm-cross-capabilities.org
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Project Page: https://github.com/SihengLi99/LLM-Honesty-Survey
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Technical report; updated the std error for human study; short version (v1) was accepted by LLM@IJCAI'23; 32 pages; more work: https://llm-enhance.github.io/
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Work in progress; 7 pages; more work at: https://llm-eval.github.io/
面向研究的基础模型以人为中心的评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.CL
AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。
EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试
机构 * Jiutian Research, China Mobile(中国移动九天研究院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 研究针对企业RAG部署的可靠性问题,推出含983个样本的EnterpriseRAG基准,评估13个LLM发现其指令遵循崩溃,为生产级RAG提供可复现的评估基础
IDRAAK:从多智能体自然语言处理到用于技术需求语义漂移检测的少样本提示
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.CL
AI总结 IDRAAK是基于语义需求表示的可解释框架,通过含6个少样本示例的LLM单次调用检测技术需求语义漂移,性能优于多种替代方案,证明少样本提示是高效替代方法。
基于模块化大语言模型(LLM)的安全智能体的事后轨迹风险验证
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文针对模块化LLM安全智能体的轨迹风险验证问题,提出生成树替代方案,在两阶段入侵检测实验中实现92.7%±2.4%的平均轨迹覆盖率,量化了联合访问缺失的成本。
Comments 18 pages, 11 tables; preprint
多智能体大语言模型流水线中的对抗攻击:揭示智能体AI架构的结构性漏洞
专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);分类 cs.AI
AI总结 该研究针对多智能体LLM流水线的结构性漏洞,通过在GPT-5-mini等模型上的实验,发现对抗性漏洞源于架构而非模型能力,推动流水线级防御的发展。
Comments This paper has been accepted at the 2026 IEEE Global Communications Conference (GLOBECOM)
当LLM停止遵循步骤:语言模型中程序执行的诊断研究
机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈丁加尔)
专题命中 评测与基准 :language model(title,abstract);LLM(title_cn,abstract_cn);large language model(abstract);分类 cs.CL
AI总结 本研究通过构建受控诊断基准,评估大型语言模型在程序执行任务中的忠实性,发现随着步骤增加准确率从63%降至20%,并揭示了缺失答案、过早答案、自我修正和执行不完整等失败模式。
Comments 24 pages, 19 figures, 4 Tables
从文本需求到微服务架构 —— 基于大语言模型的设计合成综合评估
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究探讨OpenAI o3能否仅从文本需求生成微服务架构,经实验发现少样本提示下其服务识别与通信恢复的一致性优于零样本,为需求驱动的架构合成提供了潜力。
守护者与违规者:大语言模型有害内容生成与安全缓解研究综述
机构 * University of South Florida(佛罗里达州立大学) ; Missouri University of Science and Technology(密苏里科技大学)
专题命中 评测与基准 :LLM(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。
评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Independent Researcher, China(独立研究者,中国) ; Singapore Management University, Singapore(新加坡管理大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。
Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench
量化预算约束下代理LLM搜索中的准确性与成本影响
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。
Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)
PerspectiveGap: 多智能体编排提示的基准测试
机构 * University of Maryland(马里兰大学) ; The Chinese University of Hong Kong(香港中文大学) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.CL
AI总结 提出PerspectiveGap基准,评估LLM为多智能体系统编写编排提示的能力,实验显示模型平均通过率仅14.9%,表明该能力独特且未被充分评估。
在大语言模型生成中解耦任务解决与输出格式
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。
Comments Update to the latest ACL published version and add a link to the released code
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781
COALA:通过对比正则化器和偏差分数估计实现用于ASR的鲁棒上下文语音增强语言建模
机构 * National Taiwan Normal University(国立台湾师范大学)
专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究旨在增强复杂多实体场景中的语音增强语言模型,提出COALA框架,通过将SLM潜在表示映射到判别空间量化匹配强度,并解决训练崩溃问题,在LibriSpeech基准上实现了卓越的上下文偏差性能。
Comments Accepted at INTERSPEECH 2026
RuleChef:将LLM任务知识扎根于可人工编辑的规则
机构 * KR Labs(KR实验室) ; TU Wien(维也纳工业大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。
Comments 8 pages
校准,而非编译:检测和修复语言模型编写的错误指定概率程序
机构 * RIKEN iTHEMS ; RIKEN AIP ; South China University of Technology(南方科技大学) ; Columbia University(哥伦比亚大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。