PiLLar: Matching for Pivot Table Schema via LLM-guided Monte-Carlo Tree Search
PiLLar:通过LLM引导的蒙特卡洛树搜索进行立方体表模式匹配
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文提出PiLLar框架,通过LLM引导的蒙特卡洛树搜索实现立方体表模式匹配,解决数据敏感性和匿名化数据带来的挑战,提升匹配精度和泛化能力。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
PiLLar:通过LLM引导的蒙特卡洛树搜索进行立方体表模式匹配
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文提出PiLLar框架,通过LLM引导的蒙特卡洛树搜索实现立方体表模式匹配,解决数据敏感性和匿名化数据带来的挑战,提升匹配精度和泛化能力。
个人特征如何塑造用户探索多样化电影推荐的多智能体系统
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文研究了基于LLM的多智能体系统如何支持用户探索多样化推荐,探讨个人特征对用户体验的影响,发现多智能体系统提升新颖性和多样性,性格特质和AI经验影响感知准确性与多样性。
Comments 11 pages, 2 figures. Accepted by UMAP '26 (34th ACM International Conference on User Modeling, Adaptation and Personalization)
当大语言模型评分膨胀时:探索相关性评估中的过度评分
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究揭示LLM在相关性评估中存在系统性高估问题,指出模型对不满足信息需求的文本给出高分,且易受文本长度和表层词汇影响,强调需谨慎评估LLM在相关性评估中的应用。
Comments Accepted at SIGIR 2026
基于大语言模型的网络配置修复基准测试
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出Cornetto基准测试,用于评估大语言模型在大规模网络配置修复中的功能性和扩展性,发现现有LLM在处理复杂场景时易引入回归问题。
PlayCoder: 使LLM生成的GUI代码可播放
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出PlayCoder框架,通过生成、评估和迭代修复GUI代码,提升代码的逻辑正确性和语义对齐,实现功能正确性和交互逻辑的改进。
Comments September 11, 2025 Submitted to FSE2026
大语言模型判官的保质期:未来证明、向后兼容性和问题泛化
机构 * Salesforce AI Research(Salesforce AI研究院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Dartmouth College(达特茅斯学院)
专题命中 评测与基准 :LLM(title,abstract);SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了细调判官模型在现实部署中的挑战,探讨了未来证明、向后兼容性和问题泛化三个核心问题,并通过实验发现持续学习在适应响应分布变化方面表现更优。
Comments Updated after ICLR 2026 Acceptance; 29 pages;
通过时间事件Transformer和LLM文本嵌入在MOOCs中进行学习者满意度预警预测
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文提出TET-LLM框架,结合时间事件Transformer、LLM嵌入和短文本主题分布,通过早期信号预测学习者满意度,实验表明其在7天预警范围内RMSE为0.82,AUC为0.77。
LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。
PILOT:通过路径引导、迭代式大语言模型提示进行命令行界面模糊测试
专题命中 评测与基准 :large language model(title);language model(title);prompting(title);LLM(abstract)
AI总结 PILOT通过引导路径和迭代式大语言模型提示生成命令行参数和输入文件,提升模糊测试覆盖率并发现51个零日漏洞。
Comments Accepted at the 47th IEEE Symposium on Security and Privacy (IEEE S&P 2026)
探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究
专题命中 评测与基准 :prompting(title,abstract);LLM(title,comments);large language model(abstract);language model(abstract)
AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。
Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages
专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title)
Comments Accepted by regular paper in NAACL 2025, with 13 pages, 5 figures
专题命中 评测与基准 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments ICLR 2025. 60 pages
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to Autonomous Robots (AuRo) - Special Issue: Large Language Models in Robotics, 2023 and IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2023. Project page: https://tidybot.cs.princeton.edu
专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 99 pages, 16 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;foundation model(comments)
Comments Foundation Models, Large Language Models, Arabic NLP, Arabic Speech, Arabic AI, GPT3.5 Evaluation, USM Evaluation, Whisper Evaluation, GPT-4, BLOOMZ, Jais13b
用于Verilog代码生成的大型语言模型:文献综述与未来方向
机构 * Zhejiang University \& Northwestern Polytechnical University China ; Northwestern Polytechnical University China ; Nantong University China ; Zhejiang University China ; Monash University Australia ; Singapore Management University Singapore ; Zhejiang University \& Northwestern Polytechnical University ; Northwestern Polytechnical University ; Nantong University ; Zhejiang University ; Monash University ; Singapore Management University
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。
Comments Accept in ACM Computing Surveys
以人为中心的基准测试大型语言模型(LLM)育儿建议方法
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。
Comments 15 pages. Submitted for review
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted at NeurIPS 2024-AI4Mat Workshop. The Benchmark and code can be found at https://github.com/vertaix/LLM4Mat-Bench
Journal ref 2025 Mach. Learn.: Sci. Technol. 6 020501
MEDLEY-BENCH:在AI元认知中规模购买评估但不控制
机构 * Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(临床科学、干预与技术部门(CLINTEC),Karolinska研究所) ; Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) ; Department of Biomedical Engineering and Health Systems, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院) ; Department of Textile Technology, University of Borås(纺织技术部门,Borås大学) ; Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 MEDLEY-BENCH评估了12种模型家族中35个模型在五个领域130个模糊实例上的行为元认知能力,发现评估能力随模型规模增加而增强,但控制能力不增加,揭示了元认知能力与规模无关的结论。
基于大语言模型的符号图形编程
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG
AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。
Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/
评估大型语言模型在跨器官系统CT放射报告零样本疾病标注中的效果
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 本研究评估了大型语言模型在CT报告零样本疾病标注中的效果,发现轻量级LLMs在多器官系统标注中表现优于规则方法,但需注意二元标签的局限性。
Comments 19 pages, 6 figures, 4 tables. Under review in Radiology: Artificial Intelligence
基于大语言模型的代理软件问题解决:综述
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。
技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?
机构 * East China Normal University(华东师范大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Tencent Hunyuan(腾讯混元)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。
MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准
机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Minhang Hospital, Fudan University(复旦大学附属闵行医院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。
反转大语言模型中的箭头
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。
Comments The preprint is under review in a venue
ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。
Comments Submitted to Journal of Biomedical Informatics (under review)
CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted by ISSTA 2025
Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025
非对称通信:大语言模型与语言游戏
专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。