Large Language Models for Supply Chain Optimization
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
LLM的隐式身份技术:跨数据集、模型和生成内容的指纹识别与水印
机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an, China(西安交通大学计算机科学与工程学院) ; State Grid Henan Marketing Service Center, Henan, China(国网河南营销服务中心) ; Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) ; School of Information Technology, Deakin University, Geelong, Australia(迪金大学信息技术学院)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文综述了LLM指纹识别和水印技术,提出隐式身份统一抽象,并基于生命周期分类法组织数据集、模型和生成内容的技术,建立评估框架。
Comments Accepted by IJCAI-ECAI 2026. 11 pages, 1 figure. Survey and taxonomy of LLM fingerprinting and watermarking for identity, provenance, generated-content attribution, and asset protection
Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。
Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025
机构 * Department of Statistics, University of California, Irvine(统计系,加州大学伊文斯分校) ; Department of Computer Science, University of California, Irvine(计算机科学系,加州大学伊文斯分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.LG
Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling
机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments Version 4: We added the latest works of LLM-based Embedders
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
Comments v3: Expand Agentic and SFT Chapters. Build Website for better visualization
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
Comments Accepted at 2 NeurIPS 2024 workshops: Generative AI for Health Workshop and Workshop on Advancements In Medical Foundation Models: Explainability, Robustness, Security, and Beyond
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG
Comments Statistical Foundations of LLMs and Foundation Models Workshop at NeurIPS 2024
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments MSP60K PAR Benchmark Dataset, LLM based PAR model, In Peer Review
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI、cs.LG
Comments Ongoing work. 21 pages. Related materials are continually maintained and available at https://github.com/modelscope/data-juicer/blob/main/docs/awesome_llm_data.md
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.LG
Comments NAACL 2024 Findings, GitHub Repo: https://github.com/yale-nlp/InstruSum, LLM-evaluators Leaderboard: https://huggingface.co/spaces/yale-nlp/InstruSumEval
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments Accepted by ACM Transactions on Intelligent Systems and Technology (TIST); 45 pages; More recent works; https://llm-eval.github.io/
专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
Comments Longyue Wang is the corresponding author. Our project page is at https://github.com/lyuchenyang/Macaw-LLM
可扩展评估的极限:LLM作为裁判无法超越两倍数据
机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ; Tübingen AI Center(图宾根人工智能中心) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG
AI总结 本文研究了使用LLM作为裁判进行模型评估的局限性,发现当裁判准确性不足时,去偏方法无法显著减少所需的真实标签数量。
Comments ICLR 2025; 27 pages, 8 figures
何时停止:LLM评估的贝叶斯最优停止
机构 * UK AI Security Institute(英国人工智能安全研究院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本研究提出optstop框架,将LLM评估视为序贯测量问题,基于分层贝叶斯推理实现自适应停止,可减少评估试验量且不影响结论,为LLM评估计算资源分配提供新方式。
AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。
Comments 19 pages, 5 figures
基于理论的评估揭示了LLM个性化中的作者身份差距
机构 * April 2026(2026年4月)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。
Comments Accepted at CTB Workshop, ICML 2026
评估者是实验的一部分:测量开放式大语言模型(LLM)的一致性
机构 * Illinois Institute of Technology(伊利诺伊理工大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 该研究提出实验方案测量开放式LLM一致性,发现错误同行输入会降低修订质量,评估者非中立,锚定校准必要,指出翻转率不足以完整衡量开放式一致性。
ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。
Comments Work in Progress
AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架
机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) ; Auburn University(奥本大学)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。
模板化还是完全合成?提示构造是测量LLM政治立场的混淆因素——超越写作辅助的视角
机构 * The National Center for AI in Society (CAISA), University of Copenhagen(哥本哈根大学社会人工智能国家中心(CAISA))
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 该研究针对LLM政治立场检测中模板化提示的混淆问题,扩展IssueBench框架,提出用LLM生成的完全合成提示,验证其在立场测量中更具生态效度,可减少估计偏差。
面向NLPCC 2026共享任务6的EVIL-Detect:大语言模型生成文本检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对中文场景下LLM生成文本检测需求,提出带冲突感知融合的多信号集成框架EVIL-Detect,整合多类信号并校准决策边界,在NLPCC 2026共享任务6中获宏F1 0.8888且排名第一。
Comments Accepted by NLPCC 2026 Shared Tasks
表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试
机构 * University of Georgia(佐治亚大学) ; University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Michigan State University(密歇根州立大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。
机遇并非可实现性:多大型语言模型(LLM)路由的选择有效诊断方法
机构 * Iowa State University(爱荷华州立大学) ; BRAC University(BRAC大学)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.LG
AI总结 该研究针对多LLM路由的神谕路由诊断缺陷,提出选择有效置信区间方法,通过实验发现可部署路由器仅能恢复部分神谕机遇,且最佳策略的增益下限可能为零。
MOSAIC:针对基于大语言模型的自动启发式设计的专用启发式算法与问题实例的对抗性协同进化
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出MOSAIC框架,通过对抗性协同进化组合优化问题的专用启发式算法与问题实例,构建区域专用启发式算法池,所提取的组合在各类基准测试中均优于现有最先进的基于LLM的自动启发式设计方法。
GraphReview: 基于LLM的图消息传递的科学论文评估
机构 * School of Economics and Management, East China Normal University(东华师范大学经济管理学院) ; Institute of Big Data, Fudan University(复旦大学大数据研究院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 提出GraphReview框架,通过图消息传递整合论文内在质量、同期关联和历时关联,利用LLM生成节点先验和边比较证据,结合个性化PageRank进行质量排序、决策预测和审稿生成,在决策和排序指标上平均提升29.7%。
Fisher-R1:训练用于可靠假设检验的大语言模型智能体
机构 * Stanford University(斯坦福大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。
在智能体间拆分分诊决策是隐藏偏差还是有助于发现偏差?审计能力约束下基于大语言模型的资源分配多智能体模拟研究
机构 * Institute for Future Technologies(未来技术研究所)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究通过多智能体模拟发现,在LLM资源分配中拆分决策为多智能体流程未显著改变偏差发生率,但审计能力影响偏差发现率,风险排序审核可提升覆盖范围。
Comments 6 pages, 2 figures, 3 tables. Code and data available at https://github.com/Polpii/policy-town