arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2602.11510 2026-06-16 cs.AI 版本更新 87%

AgentLeak: A Benchmark for Internal-Channel Privacy Leakage in Multi-Agent LLM Systems

AgentLeak:多智能体大语言模型系统中内部通道隐私泄露的基准测试

Faouzi El Yagoubi, Godwin Badu-Marfo, Ranwa Al Mallah

机构 * Polytechnique Montréal(蒙特利尔理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentLeak基准,通过评估内部通道(如智能体间消息、共享内存)的隐私泄露,发现多智能体系统虽降低最终输出泄露,但内部通道使总暴露率达68.9%,远超输出审计的检测范围。

Comments 19 pages, 9 figures, 16 tables. Code and dataset available at https://github.com/Privatris/AgentLeak

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04894 2026-06-08 cs.CR cs.AI 版本更新 87%

Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software

从黑盒LLM生成的软件中提取重复漏洞

Tomer Kordonsky, Amit LeVi, Maayan Yamin, Noam Benzimra, Avi Mendelson

机构 * Technion - Israel Institute of Technology(技术学院 - 以色列理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出特征-安全表(FSTab),通过黑盒攻击从前端特征预测后端漏洞,并量化模型跨程序、重述和领域的漏洞复现一致性,实验显示跨域攻击成功率高达94%。

Comments ICML 2026, Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14967 2026-08-07 cs.SE cs.AI cs.LG 版本更新 87%

MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation

MermaidSeqBench: 一种用于自然语言到Mermaid序列图生成的评估基准

Basel Shbita, Farhan Ahmed, Chad DeLuca

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MermaidSeqBench,通过混合方法构建132个样本,评估LLM生成Mermaid序列图的能力,揭示模型间显著能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10400 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新 87%

Designing Service Systems from Textual Evidence

从文本证据设计服务系统

Ruicheng Ao, Hongyu Chen, Siyang Gao, Hanwei Li, David Simchi-Levi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PP-LUCB算法,通过结合LLM代理评分与逆倾向加权残差,有效解决服务系统配置选择中的偏见问题,实现高置信度与低成本审计的平衡。

Comments This submission is withdrawn because it duplicates arXiv:2601.21471 by the same authors. The expanded manuscript was submitted as a new entry instead of as a replacement, so the same paper is now indexed twice. No results, proofs, or data are retracted. The current version is maintained as a replacement of arXiv:2601.21471, which readers should cite

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 87%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09898 2026-06-23 cs.LG cs.AI 版本更新 87%

Learning Bug Context for PyTorch-to-JAX Translation with LLMs

学习 PyTorch 到 JAX 翻译中的 Bug 上下文

Hung Phan, Son Vu, Tuan Dinh, Nesreen Ahmed, Ali Payani, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。

Comments ICML Deep Learning for Code (DL4C) workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23851 2026-06-18 cs.CL cs.AI cs.SC 版本更新 87%

ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark

ASyMOB:代数符号数学运算基准

Michael Shalyt, Rotem Elimelech, Ido Kaminer

机构 * MIT(麻省理工学院) Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ASyMOB基准,包含35,368个符号数学问题,通过扰动测试揭示大模型在符号数学推理中的鲁棒性不足,并发现LLM与CAS的互补潜力。

Comments Published in ICML2026: https://icml.cc/virtual/2026/poster/63549 Code repository: https://github.com/RamanujanMachine/ASyMOB Complete benchmark dataset: https://huggingface.co/datasets/Shalyt/ASyMOB-Algebraic_Symbolic_Mathematical_Operations_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04177 2026-06-09 cs.SE cs.AI cs.LG 版本更新 87%

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

CodeTaste:LLM能否生成人类级别的代码重构?

Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG

AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13404 2026-08-17 cs.SE cs.CR 版本更新 87%

Does Fixing Break Security? An Empirical Study of Security Degradation in Iterative LLM-Driven Infrastructure-as-Code Repair

修复会破坏安全性吗?对迭代式大语言模型驱动的基础设施即代码修复中安全性退化的实证研究

Benjamin Agyekum, Fabio Santos

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究通过分析IaC-Eval基准的5968个场景,发现迭代式LLM驱动的IaC修复会引入约3.3%场景的安全退化,主要由资源重构导致,第3次迭代是最优停止点,为安全反馈设计提供指导。

Comments 20 pages, 3 figures, 5 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026). To appear in LIPIcs Vol. 394. v2: corrected the bibliographic record of one reference (preprint, not a journal article) and added the related-version link to the published LIPIcs article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 87%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15536 2026-08-07 cs.HC 版本更新 87%

'OpenBloom': A Stigma-Sensitive LLM Design Probe for Navigating Reproductive Well-being Conversations with Young Adults

「OpenBloom」:一种面向生殖健康的污名敏感型大语言模型设计探针

Yang Hong, Ashley Hua, Adya Daruka, Sharifa Sultana

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出OpenBloom,利用大语言模型将生殖健康文章转为问题提示,通过34名参与者的136次交互研究,探讨AI生成问题如何与社会污名、情境敏感性和反思性互动,并讨论女性主义HCI、可争议性和价值敏感AI框架的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22748 2026-08-07 econ.GN q-fin.EC 版本更新 87%

Nine Raters, One Index: Carrying LLM Disagreement into Labour-Market Estimates

英国就业对生成式人工智能的暴露程度如何?开发和应用一个基于任务的指数

Golo Henseke, Rhys Davies, Alan Felstead, Duncan Gallie, Francis Green, Ying Zhou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文开发了生成式人工智能易感指数(GAISI),通过任务层面的数据衡量英国就业对大语言模型的暴露程度,发现多数岗位有一定程度的AI暴露,但仅有少数岗位高度暴露,且AI暴露对工资溢价的影响有所下降。

Comments 47 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15230 2026-08-04 econ.EM 版本更新 87%

EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data

EnergyAgentBench: 在实时能源基础设施数据上评估LLM代理的基准测试

Eliseo Curcio

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出EnergyAgentBench,首个基于实时电力市场数据的LLM代理基准测试,评估数据中心选址、长期投资组合优化等任务,九种模型在1414次运行中表现各异,Claude Sonnet 4.6在整体得分上领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00262 2026-07-22 cs.SE 版本更新 87%

LLM-Driven Cost-Effective Requirements Change Impact Analysis

基于大语言模型的低成本需求变更影响分析

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13347 2026-07-20 cs.CL cs.AI cs.LG 版本更新 87%

LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition

评估能力并不意味着优化效用:闭环表格识别中的大语言模型作为评判信号

Donghwan Kim

机构 * Aidentyx Inc.(艾登蒂克斯公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究闭环表格识别中LLM-as-a-judge的效用,发现其评判信号弱,无特定反馈也有严重损失,结构保留约束效果不佳,表明评估能力不意味着优化效用,迭代细化需确定性检测结构变化的验证信号。

Comments 32 pages, 9 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15212 2026-07-15 cs.CR 版本更新 87%

LLM vs. SAST: A Technical Analysis on Detecting Coding Bugs of GPT4-Advanced Data Analysis

大语言模型与SAST:关于GPT4-高级数据分析编码漏洞检测的技术分析

Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究对比GPT-4与两个SAST工具在32个安全场景的编码漏洞检测,用二元规则评分、逻辑或基线聚合结果,经McNemar检验,发现GPT-4检测性能更优,还讨论了将其集成到安全软件开发工作流程的相关要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08242 2026-07-07 cs.HC 版本更新 87%

Bringing Everyone to the Table: An Experimental Study of LLM-Facilitated Group Decision Making

让每个人都参与进来:关于大语言模型辅助群体决策的实验研究

Mohammed Alsobay, David M. Rothschild, Jake M. Hofman, Daniel G. Goldstein

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型辅助群体决策,通过随机实验,比较无辅助、一次性信息共享提示、人类辅助和大语言模型辅助四种条件下完成隐藏档案任务的情况,发现大语言模型辅助能增加信息共享,且成本有限,还开源数据和平台。

Comments To appear at ACM CSCW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17838 2026-06-29 cs.SE 版本更新 87%

Using Mutation-Analysis to Examine an LLM's Ability to Summarize Code

使用变异分析检验大语言模型总结代码的能力

Lara Khatib, Michael Pu, Bogdan Vasilescu, Meiyappan Nagappan

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 提出基于变异分析的评估方法,通过注入代码突变并检查摘要是否更新,测试LLM摘要是否反映实际行为;实验表明摘要准确率随复杂度下降,模型常描述意图而非行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03505 2026-06-16 cs.SE 版本更新 87%

LATS-RCA: Language Agent Tree Search for Root Cause Analysis in Microservices

LATS-RCA:面向微服务根因分析的语言智能体树搜索

Alexander Naakka, Yuqing Wang, Mika V Mäntylä

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出LATS-RCA方法,将根因分析建模为反射引导的树结构搜索,通过多智能体迭代分析日志和指标,在微服务系统中实现91.3%的诊断准确率,并验证了模型无关性。

Comments Accepted at the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16384 2026-06-10 cs.SE 版本更新 87%

SemOpt: LLM-Driven Code Optimization via Rule-Based Analysis

SemOpt: 基于规则分析的LLM驱动代码优化

Yuwei Zhao, Yuan-An Xiao, Qianyu Xiao, Zhao Zhang, Yingfei Xiong

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出SemOpt框架,通过静态程序分析识别代码段、检索优化策略并生成优化结果,在C/C++和Python任务上显著提升优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01060 2026-06-09 cs.CL cs.AI cs.LG 版本更新 87%

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量

Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') IIIT Delhi, India(德里印度理工学院) Amazon, USA(美国亚马逊) Meta, USA(美国Meta) Apple, USA(美国苹果)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14267 2026-08-13 cs.AI cond-mat.mtrl-sci 版本更新 86%

DREAMS: Density Functional Theory Based Research Engine for Agentic Materials Simulation

DREAMS:基于密度泛函理论的智能体材料模拟研究引擎

Ziqi Wang, Hongshuo Huang, Hancheng Zhao, Changwen Xu, Shang Zhu, Jan Janssen, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国) Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国) Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于DFT的分层多智能体框架DREAMS,通过多层安全防护提升LLM智能体材料模拟的可信度,在Sol27LC基准等任务中表现优异,可平衡可信度与成本,推动自主材料模拟发展。

Comments 47 pages, 44 pages of Supporting Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30412 2026-08-11 cs.CY cs.AI 版本更新 86%

Can LLMs Rank? A Tale of Triads and Triage

LLM能排序吗?三元组与分诊的故事

Gaurab Pokharel, Shafkat Farabi, Patrick J. Fowler, Sanmay Das

机构 * Virginia Tech(弗吉尼亚理工大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 研究LLM作为排序裁判的可靠性,提出用循环三元组计数和排序距离度量一致性,并在无家可归者住房分配和急诊分诊任务中验证。

Comments Accepted to the Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 86%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02594 2026-08-11 cs.AI 版本更新 86%

ACEvo: Adversarial Co-Evolution of Problem Distributions and Solvers for Combinatorial Optimization

ACEvo:面向组合优化的问题分布与求解器的对抗协同进化

Ruibo Duan, Yuxin Liu, Haoran Ye, Xinyao Dong, Zhiqiang Xu, Chenglin Fan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出ACEvo框架,通过LLM迭代协同进化启发式求解器与问题生成器,在TSP等组合优化问题上生成更具挑战性的实例分布,所得求解器在分布偏移下性能优于静态训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15974 2026-08-04 cs.CL 版本更新 86%

A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

面向对话摘要的大规模多维度LLM实证研究

Weixiao Zhou, Gengyao Li, Junnan Zhu, Xianfu Cheng, Feifei Zhai, Zhoujun Li

机构 * CCSE, Beihang University(北京航空航天大学CCSE) MAIS, CASIA(中国科学院自动化研究所MAIS) Fanyu AI Laboratory(帆禹AI实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 提出OmniCSEval基准,包含1800个跨六场景的对话,评估28个LLM在对话摘要中的完整性、简洁性和忠实性,揭示推理能力与模型规模的影响。

Comments 21 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21079 2026-08-04 cs.CL 版本更新 86%

SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

SoM-1K:用于材料力学能力的千题基准数据集

Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);foundation model(abstract);prompting(abstract)

AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02430 2026-08-03 cs.SE cs.AI 版本更新 86%

WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics

WebCoderBench: 用全面且可解释的评估指标对Web应用生成进行基准测试

Chenxu Liu, Yingjie Fu, Wei Yang, Ying Zhang, Tao Xie

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WebCoderBench,首个基于真实用户需求的Web应用生成基准,包含1572个真实用户需求及24个细粒度评估指标,结合规则和LLM评估方法,提供可解释的评估结果,实验显示无单一最优模型,为模型优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 86%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21799 2026-07-28 cs.CL cs.CY 版本更新 86%

Agentic Evaluation of Copyright Law Compliance

版权法合规性的智能体评估

Zheng Hui, Doni Bloomfield, Noam Kolt

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLM智能体版权法合规性评估问题,通过引入Copyright - Bench基准,由网站开发等商业任务组成,含提示变化与时间压力,对比智能体与人类基线,发现智能体存在选择版权作品及违规率受偏好和压力影响等情况。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏