arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 589 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 129 篇

2604.09721 2026-04-14 cs.IR cs.MM cs.SD 67%

Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering

Jamendo-MT-QA:多轨比较音乐问答基准测试

Junyoung Koh, Jaeyun Lee, Soo Yong Kim, Gyu Hyeong Choi, Jung In Koh, Jordan Phillips, Yeonjin Lee, Min Song

机构 * Yonsei University(延世大学) KRAFTON University of Oxford(牛津大学) George Mason University(乔治梅森大学) Sungkyul University(圣洁大学) MODULABS MAAP Onoma AI

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 本文提出Jamendo-MT-QA基准测试,用于评估多轨比较音乐问答能力,基于Jamendo-QA数据集构建36519个比较问答项,采用LLM辅助生成和过滤问题,并通过自动指标和LLM-as-a-Judge评估模型性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09577 2026-04-14 cs.HC cs.AI cs.CL cs.LG 67%

Generative UI: LLMs are Effective UI Generators

生成用户界面:LLM在生成用户界面方面非常有效

Yaniv Leviathan, Dani Valevski, Matan Kalman, Danny Lumen, Eyal Segalis, Eyal Molad, Shlomi Pasternak, Vishnu Natchu, Valerie Nygaard, Srinivasan, Venkatachary, James Manyika, Yossi Matias

机构 * Google Research(谷歌研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出生成用户界面的概念,展示通过适当提示和工具,现代LLM能生成高质量的定制UI。尽管生成速度不计,人类更偏好其输出,且在50%的情况下与专家相当。同时发布PAGEN数据集以评估生成用户界面的实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11109 2026-04-14 cs.DC cs.AI cs.LG cs.PF 62%

Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search

记录-混音-回放:利用进化搜索的分层GPU内核优化

Daniel Nichols, Konstantinos Parasyris, Caetano Melone, Tal Ben-Nun, Giorgis Georgakoudis, Harshitha Menon

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Record-Remix-Replay框架,结合LLM驱动的进化搜索、贝叶斯优化和记录回放编译技术,高效探索GPU内核优化,提升科学应用性能并加快优化速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21877 2026-04-14 cs.CL cs.AI 62%

CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics

CricBench:一个用于评估LLM在板球分析中能力的多语言基准

Parth Agarwal, Navya Kommuri, Trizal Garg, Prisha Singhal, Dhruv Shah, Vaibhav Devraj, Yash Sinha, Jagat Sesh Challa, Murari Mandal, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(印度比拉理工学院皮拉尼校区) KIIT Bhubaneswar, India(印度KIIT布巴内斯瓦尔)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CricBench,一个评估LLM在板球数据分析中SQL生成能力的多语言基准,包含四种板球格式数据,涵盖四种语言,评估七种模型,发现模型在不同格式上的表现差异显著,且存在语法正确性与语义正确性之间的差距。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00891 2026-04-14 cs.AI cs.CL 62%

ChatCLIDS: Simulating Persuasive AI Dialogues to Promote Closed-Loop Insulin Adoption in Type 1 Diabetes Care

ChatCLIDS: 模拟说服性人工智能对话以促进1型糖尿病护理中的闭环胰岛素采用

Zonghai Yao, Talha Chafekar, Junda Wang, Shuo Han, Feiyun Ouyang, Junhui Qian, Lingxi Li, Hong Yu

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChatCLIDS基准,用于评估基于LLM的说服对话在健康行为改变中的效果,通过模拟多轮交互和长期咨询场景,揭示当前LLM在行为改变中的局限性。

Comments Equal contribution for the first two authors. To appear in AAAI 2026 Special Track on AI for Social Impact

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11419 2026-04-14 cs.AI cs.CR 57%

Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval

超越RAG的网络威胁情报:基于图和代理检索的系统评估

Dzenan Hamzic, Florian Skopik, Max Landauer, Markus Wurzenberger, Andreas Rauber

机构 * AIT Austrian Institute of Technology(AIT奥地利技术研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文系统评估了四种RAG架构在CTI分析中的表现,发现图检索在结构化查询中表现更优,混合图文方法在多跳查询中提升答案质量达35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11304 2026-04-14 cs.AI 57%

BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows

BankerToolBench:评估AI代理在端到端投资银行业务流程中的表现

Elaine Lau, Markus Dücker, Ronak Chaudhary, Hui Wen Goh, Rosemary Wei, Vaibhav Kumar, Saed Qunbar, Guram Gogia, Yi Liu, Scott Millslagle, Nasim Borazjanizadeh, Ulyana Tkachenko, Samuel Eshun Danquah, Collin Schweiker, Vijay Karumathil, Asrith Devalaraju, Varsha Sandadi, Haemi Nam, Punit Arani, Ray Epps, Abdullah Arif, Sahil Bhaiwala, Curtis Northcutt, Skyler Wang, Anish Athalye, Jonas Mueller, Francisco Guzmán

机构 * Handshake AI McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出BankerToolBench,一个模拟投资银行日常工作的开源基准,用于评估AI代理在高价值、高强度的专业流程中的能力,测试结果显示当前AI模型在关键指标上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 57%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02387 2026-04-14 cs.AI 57%

VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

VS-Bench:评估多智能体环境中视觉语言模型的战略能力

Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang

机构 * EE, Tsinghua University(清华大学电子工程系) SIGS, Tsinghua University(清华大学深圳国际研究生院) Li Auto Inc.(理想汽车) IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。

Comments Published at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11072 2026-04-14 cs.AI 57%

Hodoscope: Unsupervised Monitoring for AI Misbehaviors

Hodoscope:无监督监控AI误行

Ziqian Zhong, Shashwat Saxena, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出Hodoscope,通过无监督方法发现AI代理的异常行为,减少人工审查工作量,并提升LLM判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10853 2026-04-14 cs.AI 57%

A Benchmark for Gap and Overlap Analysis as a Test of KG Task Readiness

一个用于空缺和重叠分析的基准:作为知识图谱任务准备性的测试

Maruf Ahmed Mridul, Rohit Kapa, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute, Troy, New York, United States(伦斯勒理工学院,纽约州特洛伊市,美国) Prudential Financial, Inc.(保德信金融集团)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一个可执行且可审计的基准,用于评估知识图谱的质量,通过将自然语言合同文本与形式本体对齐,系统比较方法。该基准包括简化但多样的人寿保险合同、领域本体和知识库,以及58个结构化场景和SPARQL查询,展示显式建模提升空缺和重叠分析的一致性和诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10580 2026-04-14 cs.CL cs.SD 57%

Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark

知晓应强调什么:一个基于语境的文本到语音基准测试

Arnon Turetzky, Avihu Dekel, Hagai Aronowitz, Ron Hoory, Yossi Adi

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) IBM Research(IBM研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出Context-Aware Stress TTS基准测试,评估语音合成系统在语境条件下对单词重音的处理能力,发现文本模型能准确恢复重音,但TTS系统常失败。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 57%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14698 2026-04-14 cs.CL 57%

ClaimDB: A Fact Verification Benchmark over Large Structured Data

ClaimDB: 一个基于大规模结构化数据的事实验证基准

Michael Theologitis, Preetam Prabhu Srikar Dammu, Chirag Shah, Dan Suciu

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出ClaimDB基准,通过百万级记录和多表组合验证事实,发现传统阅读方法失效,需转向可执行程序推理,实验显示超过一半模型准确率低于55%。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10953 2026-04-14 cs.CL 57%

A Multilingual Dataset and Empirical Validation for the Mutual Reinforcement Effect in Information Extraction

一种多语言数据集和信息提取中相互强化效应的实证验证

Chengguang Gan, Sunbowen Lee, Qingyu Yin, Yunhao Liang, Xinyang He, Hanjun Wei, Younghun Lim, Shijian Wang, Hexiang Huang, Qinghao Zhang, Shiwen Ni, Tatsunori Mori

机构 * Yokohama National University(横滨国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) Southeast University(东南大学) University of Tsukuba(筑波大学) Pusan National University(釜山大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出多语言MRE混合数据集,通过LLM辅助框架减少标注工作,验证了多语言环境下信息提取中相互强化效应的普遍性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09682 2026-04-14 cs.NI cs.AI 57%

Decision-Theoretic Safety Assessment of Persona-Driven Multi-Agent Systems in O-RAN

基于决策理论的面向角色驱动的多智能体系统在O-RAN中的安全性评估

Zeinab Nezami, Syed Ali Raza Zaidi, Maryam Hafeez, Louis Powell, Vara Prasad Talari, Mallik Tatipamula

机构 * GSMA(全球移动通信系统协会) University of Leeds(利兹大学) AWS(亚马逊云服务) Ericsson(爱立信)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一种基于角色驱动的多智能体框架,通过角色行为规范影响五个专业智能体,结合决策理论构建三维评估框架,验证486种角色配置在O-RAN优化挑战中的性能与协调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09678 2026-04-14 cs.NI cs.AI cs.FL 57%

NetAgentBench: A State-Centric Benchmark for Evaluating Agentic Network Configuration

NetAgentBench: 一种面向评估代理网络配置的基于状态的基准

Ahmed Twabi, Yepeng Ding, Tohru Kondo

机构 * Hiroshima University(广岛大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 NetAgentBench通过有限状态机形式化方法评估代理交互,揭示了当前LLM代理在复杂多轮网络配置任务中的缺陷,强调了系统性评估多轮行为稳定性的必要性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22055 2026-04-14 cs.CL 57%

RedNote-Vibe: A Dataset for Capturing Temporal Dynamics of AI-Generated Text in Lifestyle Social Media

RedNote-Vibe:一种捕捉生活方式社交媒体中AI生成文本时间动态的数据集

Yudong Li, Yufei Sun, Peiru Yang, Yuhan Yao, Wanyue Li, Jiajun Zou, Haoyang Yang, Haotian Gan, Linlin Shen, Yongfeng Huang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Metropolitan University(香港都会大学) Shenzhen University(深圳大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出RedNote-Vibe数据集,用于研究AI生成文本在生活方式社交媒体中的时间动态,并提出PLAD框架以检测AI生成内容,发现人类内容在情感领域仍占优,AI内容同质化但能通过高互动性内容缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14629 2026-04-14 cs.CV cs.CL 57%

VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites

VisText-Mosquito:一种统一的多模态数据集,用于蚊虫繁殖地的视觉检测、分割和文本解释

Md. Adnanul Islam, Md. Faiyaz Abdullah Sayeedi, Md. Asaduzzaman Shuvo, Shahanur Rahman Bappy, Md Asiful Islam, Swakkhar Shatabda

机构 * United International University, Bangladesh(孟加拉国联合国际大学) University of Arizona, USA(美国亚利桑那大学) BRAC University, Bangladesh(孟加拉国布拉卡大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出VisText-Mosquito数据集,整合视觉和文本数据以支持自动化检测、分割和解释,通过YOLOv9s和YOLOv11n-Seg模型实现高精度检测与分割,并利用大视觉语言模型生成文本解释,强调预防胜于治疗的主题。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20654 2026-04-14 cs.CV cs.AI 57%

AccidentSim: Generating Vehicle Collision Videos with Physically Realistic Collision Trajectories from Real-World Accident Reports

AccidentSim: 从真实世界事故报告生成具有物理真实碰撞轨迹的车辆碰撞视频

Xiangwen Zhang, Qian Zhang, Longfei Han, Qiang Qu, Xiaoming Chen, Weidong Cai

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University(北京工商大学计算机与人工智能学院) The University of Sydney(悉尼大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 AccidentSim通过提取事故报告中的物理信息生成真实碰撞视频,结合物理模拟和NeRF技术提升视觉与物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO 50%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11400 2026-04-14 cs.RO cs.CV 50%

EagleVision: A Multi-Task Benchmark for Cross-Domain Perception in High-Speed Autonomous Racing

EagleVision:面向高速自动驾驶赛事的多任务基准测试

Zakhar Yagudin, Murad Mebrahtu, Ren Jin, Jiaqi Huang, Yujia Yue, Dzmitry Tsetserukou, Jorge Dias, Majid Khonji

机构 * Skolkovo Institute of Science, Intelligent Space Robotics Laboratory, Center for Engineering Systems and Sciences(斯科尔科沃科学技术学院,智能空间机器人实验室,工程系统与科学中心) Khalifa University, KUCARS-KU Center for Autonomous Robotic Systems, Department of Computer Science(哈利法大学,KUCARS-KU自主机器人系统中心,计算机科学系) Beijing Institute of Technology, Beijing Key Laboratory of UAV Autonomous Control(北京理工大学,北京无人机自主控制重点实验室)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出EagleVision基准测试,用于研究高速自动驾驶赛事中跨领域感知问题,通过统一的LiDAR多任务基准,提供新标注的3D边界框数据及共同评估协议,验证了跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11171 2026-04-14 cs.CV 50%

Development and evaluation of CADe systems in low-prevalence setting: The RARE25 challenge for early detection of Barrett's neoplasia

低患病率环境下CADe系统的发展与评估:RARE25挑战赛对巴雷特氏病早期检测的探索

Tim J. M. Jaspers, Francisco Caetano, Cris H. B. Claessens, Carolus H. J. Kusters, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Jacques J. Bergman, Peter H. N. De With, Martijn R. Jong, Albert J. de Groof, Fons van der Sommen

机构 * Department of Electrical Engineering, Architectures for Reliable Image Analysis Lab, Eindhoven University of Technology, Eindhoven, Netherlands(埃因霍温理工大学电气工程系可靠图像分析实验室,荷兰埃因霍温) Department of Gastroenterology and Hepatology, Amsterdam University Medical Centers, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学医学中心胃肠病学和肝病学系,荷兰阿姆斯特丹)

专题命中 评测与基准 :pretraining(abstract)

AI总结 RARE25挑战赛针对低患病率环境下巴雷特氏病早期癌变检测问题,通过引入大规模预估患病率的基准测试,评估了多种CADe系统在不同操作点的性能,揭示了低患病率检测的挑战及现有方法的不足。

Comments The final author list is currently being finalized and will be updated in subsequent versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11092 2026-04-14 cs.IR 50%

ARHN: Answer-Centric Relabeling of Hard Negatives with Open-Source LLMs for Dense Retrieval

ARHN: 基于开源大语言模型的密集检索中以答案为中心的困难负样本重标定

Hyewon Choi, Jooyoung Choi, Hansol Jang, Hyun Kim, Chulmin Yun, ChangWook Jun, Stanley Jungkyu Choi

专题命中 评测与基准 :LLM(abstract)

AI总结 ARHN通过利用开源大语言模型对困难负样本进行重标定,结合重标定与过滤策略提升检索效果,提供更清洁的监督信号。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11078 2026-04-14 cs.CR 50%

From Context to Rules: Toward Unified Detection Rule Generation

从上下文到规则:迈向统一的检测规则生成

Cheng Meng, Wenxin Le, Xinyi Li, Qiuyun Wang, Fangli Ren, Zhengwei Jiang, Baoxu Liu

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出UniRule框架,通过双语义投影空间实现跨上下文和语言的统一检测规则生成,实验表明其优于纯LLM生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08538 2026-04-14 cs.CV 50%

ParseBench: A Document Parsing Benchmark for AI Agents

ParseBench:面向AI代理的文档解析基准测试

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B. Ospina, Simon Suo

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出ParseBench,一个包含2000多页企业文档的基准测试,涵盖表格、图表、内容忠实度、语义格式和视觉关联五大能力维度,揭示了当前系统在这些方面的能力缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11787 2026-04-14 cs.SE cs.MA 50%

CodeCureAgent: Automatic Classification and Repair of Static Analysis Warnings

CodeCureAgent:静态分析警告的自动分类与修复

Pascal Joos, Islem Bouzenia, Michael Pradel

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出CodeCureAgent,利用大语言模型代理自动分析、分类和修复静态分析警告,通过三步启发式方法生成合理修复方案,有效提升代码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10763 2026-04-14 cs.IR cs.HC 50%

BDIViz in Action: Interactive Curation and Benchmarking for Schema Matching Methods

BDIViz在行动:交互式整理与基准测试用于模式匹配方法

Eden Wu, Christos Koutras, Cláudio T. Silva, Juliana Freire

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出BDIViz系统,通过交互式可视化和LLM辅助验证,解决模式匹配方法评估中的基准多样性不足问题,支持人类在循环中的基准测试和迭代匹配器开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10747 2026-04-14 cs.SE 50%

Engineering Students' Usage and Perceptions of GitHub Copilot in Open-Source Projects

工程学生在开源项目中使用GitHub Copilot的使用情况与认知

Neha Rani, Jeevan Ram Munnangi, Austin Matthew Spangler, Donald Honeycutt

专题命中 评测与基准 :LLM(abstract)

AI总结 研究探讨了工程学生在开源项目中使用GitHub Copilot的差异,分析了性别、编程能力及AI熟悉度对使用情况的影响,发现学生更倾向于使用聊天和代码生成功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10675 2026-04-14 cs.CV 50%

HiddenObjects: Scalable Diffusion-Distilled Spatial Priors for Object Placement

HiddenObjects: 用于物体放置的可扩展扩散-蒸馏空间先验

Marco Schouten, Ioannis Siglidis, Serge Belongie, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(人工智能先锋中心)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出通过扩散模型蒸馏学习显式的类别条件空间先验,用于自然场景中的物体放置。通过自动化框架构建大规模数据集,实验表明其优于人类标注和现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏