arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-10 至 2026-07-10 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2601.22588 2026-07-10 cs.CL cs.AI cs.LG 版本更新 93%

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

重新思考大语言模型作为评判器:通过语义能力不对称利用小语言模型进行表示作为评判器

Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Daqing He

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Pittsburgh(匹兹堡大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);small language model(title);large language model(abstract)

AI总结 研究探讨小语言模型能否作高效评估器,基于语义能力不对称假设提出“表示作为评判器”范式,通过INSPECTOR框架实例化,实验显示其在推理基准测试中性能出色,为可扩展评估提供了更优选择。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16453 2026-07-10 cs.AI 版本更新 92%

RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments

RetailBench: 评估LLM代理在真实零售环境中的长周期自主决策与策略稳定性

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RetailBench基准,用于评估LLM代理在千天级超市运营模拟中的长周期决策能力,发现当前最强模型仍远落后于最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25984 2026-07-10 cs.AI cs.LG 新提交 91%

InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

InvestPhilBench: 评估大型语言模型在专家投资哲学中程序性推理的多层动态基准

Mingguang Chen, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG

AI总结 提出InvestPhilBench基准,通过八层认知层级和自动化评分管道,揭示前沿LLM在投资决策程序推理中的复合评分饱和但程序性缺陷隐藏的问题。

Comments 65 pages, 6 figures, 26 tables. Benchmark, data, and code released. v0.6 release; preliminary empirical study (de-confounded multi-model leaderboard forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11847 2026-07-10 stat.ML cs.LG 版本更新 90%

Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings

丢弃少量偏好可以改变大型语言模型的排名

Jenny Y. Huang, Yunyi Shen, Dennis Wei, Tamara Broderick

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 研究通过评估LLM排名系统的鲁棒性,发现丢弃少量偏好数据可显著影响模型排名,揭示MT-bench偏好更稳定的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03378 2026-07-10 cs.CR cs.SE 版本更新 89%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07739 2026-07-10 cs.CR 新提交 89%

Controllability-Aware Adversarial Examples Against LLM-Based Network Traffic Classifiers

针对基于大语言模型的网络流量分类器的可控性感知对抗样本

Zhenpeng Li

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的网络流量分类器的对抗鲁棒性,提出可控性感知黑盒迁移框架,按通信语义划分特征组限制扰动,生成对抗样本并迁移到多个目标,发现LLM迁移漏洞及相关特性,验证跨架构迁移层次和交叉代理有效性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08117 2026-07-10 cs.CL 新提交 89%

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

COALA:通过对比正则化器和偏差分数估计实现用于ASR的鲁棒上下文语音增强语言建模

Jhih-Rong Guo, Bi-Cheng Yan, Tien-Hong Lo, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究旨在增强复杂多实体场景中的语音增强语言模型,提出COALA框架,通过将SLM潜在表示映射到判别空间量化匹配强度,并解决训练崩溃问题,在LibriSpeech基准上实现了卓越的上下文偏差性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08143 2026-07-10 cs.CL cs.AI cs.IR 新提交 88%

ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

ICDAR 2026关于历史文档的大语言模型辅助OCR后校正的HIPE-OCRepair竞赛

Maud Ehrmann, Emanuela Boros, Juri Opitz, Andrianos Michail, Florian Wagner, Simon Clematide

机构 * École Polytechnique Fédérale de Lausanne (EPFL), Switzerland(瑞士联邦理工学院洛桑分校) University of Zurich, Switzerland(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ICDAR 2026的HIPE-OCRepair竞赛旨在评估大语言模型辅助历史文档OCR后校正系统能力,提供可重现评估框架。四支队伍提交不同策略系统,结果显示虽能提高OCR质量,但性能因多种因素而异,还存在过度校正问题,相关资源已发布供后续研究。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08038 2026-07-10 cs.AI 新提交 86%

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架

Fan Ma, Mauro Giuffrè, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu

机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) Università degli Studi di Trieste(的里雅斯特大学) Vanderbilt University(范德堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07457 2026-07-10 physics.ed-ph 86%

How Well Do AI Systems Solve AP Physics? A Comparative Evaluation of Large Language Models on Algebra-Based Free Response Questions

AI系统如何解决AP物理问题?对大型语言模型在代数基础自由回答问题上的比较评估

Bilas Paul, Jashandeep Kaur, Shantanu Chakraborty, Shruti Shrestha

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract)

AI总结 本文评估了AI系统在解答AP物理自由回答问题上的表现,发现其在代数问题解决上表现良好,但在空间推理和视觉解释方面存在局限。

Comments 10 pages, 3 figures

Journal ref Phys. Educ. 61 045008 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07895 2026-07-10 cs.CL 新提交 85%

Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

通过人机协作构建可扩展的特定文化刻板印象数据集

Weicheng Ma, John Guerrerio, Soroush Vosoughi

机构 * Dartmouth(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型刻板印象研究多集中于英语语境的问题,引入人机协作标注框架构建西班牙语刻板印象数据集EspanStereo,验证框架有效性,揭示各国刻板行为差异,该框架可扩展用于多语言,拓宽了刻板印象分析范围并奠定跨文化偏见评估基础。

Comments Weicheng Ma, John Guerrerio: equal contribution; published in EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03533 2026-07-10 cs.AI 85%

Automated Analysis of Global AI Safety Initiatives: A Taxonomy-Driven LLM Approach

全球人工智能安全举措的自动化分析:基于分类学的LLM方法

Takayuki Semitsu, Naoto Kiribuchi, Kengo Zenitani

机构 * Japan AI Safety Institute(日本人工智能安全研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自动化框架,通过共享活动分类法比较AI安全政策文件,利用活动地图上的活动类别提取并映射相关活动,生成摘要、比较和相似度评分,评估LLM在政策文档中的稳定性与有效性。

Comments 18 pages, 6 figures, 6 tables, to be published in PoliticalNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18020 2026-07-10 cs.SE cs.AI 85%

Specification and Detection of LLM Code Smells

LLM代码异味的规范与检测

Brahim Mahmoudi, Zacharie Chenail-Larcher, Naouel Moha, Quentin Stiévenart, Florent Avellaneda

机构 * École de technologie supérieure Université du Québec à Montréal

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM代码异味的概念,通过扩展检测工具SpecDetect4AI,分析了200个开源LLM系统中60.50%的系统存在代码异味问题,检测精度达86.06%。

Comments Accepted paper at ICSE NIER 2026 : https://conf.researchr.org/track/icse-2026/icse-2026-nier

Journal ref ICSE-NIER '26: 2026 IEEE/ACM 48th International Conference on Software Engineering Rio de Janeiro Brazil April 12 - 18, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 83%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 83%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 82%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08124 2026-07-10 cs.SE cs.LG 新提交 81%

TTHE: Test-Time Harness Evolution

测试时工具演化

Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center, The Hong Kong University of Science and Technology(香港生成式人工智能研究与开发中心,香港科技大学) TCL Corporate Research (HK) Co., Ltd(TCL 企业研究(香港)有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 研究LLM智能体测试时工具优化问题,提出TTHE方法,通过维护候选工具种群,基于执行轨迹推理优化,无需黄金标签或特定任务监督,在多任务实验中改进基线工具,将测试时适应重塑为程序演化并确定代理可靠性挑战。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12857 2026-07-10 cs.CY cs.AI 版本更新 81%

Adaptive Generation of Bias-Eliciting Questions for LLMs

为大语言模型自适应生成偏差引发问题

Robin Staab, Jasper Dekoninck, Maximilian Baader, Martin Vechev

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型固有偏差问题,引入反事实框架,通过迭代问题变异生成开放式问题评估偏差,构建CAB基准,评估发现模型在某些场景有持续偏差,凸显公平性研究需求。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08535 2026-07-10 cs.CL cs.AI 新提交 81%

When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

当评判者改变时,测量结果也会改变:评估大语言模型作为评判者的可靠性

Zongyou Yang, Yinghan Hou, Xiaokun Yang

机构 * Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院) Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系) School of Electronic Information, Nanchang Institute of Technology(南昌工程学院电子信息学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型作为评判者时分数因评估者变化而改变的问题,通过在四个数据集上比较两种升级路径,发现评判者升级不可互换,强评判者可减偏差,重复采样陪审团作用有限,结构化辩论能改决策,提出报告应含多方面内容。

Comments 6 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07729 2026-07-10 cs.MA cs.AI cs.CL 新提交 81%

Collective Intelligence with Foundation Models

基于基础模型的集体智能

J. de Curtò, I. de Zarzà

机构 * Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, 08034 Barcelona, Spain Escuela Técnica Superior de Ingeniería (ICAI), Universidad Pontificia Comillas, 28015 Madrid, Spain Human Centered AI, Data \& Software, LUXEMBOURG Institute of Science

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究如何将多个基础模型协调成合作推理系统,提出多智能体框架,含求解器、批评和聚合智能体及评分模块。通过消融研究比较四种配置,发现模型异质性是性能提升关键,能提高逐步准确率、降低方差,还讨论了相关原则、方法及对应用人工智能的影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12612 2026-07-10 cs.IR cs.AI 版本更新 79%

Self-EvolveRec: Self-Evolving Recommender Systems with LLM-based Directional Feedback

Self-EvolveRec:基于大语言模型定向反馈的自进化推荐系统

Sein Kim, Sangwu Park, Hongseok Kang, Wonjoong Kim, Jimin Seo, Yeonjun In, Kanghoon Yoon, Hyunsik Jeon, Chanyoung Park

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对传统推荐系统设计方法局限,提出Self-EvolveRec框架,集成用户模拟器与模型诊断工具建立定向反馈循环,并引入协同进化策略。实验证明该框架在推荐性能和用户满意度上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新 78%

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12497 2026-07-10 cs.CR 版本更新 78%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08346 2026-07-10 cs.CL q-fin.GN 新提交 77%

Grounded Event Extraction from SEC 8-K Filings with a Fine-Grained Taxonomy

基于细粒度分类法从美国证券交易委员会8-K文件中提取有依据的事件

Rian Dolphin, Joe Dursun, Jarrett Blankenship, Katie Adams, Quinton Pike

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对美国证券交易委员会8-K文件项目代码粗略问题,提出两阶段系统按119种事件类型分类法标记文件。通过模糊n-gram验证和重新评分产出有依据事件标签,经实验验证该系统能有效区分经济上不同的事件,提升事件提取精度。

Comments 9 pages, 8 figures, 1 table. Full dataset and taxonomy available at https://massive.com/docs/rest/stocks/filings/8-k-disclosures?utm_source=research&utm_campaign=8k_tags

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07946 2026-07-10 cs.SE cs.LG 新提交 77%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07881 2026-07-10 cs.SE cs.CR cs.LG 新提交 77%

Functional and Secure Code Generation with Task Vectors

使用任务向量进行功能和安全代码生成

Felix Wang, Anudeep Das, Mei Nagappan, N. Asokan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06127 2026-07-10 cs.CL 新提交 77%

Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

衡量共享决策的实践(OPTION12):对用于更好隐私和可持续性的开源小型语言模型(OS - sLLMs)的调查

Tamara Wit, Lifeng Han, Carly Heipon, David Lindevelt, Anne Stiggelbout, Suzan Verberne

机构 * Leiden University Medical Centre(莱顿大学医学中心) The Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 研究利用Observer OPTION12框架,对开源小型语言模型进行共享决策自动评估,聚焦隐私保护与本地部署。通过专家注释临床咨询评估多个模型,发现通用领域模型表现更好,还引入共识框架,为隐私保护的人在回路SDM评估提供基础。

Comments Pilot study. Preliminary findings on open-source smaller LLMs for OPTION12 shared decision-making assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 77%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00331 2026-07-10 cs.AI cs.MA 77%

CogEvo-Edu: Cognitive Evolution Educational Multi-Agent Collaborative System

CogEvo-Edu: 基于认知进化教育的多智能体协作系统

Yefeng Wu, Yuchen Song, Yecheng Zhao, Ling Wu, Shan Wan

机构 * Electronic Science and Technology, Anhui University(安徽大学电子科学与技术学院) Medical Imaging Science, Wannan Medical College(皖南医学院医学影像学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CogEvo-Edu通过认知进化机制实现教育多智能体协作,提升数字信号处理教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13723 2026-07-10 cs.SE 版本更新 75%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏