arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 644 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 163 篇

2606.15436 2026-06-16 cs.LG cs.AI eess.AS 新提交 84%

Beyond Classification: A Cough Regression Benchmark for Respiratory Acoustic Foundation Models

超越分类:呼吸声学基础模型的咳嗽回归基准

Mayur Sanap, Prasanna Desikan, Edgar Lobaton

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出多模型多目标咳嗽回归基准,评估五个基础模型在六个目标上的表现,发现MLP-small优于线性探测,揭示数据集大小与头部容量的权衡,并展示跨数据集迁移的不对称性。

Comments Accepted at the ICML 2026 Workshop on Structured Data for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16753 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

P3B3:用于测量大语言模型中欧洲和巴西葡萄牙语变体偏差的多轮对话基准

Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

机构 * NOVA University of Lisbon(新里斯本大学) NOVA LINCS(NOVA LINCS实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出P3B3基准,通过专家策划的对话提示和评估框架,测量大语言模型在葡萄牙语变体(欧洲vs巴西)上的偏差和可控性,发现多数模型偏向巴西葡萄牙语。

Comments Accepted at MeLLM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15390 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

Not All Skills Help: Measuring and Repairing Agent Knowledge

并非所有技能都有用:测量与修复智能体知识

Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Purdue(普渡大学) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASSAY框架,通过随机掩码测量技能因果贡献,分离技能生成与筛选,在推理时抑制负面技能,显著提升LLM智能体任务完成率。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16975 2026-06-16 cs.SD eess.AS 版本更新 83%

Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs

基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估

Yuhang Jia, Xu Zhang, Yang Chen, Hui Wang, Enzhi Wang, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15766 2026-06-16 cs.AI cs.HC 新提交 83%

Rethinking Scaffolding in LLM Tutors: The Interactional Mismatch Between Benchmarks and Real-World Deployments

重新思考LLM导师中的脚手架:基准测试与真实部署之间的交互不匹配

Alexandra Neagu, Jeffrey T. H. Wong, Marcus Messer, Rhodri Nelson, Peter B. Johnson

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过分析9490个聊天记录,发现AI导师基准测试假设学生积极接受脚手架,但真实场景中学生常绕过脚手架,揭示基准测试与真实部署的交互不匹配。

Comments Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15447 2026-06-16 cs.AI 新提交 83%

Hierarchical Modeling of ICD Codes in EHR Foundation Models

EHR基础模型中ICD码的分层建模

Megha Thukral, Dong Gyun Kang, Rudra Pratap Singh, Shruthi Kashinath Hiremath, Katrin Hänsel, Thomas Plötz

机构 * School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) Optum AI

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究利用ICD-10-CM层次结构作为归纳偏置,通过序列增强和图注入两种机制改进EHR表示学习,实验表明显式编码层次结构在域内和跨数据集任务中均优于扁平表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06834 2026-06-16 cs.CL q-bio.GN 新提交 83%

The Dark Regulome: Disentangling Predictability from Regulation in Genomic Foundation Models

暗调控组:从基因组基础模型中分离可预测性与调控性

Chahat Baranwal, Aaditya Baranwal, Lakshya Nitin Tandon

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) University of Central Florida(中央佛罗里达大学) Northeastern University(东北大学)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出残差化-置换诊断方法,从基因组基础模型的计算机诱变评分中分离序列可预测性与调控信号,揭示10kb近端调控边界,并验证跨架构分解可区分可预测性层与调控输出层,为暗基因组调控研究提供通用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09370 2026-06-16 cs.DC cs.AI 版本更新 83%

From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs

从检测到恢复:504 GPU上LLM预训练的运营分析

Daemyung Kang, Eunjin Hwang, Hanjeong Lee, HyeokJin Kim, Hyunhoi Koo, Jeongkyu Shin, Jeongseok Kang, Jihyun Kang, Jinho Heo, Joongi Kim, Junbum Lee, Jungseung Yang, Kyujin Cho, Youngsook Song

机构 * Lablup Inc.(Lablup公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过分析一个63节点NVIDIA B200生产集群(504 GPU)55天的Prometheus时间序列数据和73天的运营日志,提出了三项定量分析,揭示了多信号检测策略、存储I/O瓶颈和自动重试恢复机制的有效性。

Comments 42 pages, 19 figures, 16 tables. Lablup Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16617 2026-06-16 cs.CL cond-mat.mtrl-sci cs.AI 新提交 82%

Sycophancy as Material Failure under Pushback Loading: A Multi-Axis Characterization Across Three Loading Cases and up to Seventeen Material Charges

推挤载荷下的谄媚作为材料失效:三种加载情形及多达十七种材料批次的多元表征

Ferdinand M. Schessl

机构 * typx.org

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 采用材料科学框架,将LLM谄媚视为推挤载荷下的材料失效,通过14个轴测量和三种加载情形(辩论、错误预设、伦理设定)共7800个样本,揭示失效模式依赖加载类型,并发现跨评判者可靠性差异。

Comments 12 pages, 3 figures. Code, data, and pre-registrations: https://github.com/FerdinandSchessl/sycophancy-note-companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16062 2026-06-16 cs.AI cs.LG 新提交 82%

Auditing Reward Hackability in Code RL Training Environments

审计代码强化学习训练环境中的奖励可破解性

Shreshth Rajan

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 测量代码RL环境接受错误解决方案的比率,发现SWE-bench Verified中28.5%的任务测试套件薄弱,并提出通过LLM判断器和Docker金标准门控来加固漏洞任务的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15532 2026-06-16 cs.CL cs.LG 新提交 82%

EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

EIBench: 基于模拟器的基准测试和用于情绪管理的回合信用强化学习

Rongzhi Zhu, Xiang Huang, Yuchuan Wu, Rui Wang, Zequn Sun, Tao Ren, Weiyao Luo, Bingxue Qiu, Jieping Ye, Yongbin Li, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Qwen-Character Team, Alibaba Group(阿里巴巴集团Qwen-Character团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出EIBench模拟器基准,包含2222个场景,通过2x2分类(支持、防御、修复、魅力)评估多轮情绪管理;并设计CTC-GRPO方法利用逐轮状态更新作为密集反馈,提升模型情绪智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02093 2026-06-16 cs.CL cs.AI cs.IR 82%

Better by Comparison: Retrieval-Augmented Contrastive Reasoning for Automatic Prompt Optimization

通过对比改进:基于检索增强的对比推理用于自动提示优化

Juhyeon Lee, Wonduk Seo, Hyunjin An, Seunghyun Lee, Yi Bu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRPO框架,通过对比推理提升提示优化效果,利用HelpSteer2数据集中的高质量示例进行对比分析,改进提示生成的鲁棒性和可解释性。

Comments Preprint

Journal ref 2025 ACM/IEEE Joint Conference on Digital Libraries (JCDL), Dekalb, IL, USA, 2025, pp. 269-272

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09310 2026-06-16 cs.CL cs.AI cs.SE 版本更新 82%

Understanding, Detecting, and Repairing Real-World In-Context-Learning-Based Text-to-SQL Errors

理解、检测和修复基于上下文学习的真实世界文本到SQL错误

Jiawei Shen, Chengcheng Wan, Ruoyi Qiao, Jiazhen Zou, Hang Xu, Yuchen Shao, Yueling Zhang, Weikai Miao, Geguang Pu

机构 * East China Normal University(东华师范大学) Shanghai China(上海中国) Shanghai Innovation Institute(上海创新研究院) sei.ecnu.edu.cn(东华师范大学电子邮件)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究首次全面调查基于上下文学习的文本到SQL错误,总结27种错误类型,并提出MapleDoctor框架,相比现有方法修复率提高13.8%,误修复极少,延迟降低67.4%。

Comments Accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16658 2026-06-16 cs.CV 新提交 82%

Vision-Language Models as Zero-Annotation Oracles in Histopathology

视觉-语言模型作为组织病理学中的零标注预言机

Vishal Jain, Giorgio Buzzanca, Sarah Cechnicka, Maarten Naesens, Priyanka Koshy, Tri Nguyen, Jesper Kers, Candice Roufosse, Bernhard Kainz

机构 * Imperial College London(帝国理工学院) Leiden University Medical Center(莱顿大学医学中心) KU Leuven(鲁汶大学) University Hospitals Leuven(鲁汶大学医院) University Medical Center Utrecht(乌得勒支大学医学中心) Friedrich-Alexander University Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

AI总结 提出一种粗到细方法,利用通用视觉-语言模型作为零标注预言机进行前景分割,在特殊染色上优于监督基线,并通过伪标签蒸馏轻量学生模型。

Comments 11 pages, 1 figure, 6 tables. Code available at https://github.com/VishalJ99/vlm-wsi-auto-context

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16162 2026-06-16 cs.SE 新提交 82%

Binary Decompilation LLM with Feedback-Driven Multi-Turn Refinement

基于反馈驱动多轮精化的二进制反编译大语言模型

Peipei Liu, Jian Sun, Mingzhe Xing, Yicheng Zeng, Zhaoteng Yan, Lixiao Zhang, Li Chen, Dan Li

专题命中 评测与基准 :LLM(title,abstract)

AI总结 提出AutoDecompiler,利用强化学习进行反馈驱动的多轮二进制反编译,通过编译、执行和I/O测试反馈迭代改进代码,显著提升行为可重执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15608 2026-06-16 cs.CV 新提交 82%

On the Adversarial Robustness of Multimodal LLM Judges

多模态大语言模型评判器的对抗鲁棒性

Zihan Wang, Guansong Pang, Zelin Liu, Wenjun Miao, Jin Zheng, Xiao Bai

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and System, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) State Key Laboratory of Software Development Environment, Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院软件开发环境国家重点实验室) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 提出RobustMLLMJudge框架评估多模态大语言模型作为评判器时的对抗鲁棒性,并设计MGSIA攻击方法,通过语义诱导和高分流形对齐生成可迁移的分数膨胀扰动,揭示其脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16874 2026-06-16 cs.CL cs.CE cs.CY 新提交 81%

Understanding Scam Trends and Rail Paths from Reddit Self-Disclosure Narratives

理解 Reddit 自我披露叙事中的诈骗趋势和路径

Yangjun Zhang, Mirko Bottarelli, Mark Hooper, Carsten Maple

机构 * The Alan Turing Institute, London, UK(艾伦·图灵研究所,伦敦,英国)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过构建2023-2025年Reddit自我披露数据集,采用启发式标注和LLM辅助方法分析诈骗类型趋势、多阶段路径及社区支持行为,发现诈骗过程以多路径为主且随时间变化。

Comments 6 pages, International Conference on AI and the Digital Economy (CADE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15949 2026-06-16 cs.CL 新提交 81%

FinBalance: A Multi-Document Accounting Reconciliation Benchmark

FinBalance:多文档会计对账基准

Sasank Tumpati, Devansh Agarwal, Ayush Kedia, Arjun Neekhra, Murari Mandal, Krishna Garg, Yash Sinha, Suman Gupta, Dhruv Kumar

机构 * BITS Pilani(比拉理工学院皮拉尼校区) KIIT Bhubaneswar(KIIT布巴内斯瓦尔) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出FinBalance基准,通过多行业源文档构建会计对账任务,评估LLM在生成资产负债表和检测不一致性上的表现,发现模型在文档绑定和一致性聚合上存在显著差距。

Comments 18 pages, 12 figures. Code and data: https://github.com/Devansh1105/finbalance

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15643 2026-06-16 cs.CL 新提交 81%

Extending Item Response Theory for Efficient and Meaningful Multilingual Evaluation

扩展项目反应理论以实现高效且有意义的多语言评估

Gili Lior, Tzviel Frostig, Gabriel Stanovsky, Matan Eyal

机构 * Google Research(谷歌研究) The Hebrew University of Jerusalem(特拉维夫大学) PhaseV Trials

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Multilingual-IRT框架,通过引入每语言难度偏差、分离内容与语言效应的区分度及每语言能力残差,解决多语言基准测试中的线性扩展、翻译错误和文化特定知识混淆问题,在MMLU-Pro-X上实现更优的预测和错误检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15376 2026-06-16 cs.DC cs.AI cs.MA 新提交 81%

CoAgent: Concurrency Control for Multi-Agent Systems

CoAgent: 多智能体系统的并发控制

Hongtao Lyu, Dingyan Zhang, Mingyu Wu, Xingda Wei, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对多智能体LLM系统并发访问共享状态时的冲突问题,提出MTPO协议,通过智能体自身判断冲突并修复计划,实现可串行化执行,在保持近串行正确率的同时提升速度。

Comments 14 pages, 7 figures. Submitted to ATC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14715 2026-06-16 cs.MA cs.AI cs.SI 新提交 81%

MiroBench: Benchmarking Realism in Agentic Simulation of Real-world Discussions

MiroBench:真实世界讨论的智能体模拟真实性基准测试

Yaoning Yu, Ye Yu, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Starc.Institute(Starc研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出MiroBench基准,基于4292条真实Reddit帖子,通过统计测试评估LLM智能体模拟在重复性、叙事内容、毒性攻击和结构复杂度四个方面的分布匹配度,发现当前模拟器与真实讨论存在分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11692 2026-06-16 cs.CY cs.AI cs.MA cs.SI 新提交 81%

Evaluation of Alternative-Based Information Systems for Deliberative Polling using an Agentic Simulator

基于智能体模拟器的审议式投票中替代性信息系统评估

Rwaida Alssadi, Khulud Alawaji, Balaji Kasula, Muntaser Syed, Badria Alfurhood, Markus Zanker, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院) Princess Nourah Bint Abdulrahman(纳厄赫·阿卜杜勒拉赫曼公主) Free University of Bozen-Bozano(博兹诺-博萨诺自由大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于LLM的智能体双极论证模拟器(ABAS),通过覆盖率和语料多样性评估审议式投票中推荐机制的有效性,并测试了对抗性投票攻击下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08867 2026-06-16 cs.CL 新提交 81%

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

构建面向1亿用户规模的客户支持AI代理:一种评估驱动的框架

Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

机构 * Nubank

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出一个统一框架,通过评估驱动开发、上下文工程、人工循环提示迭代和LLM评判一致性优化,在Nubank的100M+用户规模下实现客户支持AI代理的离线开发与在线效果桥接,并在五个生产部署中验证了离线指标与在线结果的高度相关性。

Comments 12 pages. Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15420 2026-06-16 cs.LG cs.AI 新提交 81%

Constitutional Value Potentials: reading and steering internal priority margins in language models

宪法价值潜力:读取和引导语言模型中的内部优先级边际

Tong Che, Rui Wu

机构 * NVIDIA Research(英伟达研究院) Rutgers University(罗格斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出宪法价值潜力(CVP)方法,通过从隐藏状态学习标量势来读取模型内部的价值优先级边际,以预测和干预价值冲突,AUROC高达0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01095 2026-06-16 cs.CV cs.AI cs.LG 版本更新 81%

CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions

CycliST:用于循环状态转换推理的视频语言模型基准

Simon Kohaut, Daniel Ochs, Shun Zhang, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami

机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA)) Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国) Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI)) Center for Cognitive Science(认知科学中心) German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CycliST基准,通过合成视频评估视频语言模型对循环状态转换的文本推理能力,揭示现有模型在检测循环模式、时间理解和定量分析方面的局限。

Comments Published in the Journal of Data-centric Machine Learning Research (DMLR); https://openreview.net/forum?id=l03g53HUL2

Journal ref Journal of Data-centric Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16749 2026-06-16 cs.CV 新提交 80%

Structure-aware Knowledge-guided Heterogeneous Mamba for Zygomaticomaxillary Suture Assessment

结构感知知识引导的异构Mamba用于颧上颌缝评估

Xiaoqi Guo, Birui Chen, Xinquan Yang, Chaoyun Zhang, Xuefen Liu, Mianjie Zheng, Kun Tang, Xuguang Li, Wen Ma, Yanhua Xu, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Affiliated Stomatology Hospital of Kunming Medical University(昆明医科大学附属口腔医院) Shenzhen University General Hospital(深圳大学总医院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出首个ZMS公开数据集(3790张图像,覆盖4-24岁),并设计SKMamba框架,通过解耦双路径架构、隐式边缘提取器和跨模态语义对齐模块,实现自动化ZMS成熟度评估,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16650 2026-06-16 cs.SE 新提交 80%

Understanding Automated Web GUI Testing: An Empirical Study Across Exploration Strategies and State Abstractions

理解自动化Web GUI测试:跨探索策略和状态抽象的实证研究

Chenxu Liu, Wei Yang, Ying Zhang, Tao Xie

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过实证研究分析自动化Web GUI测试中探索策略(基于模型、强化学习、大语言模型)与状态抽象如何共同影响测试有效性,发现不同策略在代码覆盖、状态覆盖和故障发现上互补,状态抽象是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16121 2026-06-16 cs.CR 新提交 80%

Invisible Manipulation Channels in AI-Assisted Financial Advisory: Implications for Market Integrity and Regulatory Design

AI辅助金融咨询中的隐形操纵通道:对市场完整性与监管设计的影响

Liuyang Yao, Zhouyu Li, Junguang He, Ziyang You

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文发现并验证了LLM推理采样层的隐形操纵通道,该漏洞可系统性偏置AI金融意见,同时绕过输出审计和统计水印,并提出基于QRNG和TEE的硬件防御及四项监管修正。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15689 2026-06-16 cs.SE 新提交 80%

Bigger Isn't Always Better: A Comparative Evaluation of LLMs for Automated Code Review

更大未必更好:大型语言模型在自动化代码审查中的比较评估

Shivam Pankaj Kumar, Swati Bararia, Kislay Raj

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 评估五个LLM在代码审查中的表现,发现较小模型Claude Haiku 4.5以更低成本超越较大模型,并揭示合成数据高估能力、差异大小主导质量等关键发现。

Comments 7 pages, 4 figures, 13 tables, 13 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15572 2026-06-16 cs.CY 新提交 80%

Improving Capstone Team Outcomes through Dynamic Skill Matching and Preference Alignment

通过动态技能匹配和偏好对齐改进顶点项目团队成果

Brandon Pardi, Garret Castro, Michael Pisman, Avash Adhikari, Santosh Chandrasekhar

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出三阶段方法,结合学生偏好与项目技能需求,利用大语言模型提取技能要求,通过动态分配算法优化团队组成,提升技能覆盖和偏好满意度。

Comments 15 pages, 3 figures, Accepted to the 12th International Conference on Computational Science and Computational Intelligence (CSCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏