arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-13 至 2026-07-13 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31 篇

2510.03595 2026-07-13 cs.CL 版本更新 89%

Decoupling Task-Solving and Output Formatting in LLM Generation

在大语言模型生成中解耦任务解决与输出格式

Haikang Deng, Po-Nien Kung, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。

Comments Update to the latest ACL published version and add a link to the released code

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交 87%

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09524 2026-07-13 cs.SE 新提交 85%

Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments

平衡有用性和自然性:基于大语言模型的代码审查评论整理管道

Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对现有代码审查数据集质量问题限制大语言模型在代码审查任务中效用的情况,提出两种整理管道。一种用大语言模型重述评论生成CuREV数据集,另一种以高质量示例为指导增强评论真实性和多样性,提升了代码审查数据集质量和下游任务效果。

Comments arXiv admin note: substantial text overlap with arXiv:2502.03425

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09007 2026-07-13 cs.SE quant-ph 新提交 83%

Benchmarking Large Language Models on Repairing Qiskit Programs using Bugs4Q

使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试

Saumya Brahmbhatt, Mitali Hukkeri, Dongchan Kim, M. V. Panduranga Rao, Lei Zhang

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试,评估两个含 67 个缺陷的 Bugs4Q 版本,在六个 Qiskit 版本上测试四个大语言模型,发现问题并发布重新验证的基准测试,强调基准验证先于修复评估。

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交 83%

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08981 2026-07-13 cs.SE cs.AI 新提交 83%

The Patchwork Problem in LLM-Generated Code

大语言模型生成代码中的拼凑问题

Viraaji Mothukuri, Reza M. Parizi

机构 * Decentralized Science Lab, College of Computing and Software Engineering(分布式科学实验室,计算机与软件工程学院)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究大语言模型生成代码中的拼凑问题,将结构一致性形式化并引入故障分类法,提出混合验证框架,经实证评估和真实世界验证,揭示多数结构故障难被现有检查发现,模型间故障模式有别,此类故障普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 81%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07720 2026-07-13 cs.LG cs.AI 新提交 81%

Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS-ANS Dynamics

全睡眠:一种通过中枢神经系统-自主神经系统动态分层对比学习的睡眠基础模型

Zhoujie Hou, Song Wang, Kexin Lou, Mo Wang, Chen Wei, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) Omni-Intelligence(全知智能) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 介绍全睡眠模型,利用CNS/ANS划分,通过分层对比学习的三个目标进行拓扑约束表示学习,在多中心多模态PSG数据预训练后用于睡眠分期和多疾病分类,性能优于基线,凸显生理层次对睡眠表示学习的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07047 2026-07-13 cs.CL cs.AI 新提交 81%

Riemannian Geometry for Pre-trained Language Model Embeddings

预训练语言模型嵌入的黎曼几何

Szczepan Konior, Alexandre Quemy, Przemysław Klocek, Bartłomiej Sobieski, Grégoire Cattan

机构 * IBM Automation and AI(IBM自动化与人工智能) Hother(霍瑟) University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究预训练语言模型嵌入的几何结构,提出黎曼均值池化方法,通过提取回拉度量并聚合,在三个数据集上RMP优于欧几里得均值池化,消融实验定位增益来源,训练好的编码器在特定数据集贡献额外信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09553 2026-07-13 cs.SE 新提交 80%

Writing Bug Reports for Software Repair Agents: What Information Matters Most?

为软件修复代理编写错误报告:哪些信息最重要?

Vincenzo Luigi Bruno, Alessandro Giagnorio, Daniele Bifolco, Leon Wienges, Massimiliano Di Penta, Gabriele Bavota

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究软件开发中为软件修复代理编写错误报告的问题,通过对错误报告分类标注,用三个LLM主干运行mini-swe-agent,拟合回归模型,发现定位线索和建议修复等信息对代理成功更重要,传统对人类有用的信息作用较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-07-13 cs.CL cs.AI 新提交 79%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 34 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 78%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08952 2026-07-13 cs.HC 新提交 78%

Micro-level AI Feedback Features and Student Responses in Consecutive LLM Tutoring Interactions

连续大语言模型辅导交互中的微观层面人工智能反馈特征与学生反应

Shayla Sharmin, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究自然辅导场景下连续用户与AI交互中反馈特征与学生反应的关系,聚焦具体阐述、情感语言和回复长度三个微观特征,通过数据分析发现具体阐述有助于学生理解,凸显跨交互检查反馈的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新 78%

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :prompting(title,abstract)

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09076 2026-07-13 cs.CV 版本更新 78%

ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图

Tianchen Deng, Yanbo Wang, Yejia Liu, Chenpeng Su, Jingchuan Wang, Danwei Wang, Shao-Yuan Lo, Weidong Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对大规模城市场景中快速移动对象建模及相机自我运动处理难题,提出ProSGNeRF,通过渐进式场景图网络架构学习局部场景表示,利用基础模型网络编码潜码并引入频率调制模块,提升视图合成等能力。

Comments Accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09510 2026-07-13 cs.SE cs.AI 新提交 77%

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

失败作为一个过程:CLI编码代理轨迹剖析

Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究CLI编码代理失败轨迹,引入面向过程框架,收集并标注大量执行轨迹,发现失败多由认知错误驱动,起始于最初几步且常隐藏,提出提高编码代理可靠性需早期验证和干预,而非仅靠最终结果评估。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12920 2026-07-13 cs.MA cs.AI cs.CL 版本更新 73%

Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue

通过对话对齐世界模型实现具身多智能体协调

Vardhan Dongre, Dilek Hakkani-Tür

机构 * Siebel School of Computing & Data Science(计算机与数据科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过对话机制探索具身智能体的世界模型对齐,发现对话能减少冲突但降低任务成功率,提出评估世界模型对齐的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09197 2026-07-13 cs.MA 新提交 71%

When is Routing Meaningful? Diversity and Robustness in Language Model Societies

路由何时有意义?语言模型社会中的多样性和鲁棒性

Fantine Huot, Michael Kaisers, Mirella Lapata

专题命中 评测与基准 :language model(title)

AI总结 研究多模型系统路由策略何时有意义,通过适应分层社会熵并引入基于扰动的度量来诊断失败模式,应用于EmbedLLM和RouterBench,发现HSE收益递减,KNN路由器扰动下鲁棒性差,提示路由稳定,揭示准确性与意义可能背离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08885 2026-07-13 cs.SE 新提交 71%

Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions

程序员是大型语言模型生成断言的糟糕且过度自信的评判者

Zhanna Kaufman, Yuriy Brun, Adithya Murali, Madeline Endres

专题命中 评测与基准 :LLM(title)

AI总结 研究程序员评估大型语言模型生成断言的能力,通过实验发现程序员判断正确断言较准,判断错误断言较差,自然语言解释未带来整体益处,凸显帮助开发者评估机器生成可靠性工件的重要性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09654 2026-07-13 cs.CV cs.AI 新提交 70%

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

十年视觉语言人工智能模型中准确性和视觉认知错误的演变

Shravan Murlidaran, Miguel P. Eckstein

机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系) Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系) Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究十年间视觉语言模型进展,引入CSB数据集,评估模型在其上及MS-COCO样本中的准确性与视觉认知错误类型,发现MLLM消除简单与复杂场景描述准确性差距,几乎消除多数错误类型,为模型发展提供全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16515 2026-07-13 cs.CV cs.CR cs.LG 70%

Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations

精打细算,却愚弄像素:通过视觉对抗扰动在多模态智能体中绕过价格限制

Jiachen Qian, Zhaolu Kang

机构 * City University of Hong Kong(香港城市大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究发现多模态大语言模型在价格受限环境下易受视觉误导,提出PriceBlind攻击框架,通过语义解耦损失提升图像嵌入精度,实现80%的攻击成功率,并展示鲁棒编码和防御机制对攻击的抑制效果。

Comments 15 pages, 4 figures, 13 tables

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 16059-16073, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01480 2026-07-13 cs.AI physics.comp-ph 版本更新 70%

A Self-Evolving Agentic Framework for Metasurface Inverse Design

一种自演化代理框架用于超材料逆向设计

Yi Huang, Bowen Zheng, Yunxi Dong, Hong Tang, Huan Zhao, S. M. Rakibul Hasan Shawon, Hualiang Zhang

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自演化代理框架,通过上下文级技能进化解决超材料逆向设计中工作流构建的难题,提升任务成功率并减少尝试次数,实现可重用的求解器专业知识积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22313 2026-07-13 cs.LG 版本更新 70%

Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment

触发式对齐:黑盒评估无法保证更新后对齐

Yavuz Bakman, Duygu Nur Yaldiz, Eleni Triantafillou, Peter Kairouz, Salman Avestimehr, Sai Praneeth Karimireddy

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型更新后对齐问题,指出静态黑盒评估有局限,无法保证更新后对齐,通过理论分析和多领域实证验证,揭示模型隐藏对抗行为及与模型规模的关系,强调更新后鲁棒对齐评估的迫切性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 62%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09230 2026-07-13 q-fin.TR cs.LG 新提交 57%

When Does Order Flow Matter? State-Dependent L2 Liquidity-State Transitions in Crypto Futures

订单流何时重要?加密期货中依赖状态的 L2 流动性状态转换

Joohyoung Jeon

机构 * Korea University(韩国大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究 2023 年至 2026 年币安加密期货,定义离散 L2 流动性状态转换任务,用事件聚类验证等评估模型。发现事件前 L2 流动性状态是重要预测信号,订单流在 L2 状态模型上分层才有价值,且不同符号表现不同,提出状态优先设计原则及评估协议。

Comments 8 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09456 2026-07-13 cs.LG 新提交 57%

Active rejection enables reliable generalization of universal machine-learning interatomic potentials

主动拒绝可实现通用机器学习原子间势的可靠泛化

Mingxiang Luo, Xinnan Mao, Lu Wang, Lei Bai, Feng Ding, Yuqiang Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Suzhou Laboratory(苏州实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 研究针对通用机器学习原子间势训练数据集受限问题,提出自适应多教师路由方法,通过校准预训练教师、估计结构-教师对可靠性来生成伪标签,提升模型性能和动力学鲁棒性,有效构建高保真uMLIPs数据系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09114 2026-07-13 cs.CV cs.AI cs.MM 新提交 57%

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

基于事件流的多模态视频异常检测:一个基准数据集和算法

Peipei Zhu, Yueqing Niu, Lin Zhu, Guanchong Niu, Yang Yu, Zheng Li

机构 * College of Pharmaceutical Engineering of Traditional Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学中药制药工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) State Key Laboratory of Component-based Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学组分中药国家重点实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 该研究针对视频异常检测在复杂条件下的局限性,提出EVAD框架,利用事件相机与传统视频。构建大规模基准数据集,设计对比多模态预训练框架及自适应融合模块,实验验证了该方法在现实场景中检测VAD的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 50%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 评测与基准 :language model(abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09628 2026-07-13 cs.HC 新提交 50%

Indirect and Direct AI Scaffolding for Computational Problem Posing: A Pilot Experience Report

用于计算问题提出的间接和直接人工智能支架:初步经验报告

Shayla Sharmin, Mohammad Fahim Abrar, Mohammad Al-Ratrout, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(abstract)

AI总结 该报告介绍两个大语言模型驱动的支架系统,用于支持不同计算场景的问题提出。系统用布鲁姆分类法评估问题,输出方式有间接(引导性问题)和直接(示例)两种。研究表明二者互补,先间接后直接能促进反思与改进,为计算课堂整合此类支架提供策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09161 2026-07-13 cs.SE 新提交 50%

Evaluating Semantic and Quality-Aware Retrieval for Source Code Repositories

评估源代码库的语义和质量感知检索

Marek Horváth, Emília Pietriková

专题命中 评测与基准 :LLM(abstract)

AI总结 研究针对自然语言查询的源代码库检索问题,结合函数级碎片化、文本和代码嵌入等技术及多种检索模式构建原型系统,用C代码语料库评估,发现语义检索总体最强,自动路由表现良好,质量元数据对特定查询有用。

详情

展开后加载摘要…

URL PDF HTML 收藏