EduGuard: A Safe RAG-Based LLM Tutor for Programming Education
EduGuard:一种用于编程教育的基于安全检索增强生成的语言模型导师
专题命中 推理评测 :verifier(abstract)
AI总结 研究针对学生使用GenAI进行编程学习时的问题,提出EduGuard安全RAG辅导框架,集成多种功能。通过构建基准测试并与强基线比较,在正确性、基础等方面表现最佳,能提升准确率并降低过度依赖,证明安全GenAI辅导需多方面保障。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
EduGuard:一种用于编程教育的基于安全检索增强生成的语言模型导师
专题命中 推理评测 :verifier(abstract)
AI总结 研究针对学生使用GenAI进行编程学习时的问题,提出EduGuard安全RAG辅导框架,集成多种功能。通过构建基准测试并与强基线比较,在正确性、基础等方面表现最佳,能提升准确率并降低过度依赖,证明安全GenAI辅导需多方面保障。
生物医学问答的自适应检索策略
专题命中 推理评测 :reasoning(abstract)
AI总结 研究生物医学问答中不同问题类型的有效检索策略,提出自适应检索框架,依问题类型选检索和证据聚合策略,结合多种技术,经实验验证该策略能提升证据相关性和答案质量,为增强相关问答系统提供有效方向。
GlobalForge:迈向强大的人工智能生成图像检测
机构 * Huazhong University of Science and Technology(华中科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Jilin University(吉林大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对AI生成图像检测器在现实世界通道传播后性能下降问题,提出GlobalForge框架,通过局部信息瓶颈和全局结构推理模块,基于退化对比结构损失联合训练,提升了检测器在多种基准上的性能。
VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。
网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估
专题命中 推理评测 :reasoning(abstract)
AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。
命名之前先理解!通过代码摘要增强基于大语言模型的方法名预测
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 研究针对方法名预测中现有评估不能反映语义质量、基于LLM的方法与人命名过程不同的问题,通过实证研究比较多种评估器及策略,提出结合摘要和细化的SMNP方法,实验证明该方法在方法名预测上有效且鲁棒。
更快的人工智能,参差不齐的前沿:快速跨越、锯齿状前沿与人类判断力的重新定位
专题命中 推理评测 :reasoning(abstract)
AI总结 研究人工智能在认知任务上快速跨越人类基线但前沿参差不齐的现象,指出人类在一些方面仍具优势,基准结果有偏差,人类将系统用作认知扩展,人机协作需重新定位人类角色,阐述了相应状况及意义。
ManiScope:基于大语言模型的加密货币操纵风险可视化分析
专题命中 推理评测 :reasoning(abstract)
AI总结 针对加密货币市场操纵风险评估问题,提出ManiScope系统,利用大语言模型辅助可视化分析,提供多方面协同视图及人机协作框架,经案例和用户研究验证,该系统能有效评估风险、减少人工并围绕假设组织发现。
DynEval:对自然环境下的文本到图像生成模型进行全面评估
机构 * Indian Institute of Science(印度科学研究所) ; Hugging Face(拥抱脸)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。
Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/
使用具有错误减少技术的大语言模型来判定静态分析警报
专题命中 推理评测 :reasoning(abstract)
AI总结 研究用大语言模型判定静态分析警报,采用一致性检查和LLM推理评估两种方法,在三个测试套件上评估多个LLMs,中级推理LLMs经错误缓解后召回率和特异性高,还探讨了相关问题及合成程序作为证据的结果。
Comments 22 pages
以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?
机构 * The University of Tokyo(东京大学) ; University of Twente(特温特大学) ; University of Bristol(布里斯托大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。
PERSONAJUDGE:使用特定评估者的示范数据模拟个体人类偏好判断
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对大语言模型作评判时忽略个体评估者差异的问题,提出结合分类判断与特定评估者辅助数据的模拟方法,经实证研究发现该方法有改进,推理痕迹作用大,还明确了模拟难度及相关属性,为个性化评估提供见解。
基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测
机构 * San Diego State University(圣地亚哥州立大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of California, Davis(加利福尼亚大学戴维斯分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。
用于法医合成媒体检测的概率人工智能模型的溯因确证
机构 * NCSC, part of GCHQ(英国国家网络安全中心(NCSC))
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对法医合成媒体检测问题,利用溯因推理确证多种方法输出以识别最可能结论,应用该方法可降低误报风险,还对OpenAI的SynthID进行实证评估及评估不同检测方法互补性。
SteelBench:真实工业环境下的视觉语言模型评估基准
机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) ; Steel Authority of India Limited(印度钢铁管理局有限公司) ; VIT Vellore(维洛尔理工学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。
用于自动驾驶的智能体驱动长尾模拟
机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) ; Bosch Research(博世研究院)
专题命中 推理评测 :planning(abstract)
AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。
迈向高效低空传感:一种用于无人机任务分配的双异构图学习方法
专题命中 推理评测 :planning(abstract)
AI总结 针对传统无人机任务分配方法难捕捉任务依赖与通信关系的问题,提出基于双异构图学习的方法,构建任务图与通信图,将分配问题转为结构匹配问题,用图注意力网络和交叉注意力机制优化匹配,提升任务完成率与效率。
知识与关怀之间:从患者和医生角度对用于2型糖尿病自我管理的生成式人工智能的混合方法评估
专题命中 推理评测 :reasoning(abstract)
AI总结 该混合方法研究从患者和医生角度评估用于2型糖尿病自我管理的生成式人工智能。通过分析患者查询、医生评分及访谈,发现模型优缺点,得出两个分析概念,为四个设计方向提供依据。
Comments arXiv admin note: text overlap with arXiv:2510.10048
一种评估大语言模型道德敏感性的可扩展方法
专题命中 推理评测 :reasoning(abstract)
AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。
Comments 9 pages, 3 figures, preprint
GRCD:用于多发现胸部X光对的地面区域变化检测
机构 * Department of Computer Science(计算机科学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。
编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理
专题命中 推理评测 :reasoning(abstract)
AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。
大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战
专题命中 推理评测 :reasoning(abstract)
AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。
OmniPresent:从科学论文生成连贯的演示文稿套件
专题命中 推理评测 :planning(abstract)
AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。
Comments In progress
用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调
专题命中 推理评测 :reasoning(abstract)
AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。
Comments 6 pages, 2 figures, 5 tables
LASER: 通过视觉注意力保持与沉没抑制为LVLMs提供矫正透镜
机构 * The University of Queensland(昆士兰大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对大型视觉语言模型在长序列解码中视觉遗忘的问题,提出LASER后训练框架,通过视觉接地奖励和沉没抑制奖励调节注意力轨迹与分布,在8个基准上超越强基线。
Comments The 19th European Conference on Computer Vision (ECCV 2026)
STRUCTSURVEY: 结构化智能检索用于自动生成综述论文
专题命中 推理评测 :reasoning(abstract)
AI总结 提出STRUCTSURVEY分层多智能体框架,通过动态构建实体、关系和主题分类的图表示,将结构推理从生成阶段转移到检索阶段,在ACL综述基准上相比嵌入检索基线平均提升ROUGE-1召回率2.9、ROUGE-2召回率1.0,且不降低精确度。
Comments 8 pages, 1 figure, appendices, SurgeLLM, RAG4Reports, ACL
所有关系通向罗马:自动化知识图谱构建与问题生成
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ARLtR框架,联合构建知识图谱、嵌入和基于事实的问答对,实现符号图与稠密检索的统一表示,并以罗马帝国历史数据集验证。
Comments 10 pages, 5 figures, version one
如其所是:将LLM搜索评估与历史用户偏好对齐
专题命中 推理评测 :reasoning(abstract)
AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。
ClarifyCodeBench: 评估大语言模型在代码生成中澄清模糊需求的能力
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ClarifyCodeBench基准,通过人工标注的模糊需求、澄清问题和指标,评估LLMs主动澄清需求的能力,发现代码生成能力与需求澄清能力脱钩,且多模糊场景下性能下降。
Imprint: 面向长程自我中心问答的在线记忆压缩
机构 * IIT, Kharagpur(印度理工学院卡哈拉格普尔分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出交互中心记忆框架Imprint,将长程自我中心记忆建模为在线压缩问题,利用人类记忆巩固信号选择性保留和压缩交互,在7天基准上提升QA准确率并大幅降低存储和检索开销。