IntrinTrans: LLM-based Intrinsic Code Translator for RISC-V Vector
IntrinTrans: 基于大语言模型的RISC-V向量内在函数翻译器
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文提出IntrinTrans,利用大语言模型和编译反馈自动翻译跨架构内在函数,并通过寄存器使用信息优化生成代码,实验证明其性能接近原生实现。
Comments 6 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
IntrinTrans: 基于大语言模型的RISC-V向量内在函数翻译器
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文提出IntrinTrans,利用大语言模型和编译反馈自动翻译跨架构内在函数,并通过寄存器使用信息优化生成代码,实验证明其性能接近原生实现。
Comments 6 pages
SkillSight:通过共享描述实现准确技能检索
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型智能体技能检索问题,提出SkillSight框架,通过语义和词汇空间校准共享背景,减少偏差,实验证明该方法能提升检索指标,在端到端评估中表现出色且速度快,实现准确高效的技能选择。
Comments 9 pages, 4 figures
条件 regime 验证:安全分类器适配与监控的正确性估计
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。
Comments 16 pages including technical appendix, 6 figures
基于缩放假设的无标签智能体学习控制器能力评估
机构 * Georgian
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。
Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)
勿宣称面向基准的优化可提升通用编码能力——需要多样化评估
专题命中 评测与基准 :foundation model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 该研究指出少量编码基准的优化无法提升通用编码能力,通过案例研究验证了基准排名难泛化、跨任务迁移差等问题,呼吁采用差异化评估与持续基准维护。
Comments Accepted to the DL4Code workshop @ ICLR2026
信息满意度:面向读者的摘要评估轴
机构 * St. Edward’s University(圣爱德华大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本研究提出以读者的信息满意度作为摘要评估的面向读者的轴,发现主流摘要指标无法衡量该满意度,且与人工判断一致性差。
体育领域的大模型综述
机构 * Renmin University of China(中国人民大学) ; Sichuan University(四川大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。
Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026
Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。
基于幅值型专家掩码的混合专家模型的深度感知敏感性分析
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过在XLCoST基准上对Qwen3.6-35B-A3B模型的逐层敏感性分析,发现MoE层敏感性具深度依赖性,提出聚焦晚期层的掩码策略,可在保留输出质量的同时减少专家数量,为MoE模型压缩提供了实证基础与实用路径。
日式儿童谜语作为机器洞察与元认知的基准
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究通过日本儿童谜语构建基准,揭示机器在洞察推理和元认知控制方面的不足,为提升AI的自我评估能力提供新方向。
STINER:从X平台自动提取战略网络威胁情报
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对社交媒体CTI提取难题,提出STINER分类体系与语料库,经测试DarkBERT等领域适配编码器表现最优,还利用STINER-DarkBERT完成了2025年上半年欧洲威胁态势分析。
Comments Accepted at RAID 2026 (29th International Symposium on Research in Attacks, Intrusions and Defenses)
破坏模型以测试评判器:面向领域类图语义评估器的变异测试方法
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究针对领域类图语义评估器,提出一种变异测试方法,通过注入语义缺陷生成变体并评估评判器检测缺陷的能力,其结果与人工评估基本一致,可作为语义评判器分析的可扩展替代方案。
Comments Paper accepted at the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)
LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。
Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy
注定要反复标注:ImageNet的故事
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文针对ImageNet-1k数据集的标签噪声问题,构建ReImageNet数据集,采用人机协作反复优化的标注流程,使模型准确率显著提升,相关资源已公开。
Comments 25 pages, 16 figures, 8 tables. Project page: this https URL (https://vrg.fel.cvut.cz/reimagenet)
超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。
Comments Preprint. Code available at this https URL (https://github.com/MorrisYUJQ/DFT-GEN)
HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准
专题命中 评测与基准 :language model(abstract);prompting(abstract)
AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。
Comments 18 pages, 8 figures
无数据?不问题:为更好的入侵检测合成安全图
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出PROVSYN框架,通过合成异构图结构和文本属性,提升入侵检测的鲁棒性,实验显示其在五维评估中表现优于基线模型,有效缓解数据不平衡问题。
CVT-Bench:反事实视角变换揭示多模态大语言模型中不稳定的空间表征
机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯杜大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 CVT-Bench通过控制诊断基准评估多模态大语言模型在反事实视角变换下的关系一致性,发现尽管单视角准确率高,但系统在反事实视角变换下存在系统性退化,揭示了表征结构对反事实空间推理的重要性。
Comments Reframed CVT-Bench around spatial-state integrity, added real-world benchmark derived from 3dSGG, context controls and other minor changes. 21 pages, 10 figures, 15 tables. Project page: this https URL (https://shanmukha-here.github.io/CVT-Bench)
全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) ; School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。
GALA:面向文本到时间序列合成的生成感知跨模态对齐
专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.LG
AI总结 本研究针对文本到时间序列合成中条件表示与信号模态不匹配的问题,提出GALA两阶段跨模态对齐方法,在TSFragment-600K数据集上实现SOTA,打破了生成器内部文本编码器的保真度与贴合度权衡。
Comments 21 pages, 6 figures
AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地
机构 * The University of Tokyo(东京大学) ; National Institute for Materials Science(国立材料科学研究所) ; RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)
专题命中 评测与基准 :language model(abstract);分类 cs.LG
AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。
AlignFace:具有可解释概念关系的人类对齐人脸相似度度量
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。
Comments 10 pages, 10 figures, 2 tables, ACM MM 26
模型无关的检索增强扩展预测用于时间序列
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 该研究提出模型无关的RAEF方法,通过改进检索与聚合机制提升时间序列预测性能,其效果优于RAF,兼具高效性与竞争力,可替代微调用于时间序列预测的领域适配。
Comments 6 pages, 1 figure
AI研究偏好模型
机构 * FAIR at Meta ; University of Oxford(牛津大学) ; University College London(伦敦大学学院)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 该研究针对AI研究智能体的候选方案评估成本过高问题,提出AI研究偏好模型,将其集成到AIRA-dojo智能体后提升了基准任务性能,且达到目标性能的时间更短、预算更少。
Comments 34 pages, 17 figures, 6 tables
生成无奖励的评判标准以减少智能体评估中的过度打分
机构 * Trinity College Dublin(都柏林三一学院) ; University College Dublin(都柏林大学学院) ; Dublin City University(都柏林城市大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。
“我的名字有很多”:通过稀疏自编码器剖析助手及其角色设定
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 本研究借助稀疏自编码器剖析语言模型对说话者的内部表征,发现助手与角色扮演角色特征核心相关,故事角色则无,且可通过沉浸式模拟模式区分三者,助手有时会漂移至该模式。
Comments 38 pages, 9 tables, 4 figures, 2 listings
SportD:视觉语言模型能进行物理策略制定吗?
机构 * Princeton University(普林斯顿大学) ; Rice University(莱斯大学) ; UC Irvine(加州大学欧文分校) ; POSTECH(浦项科技大学) ; NYU Shanghai(纽约大学上海分校) ; UC Santa Barbara(加州大学圣塔芭芭拉分校) ; Zhejiang University(浙江大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。
重新定义视觉域中的泛化:基于FusionDetect的假图像检测双轴框架
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI
AI总结 该研究针对假图像检测的跨生成器与跨视觉域泛化挑战,推出OmniGen基准,提出基于CLIP和Dinov2的FusionDetect方法,其在多基准上实现最优性能并提升了OmniGen上的准确率。
Comments Project code: this http URL (http://github.com/amir-aman/FusionDetect)
ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。
P2Skill:面向云-本地大语言模型推理系统的隐私保护技能蒸馏
专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract);language model(abstract);small language model(abstract)
AI总结 针对云-本地LLM推理系统的P2Skill,通过技能提示实现本地SLM自主处理PII相关操作,无需隐私微调,在四领域基准上的隐私保护推理质量较基线提升1.69倍、3.66倍。