A Scalable Approach to Evaluating Moral Sensitivity in LLMs
一种评估大语言模型道德敏感性的可扩展方法
专题命中 推理评测 :reasoning(abstract)
AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。
Comments 9 pages, 3 figures, preprint
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
一种评估大语言模型道德敏感性的可扩展方法
专题命中 推理评测 :reasoning(abstract)
AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。
Comments 9 pages, 3 figures, preprint
GRCD:用于多发现胸部X光对的地面区域变化检测
机构 * Department of Computer Science(计算机科学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。
编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理
专题命中 推理评测 :reasoning(abstract)
AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。
大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战
专题命中 推理评测 :reasoning(abstract)
AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。
OmniPresent:从科学论文生成连贯的演示文稿套件
专题命中 推理评测 :planning(abstract)
AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。
Comments In progress
用于电信网络故障排除的单 GPU 上的边缘可部署大语言模型微调
专题命中 推理评测 :reasoning(abstract)
AI总结 研究电信边缘站点大语言模型微调,用Unsloth框架进行GPU分析,系统分析多因素对训练稳定性和资源效率的影响,给出推理与非推理模型不同行为,为电信边缘环境LLM微调提供配置指南。
Comments 6 pages, 2 figures, 5 tables
SWE-Manager:编码前选择并合成黄金方案
专题命中 推理评测 :reasoning(abstract)
AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。
IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化
机构 * Sun Yat-sen University(中山大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。
Comments Accepted by ECCV 2026
VKnowU:评估多模态语言模型中的视觉知识理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; City University of Hong Kong(香港城市大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。
Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU
Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。
Comments 9 pages, 6 figures
面向科学传播中图表-图像连贯性锚定的多模态推理类型学
机构 * New Jersey Institute of Technology(新泽西理工学院) ; Brooklyn College(布鲁克林学院)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本研究提出R1-R5多模态推理类型学,刻画科学文献中图表、图像与文本的协同推理缺口,可系统识别连贯性锚定状态,缩小不同人群解读科学结论的认知差距。
Oyster-II:大语言模型中用于建设性安全对齐的强化学习
机构 * Alibaba AAIG(阿里巴巴人工智能全球研究院)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 研究大语言模型安全等问题,指出传统策略不足。基于Oyster-I范式,提出Oyster-II框架,采用强化学习结合零强化学习范式,在多基准测试中安全维度表现出色。
SPORK:自我推测性分叉以加速智能体大语言模型推理
机构 * Tsinghua University(清华大学) ; Meituan(美团)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。
Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork
从‘思考’到‘证明’:将高风险可解释性与专业沟通标准对齐
机构 * William & Mary(威廉玛丽学院) ; Anytime AI
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出‘结果->证明’方法,通过结构化可解释性框架SEF提升系统输出的可验证性与可靠性,在三个领域四个任务中验证了该方法的有效性。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 24628-24637
快手总结注意力技术报告
机构 * Kuaishou(快手)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。
Comments update related works
为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究
机构 * Sage.is AI-UI(Sage.is人工智能用户界面)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。
Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings
一种用于副作用感知药物重新设计的先例引导协同科学家
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出PRECEDE用于副作用感知药物重新设计,将重新设计视为基于证据的推理,由LLM编排,定位为人监督的科学工作流,可审核、证伪且受先前药理学限制。
Comments Accepted at the ICML 2026 Workshop on AI for Science
通过轨迹自蒸馏实现少步扩散语言模型
机构 * Rutgers University(罗格斯大学) ; Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。
对大语言模型有限元认知能力的证据
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出评估大语言模型元认知能力的新方法,发现前沿模型在事实和推理问题上的自信心评估和预测能力有限,且与人类存在显著差异。
Comments 26 pages, 25 figures
Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026
学习何时关注:为长上下文LLM的条件记忆访问
机构 * Department of Electrical and Computer Engineering, Purdue University, USA(电子工程系,普渡大学,美国)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出L2A方法,通过条件性长程记忆访问提升长上下文LLM性能,使Qwen 2.5和Qwen 3模型的有效上下文长度从32K扩展到128K,同时提升训练效率并减少内存消耗。
Comments 26 pages, 11 Tables, 18 Figures. Accepted at ICML 2026
用于消除大语言模型认知熵的滚动系数的海维赛德连续性
机构 * North-West University, RSA(南非北开普大学) ; University of Pretoria, RSA(南非彼得里亚大学) ; Mankind Research Labs, Sandton(沙顿人类研究实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。
Comments A First draft
不要单独提交:扩散大语言模型中的联合令牌提交
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Zhongguancun Academy(中关村科学城)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 研究扩散大语言模型中多令牌提交问题,提出CoCommit方法,通过标记门控协调步骤延迟提交,重新应用骨干网络最后n层使标记位置协调,近似联合模式解码,提高推理和精确答案任务准确率。
嵌入投影的可扩展语义引导
机构 * Virginia Tech(弗吉尼亚理工学院) ; Department of Defense(国防部) ; Tulane University(路易斯安那州立大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。
Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures
用于恶意Python包检测的基于大语言模型增强的分层异构图表示学习
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 提出用于恶意Python包检测的LLM增强分层异构图表示学习框架,构建分层异构代码图,利用LLMs推理功能语义角色,开发分层异构图神经网络并结合功能级归因机制,实验表明该框架性能优越。
DELTAVID:利用跨视频差异增强细粒度时空感知
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Kuaishou Technology(快手科技)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究针对视频多模态大语言模型缺乏精确局部时空感知问题,提出DELTAVID框架,将跨视频找差异转化为可训练感知信号,还引入相关数据集,提升了跨视频差异理解性能并能迁移到通用视频理解基准。
OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)
机构 * OpenAI
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。
Comments 20 pages, 3 figures, 12 tables
关于用于进化优化的大语言模型的系统综述:从建模到求解
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该综述聚焦进化优化,通过工作流框架系统回顾相关进展,将文献分为优化建模与求解两阶段,求解阶段再分三类范式,分析方法、局限性及与传统方法关系,还给出基准、比较及应用,并指出研究方向。
CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 其他推理 :reasoning(abstract)
AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。
Comments 16 pages, 6 figures
通过智能大语言模型实现语义感知和自我改进的程序简化
专题命中 其他推理 :reasoning(abstract)
AI总结 研究将程序简化作为由智能大语言模型驱动的自主推理任务,方法是让模型分析语义、提出假设并迭代改进,还能提炼经验,PROJ框架实现该方法,实验表明其优于现有技术。
双自适应SAM3:基于低秩专家层的分层路由用于参数高效的医学图像分割
机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学) ; Imperial Global Singapore (IGS), Imperial College London(伦敦帝国理工学院新加坡帝国全球(IGS))
专题命中 其他推理 :reasoning(abstract)
AI总结 提出双自适应SAM3框架,通过任务感知的动态专家路由器和参数感知的分解参数化专家设计,兼顾分割精度与参数效率,在医学图像分割上有高表现。
Comments Accepted by MICCAI 2026