LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests
LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。
LLMs能否感知情绪?通过提示、检索和课程学习进行情绪识别
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出PRC-Emo框架,结合提示工程、示范检索和课程学习,探索LLM在对话中感知情绪的能力,实验表明在IEMOCAP和MELD数据集上达到新的SOTA性能。
Comments Accepted at AAAI 2026
Journal ref Proc. AAAI Conf. on Artificial Intelligence, Vol. 40, No. 38, pp. 31778-31786 (2026)
跨语言注意力蒸馏与基于个性引导的生成增强用于多语言个性识别
机构 * Universiti Tunku Abdul Rahman(拉曼大学) ; Kanagawa Institute of Technology(神奈川工科大学) ; Université Sorbonne Paris Nord(索邦巴黎北大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 本文提出ADAM方法,通过跨语言注意力蒸馏和基于个性引导的生成增强,提升多语言个性识别性能,实验表明CLAD在多种语言和个性特征上均优于标准BCE模型。
Comments IEEE Transactions on Cognitive and Developmental Systems (2026)
AlphaCast:一种用于交互式时间序列预测的人类智慧-大语言模型智能协同推理框架
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 AlphaCast提出一种交互驱动的代理推理框架,利用无训练大语言模型实现准确的时间序列预测,通过多阶段工作流整合上下文准备、基于推理的生成和反思评估,将预测转化为多轮自主交互过程。
对代码仓库的采样工作流建模
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 本文提出一种领域特定语言,用于描述复杂采样策略,以提高采样方法的可表示性和可推理性,通过统计指标验证了其在代码仓库采样中的有效性。
Journal ref MSR '26 - 23rd International Conference on Mining Software Repositories, Apr 2026, Rio de Janeiro, Brazil
XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台
机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) ; DASKALOS-APPS ; National Technical University of Athens(雅典国家技术大学) ; University of Exeter(埃克塞特大学) ; CVCOSMOS Ltd(CVCOSMOS有限公司)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。
Comments 21
指令调优的LLM用于领导型HPC系统上解析和挖掘无结构日志
机构 * Oak Ridge National Laboratory(橡树岭国家实验室) ; University of Tennessee(田纳西大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出一种基于指令调优的LLM框架,利用链式推理解析HPC日志,结合领域特定日志模板和示例对LLaMA模型进行微调,实现高精度的日志解析与挖掘,验证了其在大规模日志数据上的有效性。
多模态情感计算近期进展:自然语言处理视角
机构 * Guangdong University of Technology(广东工业大学) ; Stony Brook University(石溪大学) ; University of Bologna(博洛尼亚大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Arizona State University(亚利桑那州立大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。
CL4SE:软件工程中基于上下文学习的基准测试
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本文提出CL4SE基准测试,系统分类四种软件工程特定上下文类型,通过高质量数据集和五种主流LLM评估,展示上下文学习在代码生成、审查等任务中的性能提升。
Comments 34 pages, 4 figures
CodeWiki: 评估AI生成大规模代码库整体文档的能力
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。
Comments Accepted at ACL 2026
用于锂离子电池可扩展和准确逆参数推断的神经后验估计
机构 * Computational Science Center, National Laboratory of the Rockies(落基山国家实验室计算科学中心) ; Energy Conversion and Storage Systems Center, National Laboratory of the Rockies(落基山国家实验室能量转换与存储系统中心) ; Energy Storage Research and Analysis Department, Idaho National Laboratory(爱达荷国家实验室储能研究与分析部)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出神经后验估计方法,用于高效估计锂离子电池参数,尽管在高维情况下计算成本较高,但能提供更准确的参数校准,并在电压预测中存在误差,同时具有更高的可解释性。
NED-Tree: 通过非线性元素分解树弥合语义鸿沟以实现LLM非线性优化建模
机构 * College of System Engineering, National University of Defense Technology(国防科技大学系统工程学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出NED-Tree框架,通过句级提取策略和递归树结构解决LLM在非线性优化建模中的语义鸿沟问题,实验显示其在10个基准测试中达到72.51%的平均准确率。
Comments 17 pages, 7 figures, conference
英国人工智能安全研究所对齐评估案例研究
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI
AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。
BloClaw:面向下一代科学发现的全能多模态智能工作空间
机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) ; Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) ; First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。
当标签稀缺时:一种系统性地映射标签高效代码漏洞检测方法
专题命中 代码评测 :code model(abstract);分类 cs.SE
AI总结 本文系统性地映射了减少对人工标签依赖的代码漏洞检测方法,综合了五种范式家族及其机制,并提出了设计图和约束优先决策指南以指导实际应用。
基于图注意力网络的自闭症谱系障碍检测
机构 * Middle Tennessee State University(中田纳西州立大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出一种基于图注意力网络的检测方法,利用fMRI数据构建功能连接矩阵,通过注意力机制识别关键连接模式,提升诊断准确性,实验结果显示在测试数据上达到88.79%的平均准确率。
性别化提示与大语言模型代码审查:提示中的性别线索如何影响代码质量和评估
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 研究探讨性别化提示对代码生成和审查的影响,发现性别线索在代码质量上影响有限,但对代码审查存在系统性偏见。
FinToolSyn: 一种用于金融工具使用对话数据的前向合成框架,具有动态工具检索
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; FiT, Tencent(腾讯FiT) ; Zhejiang University(浙江大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 本文提出FinToolSyn框架,通过动态工具检索生成高质量金融对话数据,构建43,066个工具库并合成148k对话实例,提升金融场景下的工具调用能力。
Edu-Values:面向评估大型语言模型的中国教育价值观
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。
Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission
时间序列机器学习的多元宇宙:一个用于多变量时间序列分类的档案
机构 * University of Bradford(布拉德福德大学) ; University of East Anglia(东安格利亚大学) ; Université de Haute-Alsace(阿尔萨斯大学) ; Monash University(莫纳什大学) ; University of Southampton(南安普顿大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文扩展了UEA档案,增加至133个分类问题,并发布预处理数据集,更名为Multiverse档案以反映多样性。提供指导和基准评估,建立未来研究的性能标准。
GRAFITE:用于问题跟踪和评估的生成回归分析框架
机构 * IBM Research - AI(IBM人工智能研究院)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 GRAFITE通过持续评估平台追踪和评估模型问题,利用LLM作为裁判进行质量测试,支持多模型对比和回归检测。
Comments 7 pages, 2 figures
通过合成任务扩展实现AI科学家
机构 * Princeton University(普林斯顿大学) ; Microsoft Research(微软研究院)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。
通过大规模开源代理仓库挖掘实现技能自动化获取:一种多代理过程知识提取框架
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出一种多代理过程知识提取框架,通过挖掘开源仓库获取高质量代理技能,结合安全治理和评估指标实现可扩展的知识获取,提升知识转移效率40%。
ResearchGym: 在真实世界人工智能研究中评估语言模型代理
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。
Comments ICLR 2026 Agents in the Wild Workshop
FormalRTL: 在大规模上实现验证的RTL综合
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。
SPOT:一个标注的法语语料库和基准,用于检测在线对话中的关键干预
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 SPOT通过标注法语语料库和基准,检测在线对话中的关键干预,验证了监督学习在非英语社交媒体任务中的重要性。
超越端点:面向向量化的非公路网络提取的路径中心推理
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出MaGRoad,一种基于路径中心的非公路道路网络提取方法,通过构建大规模数据集和改进模型结构,在野外环境中实现了更鲁棒的道路提取。
Comments This revision improves clarity and consistency throughout the paper. We refine terminology to more precisely describe the vertex extraction optimization, add motivational context to the edge feature encoding section, and clarify the overall inference pipeline. We also add an Acknowledgments section
基于推理的图像风格化代理规划 via 离线强化学习
机构 * Adobe Research(Adobe研究)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。
Comments 85 pages
探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。
Comments Accepted at ICSA 2026
UniCoR: 代码多模态协作以实现稳健的跨语言混合代码检索
专题命中 代码评测 :code model(abstract);分类 cs.SE
AI总结 UniCoR通过多模态协作和自监督学习提升跨语言混合代码检索的语义理解和泛化能力。
Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)