Generated, Parallel, Scalable? A Study of Agentic AI-Generated Julia Code on Supercomputers
生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract)
AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract)
AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。
Position: 模块化记忆是持续学习智能体的关键
机构 * University of Bremen(不莱梅大学) ; Seoul National University(首尔国立大学) ; Computer Vision Center Barcelona(巴塞罗那计算机视觉中心) ; University of Florence(佛罗伦萨大学) ; Microsoft Research(微软研究院) ; HEC Montreal, Mila--Quebec AI Institute, Canada CIFAR AI Chair(蒙特利尔HEC学院、魁北克人工智能研究所、加拿大CIFAR人工智能 chair) ; Bielefeld University(比勒海姆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Rochester(罗切斯特大学) ; University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) ; Nankai University(南开大学) ; LUISS University(卢西亚诺大学) ; Stony Brook University(石溪大学) ; University of Tübingen(图宾根大学) ; University of Trento, FBK(特伦托大学,FBK) ; Tsinghua University(清华大学) ; University of Groningen(Groningen大学)
专题命中 长上下文与记忆 :foundation model(abstract,comments);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过模块化记忆结合权重内学习与上下文学习,解决持续学习中的灾难性遗忘问题,实现大规模持续适应。
Comments ICML 2026 Position Track Spotlight. This work stems from discussions held at the Dagstuhl seminar on Continual Learning in the Era of Foundation Models (October 2025)
AnchorKV: 通过拒绝锚点的软惩罚实现安全感知的KV缓存压缩
机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) ; Department of Electrical and Computer Engineering, Tufts University(塔夫茨大学电气与计算机工程系)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出AnchorKV,一种通过软惩罚机制调整令牌保留分数以远离有害提示的KV缓存压缩方法,在保持实用性的同时显著提升安全性。
LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流
机构 * IEEE
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。
打破自回归诅咒:动态认知熵编排的可擦除强化学习用于大语言模型
机构 * SenseTime(商汤科技) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出动态认知熵编排的可擦除强化学习(E³RL),通过将模型内生的局部自回归交叉熵作为认知不确定性坐标,利用分段自适应动态阈值和优势分配精准切除逻辑缺陷并重用KV缓存,解决长序列推理中的自回归级联崩溃问题。
SpecGen: 利用推测生成加速智能体内核优化
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)
AI总结 针对智能体内核优化中生成延迟长、反馈不足和资源利用率低的问题,提出SpecGen系统,通过推测生成在推理过程中提前产生候选内核,并行验证剖析,动态调整资源,并利用远程KV缓存减少前缀重计算,显著降低端到端时间并提升内核加速比。
扩散变换器中的注意力 sinks:一种因果分析
机构 * Department of Computer Science, Tulane University, New Orleans, LA, USA(路易斯安那州新奥尔良大学计算机科学系)
专题命中 长上下文与记忆 :language model(abstract,abstract_cn)
AI总结 研究探讨了扩散变换器中注意力 sinks 的作用,通过动态识别并抑制注意力接收者,发现其对文本-图像对齐和偏好代理影响有限,但强干预下出现特定边界。
变宽Transformer
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL
AI总结 提出一种中间窄、两端宽的变宽Transformer架构,通过无参数残差缩放机制实现非均匀容量分配,在语言模型困惑度、FLOPs和KV缓存上优于均匀宽度基线。
EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆
机构 * HKUST(GZ)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; Xi’an Jiaotong University(西安交通大学) ; XGRIDS(深圳格物智联)
专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI
AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。
VL-MemKnG:结合时空知识图谱的混合记忆用于长程自我中心导航轨迹问答
机构 * Mobile Robotics Laboratory, Artificial Intelligence Center(移动机器人实验室,人工智能中心) ; Skoltech(斯科尔科沃科学技术学院) ; Intelligent Multimodal Vision Analysis Group, Department of Engineering, Universitat Pompeu Fabra(智能多模态视觉分析组,工程系,庞培法布拉大学) ; Independent Researcher(独立研究员)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 提出VL-MemKnG混合记忆框架,结合时空知识图谱与片段级上下文记忆,通过混合检索推理模块提升长程自我中心视频导航问答的准确性和效率。
STEP-LLM: 通过大型语言模型生成CAD STEP模型
机构 * Northwestern University(西北大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文提出STEP-LLM,通过大型语言模型将自然语言转化为CAD STEP模型,采用图结构预处理和强化学习提升几何精度,验证了LLM驱动的STEP模型生成可行性。
Comments Accepted to the Design, Automation & Test in Europe Conference (DATE) 2026
Journal ref In Proceedings of the 2026 Design, Automation & Test in Europe Conference (DATE 2026), 2026
从受训者到训练者:用于多智能体推理的LLM设计的强化学习训练环境
机构 * LARK, HKUST (GZ)(香港科技大学(广州)LARK实验室) ; University of Cambridge(剑桥大学) ; HKUST(香港科技大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出LLM-as-Environment-Engineer框架,让策略模型自动分析失败轨迹并修改训练环境配置,在MAPF-FrozenLake测试平台上用Qwen3-4B实现最优性能。
DiffAttn: 基于扩散的驾驶员视觉注意力预测与LLM增强语义推理
机构 * School of vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; Beijing Key Laboratory of Human-Computer Interaction, Institute of Software, Chinese Academy of Sciences(北京人机交互重点实验室,中国科学院软件研究所) ; Remote Sensing and Earth Observation Laboratory, University of Copenhagen(远程感知与地球观测实验室,哥本哈根大学) ; California PATH, University of California, Berkeley(加州PATH,加州大学伯克利分校)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出DiffAttn框架,将驾驶员视觉注意力预测建模为条件扩散去噪过程,结合Swin Transformer、特征融合金字塔和LLM增强语义推理,在四个数据集上达到最先进性能。
通过结构不确定性量化LLM逻辑推理中的一致性
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI
AI总结 提出结构不确定性框架,通过自偏好排序的稳定性评估LLM推理一致性,在逻辑和数学任务中与答案分散度互补,提升不可靠实例识别。
Comments Published at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. Accepted as best paper
提取语义:从URDF自动构建机器人本体的LLM引导方法
机构 * LAAS-CNRS, Department of Robotics, Toulouse, France(法国图卢兹机器人系CNRS实验室)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出利用大语言模型从URDF文件自动生成机器人语义本体,通过多数投票和语法验证确保与现有本体对齐,初步实验表明该方法能有效桥接低层描述与高层知识表示。
Journal ref 18th International Conference on Social Robotics (ICSR 2026), University of London, Jul 2026, Londres, United Kingdom
从盾牌到靶心:针对基于LLM的智能体护栏的拒绝服务攻击
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 本文揭示基于LLM的护栏易受拒绝服务攻击,通过束搜索优化框架和机制感知结构变异生成恶意负载,导致令牌放大13-63倍、延迟放大148倍,威胁系统可用性。
基于LLM的多智能体系统实现自动化加密货币投资组合管理
机构 * University College London(伦敦大学学院) ; Nanyang Technological University(南洋理工大学) ; Exponential Science(指数科学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一个三智能体系统(市场、新闻、交易),通过分层、协作和辩论架构融合多模态信号,在2025年回测中实现133.52%累计收益和1.502夏普比率,优于单智能体和深度学习基线。
LLM 能当 CEO 吗?基于多角色智能体模拟的战略资源重新配置基准测试
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Yale University(耶鲁大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出 CEO-Bench,一个多智能体基准,评估 LLM 在约束丰富的组织环境中进行多轮战略资源重新配置的能力,发现模型在结构有效性上表现良好,但在战略校准上存在系统性失败模式。
Comments 13 pages
WEQA: 可穿戴健康问答中的查询自适应智能推理
机构 * University of Cambridge(剑桥大学) ; Tsinghua University(清华大学) ; University College London(伦敦大学学院) ; Dartmouth College(达特茅斯学院) ; Google Research(谷歌研究院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(abstract);foundation model(abstract);pretraining(abstract)
AI总结 提出WEQA框架,通过LLM控制器动态组合传感器分析与预训练模型,实现可穿戴健康数据问答,在基准测试中准确率提升24%,专家评估显示实用性和临床合理性显著提高。
解锁大语言模型代码修正的迭代反馈循环
机构 * Iowa State University(爱荷华州立大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。
Comments 22 pages, 14th Computing Conference 2026
从酝酿到解析:追踪LLM中代码推理的内部生命周期
机构 * South China University of Technology(华南理工大学) ; Sun Yat-sen University(中山大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Hangzhou Dianzi University(杭州电子科技大学) ; Guangzhou College of Technology and Business(广州工商学院)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.AI
AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。
自适应激活引导:通过闭环PID控制实现高效LLM推理
机构 * Independent Researcher(独立研究者)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 提出PID-steering方法,利用PID控制器根据块级冗余分类器动态调整激活引导强度,在减少推理开销的同时提升准确率。
视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Algoverse AI Research(Algoverse AI研究) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。
Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe
使用大型视觉语言模型审核不安全的用户生成内容游戏中的非法在线图像推广
机构 * University at Buffalo(布法罗大学) ; Northeastern University(东北大学) ; Clemson University(克莱姆森大学) ; The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 针对社交媒体上非法推广不安全UGC游戏的图像,提出UGCG-Guard系统,利用大型视觉语言模型和条件提示策略实现零样本域适应,检测准确率达94%。
Comments In Proceedings of the 33rd USENIX Conference on Security Symposium (SEC '24), August 14-16, 2024
你的模型多样性,而非方法,决定推理策略
机构 * UIUC(伊利诺伊大学香槟分校) ; Capital One
专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。
Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning
ParkingTransformer: 基于大语言模型增强的端到端自主泊车轨迹规划
机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) ; School of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) ; College of Transportation, Shandong University of Science and Technology(山东科技大学交通学院) ; National University of Defense Technology(国防科技大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ParkingTransformer框架,利用多视角感知和大语言模型场景理解能力,结合轨迹查询与隐状态特征,直接输出规划轨迹,无需密集BEV表示,通过3D位置编码、固定窗口流机制和粗到细解码策略提升性能,在CARLA和实车实验中验证有效性。
EmoFSM:一种用于情感支持对话的有限状态机
机构 * Geely AI Lab(吉利人工智能实验室)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。
Comments 15 pages, 4 figures. PAKDD 2026
上下文感知与关系感知的图检索增强生成统一框架
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Finvolution Group(信也科技集团)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出HyGRAG分层图RAG框架,通过构建融合上下文与关系的摘要、跨层级检索及动态更新,将多跳推理准确率提升9.7%。
Comments Accepted at The ACM Web Conference 2026 (WWW '26)
一种面向策略逻辑的策略综合的神经符号方法
机构 * University of Naples Federico II(那不勒斯费德里科二世大学) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) ; Università degli Studi di Salerno(萨勒诺大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种神经符号框架,将大语言模型作为策略生成预言机,结合模型检查器进行形式验证,在NatATL中实现高精度策略综合。
DecoSearch: 面向Text-to-SQL的复杂度感知路由与计划级修复
机构 * Florida International University(佛罗里达国际大学) ; NEC-Labs(NEC实验室) ; Singapore Management University(新加坡管理大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出DecoSearch框架,通过复杂度感知路由将查询分配给直接生成或DAG分解,并结合拓扑精炼器修复执行失败,在BIRD和Spider上取得高准确率且显著降低token消耗。