Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review
审查代码,而非故事:代码优先同行评审的愿景与协议
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。
Comments 17 pages, vision and protocol paper
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
审查代码,而非故事:代码优先同行评审的愿景与协议
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。
Comments 17 pages, vision and protocol paper
再试一次,不要回头:小型代码模型中盲重采样优于自我修复
专题命中 软件智能体 :分类 cs.AI、cs.LG、cs.SE;agent(comments)
AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。
Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent
LoopVSR:用于自动修复视觉语音识别推理流水线的循环工程框架
专题命中 软件智能体 :agent(abstract)
AI总结 LoopVSR是一种循环工程框架,可让代码智能体结合端到端执行证据自动修复VSR推理流水线,在CMLR VSR系统上的表现远优于静态防护,可实现100%平均修复率。
关注上下文:通过环境-社会解耦实现社会适配机器人动作的持续学习
机构 * Utrecht University(乌得勒支大学) ; University of Cambridge(剑桥大学)
专题命中 软件智能体 :agent(abstract)
AI总结 该研究针对社交机器人在多样上下文场景下的持续学习问题,提出EDD框架解耦环境与社会知识,缓解遗忘,性能优于现有基线,相关代码已公开。
Comments Extended version of the paper accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
预取器为何失效?让智能体来解答
专题命中 软件智能体 :agent(abstract)
AI总结 该研究提出智能体驱动的自动研究流程构建预取器混合模型MoP,在SPEC CPU2006/2017上实现61.1%几何平均IPC加速,超越多款人工设计预取器,为硬件预取器设计提供新路径。
IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译
专题命中 软件智能体 :agent(abstract)
AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。
Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)
未知动力学下有限时域连续时间逆LQR的联合可识别性与条件约束
专题命中 软件智能体 :agent(abstract)
AI总结 本文针对未知动力学的有限时域连续时间逆LQR问题,利用时变最优增益的内生激励建立联合可识别性条件,开发感知条件的采样数据重构方法,通过数值实验验证了理论与条件指数的诊断价值。
权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习
专题命中 软件智能体 :agent(abstract)
AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。
Comments 9 pages, 4 figures, and 3 tables
Γ-鲁棒多选背包问题的 simultaneous 组-包络界
专题命中 软件智能体 :planning(abstract)
AI总结 本文针对Γ-鲁棒多选背包问题,提出 simultaneous 组-包络界方法,可同时界定阈值族,大幅加速松弛求解,在实验中实现2.37倍几何平均加速。
Comments 19 pages, 2 figures. Code and reproducibility materials: https://github.com/eric939/simultaneous-group-envelope-mckp
MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试
专题命中 软件智能体 :workflow(abstract)
AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。
凸障碍物周围平滑最小时间轨迹的双凸优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of California Santa Barbara(加州大学圣巴巴拉分校)
专题命中 软件智能体 :planning(abstract)
AI总结 本研究提出一种双凸优化方法,用于凸障碍物周围的最小时间运动规划,可保证收敛、支持任意阶导数约束,实验表明其轨迹质量高、鲁棒性强且计算效率与现有方法相当。
Comments 18 pages, 9 figures, 4 tables. Submitted to IEEE Transactions on Robotics. Project page: https://wernerpe.github.io/bmtp-website/ Code: https://github.com/wernerpe/pybmtp
BoilerSketch:面向CS1/早期CS2的TA监督、以图表为核心的生成式AI结构化图表实践
专题命中 软件智能体 :workflow(abstract)
AI总结 BoilerSketch是面向CS1/早期CS2的TA监督式生成式AI实践,通过双面板交互模型生成结构化Mermaid图表,经21名教学人员评估,三分之二认为其对概念理解和支持任务有中等以上帮助,为入门计算课程提供了实用AI支持方案。
Comments 9 pages, 3 tables, 3 figures
HeteroPROPMT:一种实时且隐私保护的异构协同感知框架
机构 * Michigan State University(密歇根州立大学)
专题命中 软件智能体 :agent(abstract)
AI总结 HeteroPROPMT是一种实时隐私保护异构协同感知框架,通过模块化提示与轻量调优对齐异构智能体特征,在OPV2V-H等数据集上性能优于现有方法,且参数效率高、隐私性好。
Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 9 pages, 4 figures, 5 tables
太阳邻域种群研究的概率框架:应用于SDSS-V和盖亚
专题命中 软件智能体 :planning(abstract)
AI总结 该研究针对SDSS-V太阳邻域普查样本选择效应问题,提出概率框架及正向建模方法,通过模拟数据集验证,利用盖亚数据发布19的数据展示其科学效用,公开代码为未来研究提供重要工具。
Comments 23 pages, 8 figures
从天文到星际:具有能量守恒自引力的高阶可微(磁)流体动力学
专题命中 软件智能体 :agentic(abstract)
AI总结 介绍用Python/JAX编写的可微(磁)流体动力学模拟器astronomix,利用自动微分实现逆建模等,在单GPU运行时表现良好且可扩展,还提出新自引力方案及相关智能技术提升性能。
拒绝并非安全!评估大语言模型驱动的内容幽默化中的潜在安全风险
专题命中 软件智能体 :agent(abstract)
AI总结 研究基于LLM的内容幽默化潜在安全风险,提出HumorSafe框架评估风险传播,发现LLMs幽默化时会引入刻板印象和毒性,还提出HumorPIA攻击,揭示现有LLM安全评估在幽默化设置下的差距。
ViCo3D:利用视觉基础模型增强基于激光雷达的协作式3D目标检测
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 软件智能体 :agent(abstract)
AI总结 研究针对V2X系统中基于激光雷达协作式3D感知的不足,提出ViCo3D框架。通过将点云投影为图像让VFM提取特征,引入融合模块及跨智能体融合策略,实现了先进的3D检测性能,提升了协作增益。
基于大语言模型的程序推理何时正确?基于大语言模型的代码推理的补全语义
专题命中 软件智能体 :workflow(abstract)
AI总结 研究基于大语言模型的程序推理何时正确,引入补全语义,将不完整程序形式化,定义存在性推理正确性。以见证生成工作流程实例化方法,在真实任务上评估,能区分合理与不合理推理,为验证不完整程序推理提供实用机制。
Comments 28 pages, 4 figures, 3 tables
通过编码代理实现基于契约的行为树合成
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 软件智能体 :agent(abstract)
AI总结 研究从自然语言合成机器人行为树时基础设定易出现的问题,提出基于契约的合成架构,编码代理查询服务器获取契约后合成行为树,经实验评估两个大语言模型,结果显示该架构能实现高验证率和成功率,且可转移到物理硬件。
Comments IEEE RA-L Submission
卡尔达诺的伏尔泰治理:完整规范与研究计划
专题命中 软件智能体 :agent(abstract)
AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。
最优输电切换的强化学习与优化方法比较研究
专题命中 软件智能体 :agent(abstract)
AI总结 研究最优输电切换问题,比较强化学习框架与基于混合整数线性规划的优化方法,通过在IEEE RTS-96 24节点系统上的案例研究发现,强化学习智能体在低预算下能产生接近最优解,生成可行解速度比优化求解器快两到三个数量级。
D-SafeMPC:基于离散时间控制障碍函数的扩散驱动安全模型预测控制
机构 * Paderborn University(帕德博恩大学) ; Illinois Institute of Technology(伊利诺伊理工学院) ; California Institute of Technology(加州理工学院) ; Technical University of Munich(慕尼黑工业大学)
专题命中 软件智能体 :planning(abstract)
AI总结 研究针对扩散模型用于机器人规划时无法保证安全和动态约束的问题,提出D-SafeMPC方法,通过控制障碍函数等引导扩散过程,结合迭代投影方案,经实验验证该方法能提升安全性、任务成功率和规划效率。
AcadGIS:一个用于生成可重现、适合发表的学术地图的单导入Python包
专题命中 软件智能体 :workflow(abstract)
AI总结 研究针对学术地图制作流程零散的问题,提出AcadGIS这个免费开源Python包,它能在一个命名空间下从高级命令创建面向发表的研究地图,通过三个用例展示其可将常见地图表示为紧凑脚本,解决了可访问性和可重复性问题。
Comments 19 pages, 8 figures, 2 tables, and 6 code listings. AcadGIS v0.2.0: https://github.com/riponcm/AcadGIS/releases/tag/v0.2.0
观测质量至关重要:通过面向失败的分析实现鲁棒多鱼眼相机校准
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 软件智能体 :workflow(abstract)
AI总结 研究多鱼眼相机校准难题,通过面向失败分析发现内参初始化是主因,提出CO - Calib框架,结合鲁棒目标检测器和误差分析引导帧选择器,实验表明该框架提升校准成功率、外参精度及校准稳定性。
Comments 9 pages, 7 figures, 6 tables. Code: https://github.com/HKUST-Aerial-Robotics/CO-Calib
HETERQA:多异构源记录检索基准测试
专题命中 软件智能体 :agentic(abstract)
AI总结 研究新兴系统中多异构源记录检索问题,构建含857个问答对的HETERQA基准,采用答案驱动方式,经多步操作生成,验证基准并评估多种检索器,为异构源记录检索提供有效测试平台。
Comments 20 pages, 10 figures
Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞
专题命中 软件智能体 :agentic(abstract)
AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。
联邦主权传输协议 (FSTP):无需披露的可验证协调
专题命中 软件智能体 :agent(abstract)
AI总结 提出联邦主权传输协议 (FSTP),通过编译时类型系统强制数据隔离、上下文无关身份模型和基于Blocklace的事件日志,实现无需暴露内部数据的可验证联邦协调。
Comments 26 pages, 4 figures, 3 tables. Reference implementation in Rust (fstp-core). Protocol specification and code to be linked from GitHub release v0.1.0 upon announcement
调试作为证据驱动的推理:数据密集型编程中的可视化机会
专题命中 软件智能体 :workflow(abstract)
AI总结 通过半结构化访谈揭示数据密集型调试中的三个跨领域挑战,并转化为可视化设计需求,为未来研究奠定基础。
Comments 5 pages, 1 figure, submitted to IEEE VIS conference
基于硬件安全门控的LLM编写原生ARTIQ控制代码系统在离子阱平台上的应用
专题命中 软件智能体 :agent(abstract)
AI总结 提出一种硬件安全门控系统,通过令牌授权机制确保LLM代理在离子阱实验中安全自主地编写和执行控制代码,并在实验中验证了其有效性和可移植性。
Comments 15 pages, 5 figures
通过形式理论的视角解读MLIR中的AI模型编译
专题命中 软件智能体 :agent(abstract)
AI总结 本文通过形式理论(如项重写系统、精化演算、抽象解释)对应MLIR的匹配-重写引擎、阶段降低和范围分析,论证形式概念有助于明确抽象完备性、理想设计及实际权衡。