Galactica: A Large Language Model for Science
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
专题命中 数学推理 :self-correction(abstract);分类 cs.CL
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
Comments 10 pages, 3 figures, 3 tables
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
Comments Accepted by the Findings of NAACL 2022
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
Comments 12 pages, three figures, invited talk at MaxEnt2020/2021, reviewed and published by Entropy
Journal ref Torsten A. Enßlin, Entropy 2022, 24, 374
专题命中 数学推理 :planning(abstract);分类 cs.AI
专题命中 数学推理 :planning(abstract);分类 cs.LG
Comments 60 pages, 19 figures, final version accepted for publication in Neural Computation
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
Comments Accepted by IEEE Transactions on Intelligent Transportation Systems
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
Comments 43 pages, lots of pictures
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
Comments 40+32 pages
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
Comments 12 pages, 1 figure, 1 table, submitted version
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
Comments 145 pages, 61 figures, 1 table. PhD thesis, National Laboratory for Scientific Computing (LNCC), Brazil, February 2015
专题命中 数学推理 :分类 cs.CL、cs.AI、cs.LG;reasoning(comments)
Comments NeurIPS'24 MATH-AI, the 4th Workshop on Mathematical Reasoning and AI
评估大语言模型在科学软件中稳定数值表达式的能力
专题命中 数学推理 :reasoning(abstract)
AI总结 本文评估大语言模型在数值稳定性任务中的表现,发现其在检测和稳定不稳定的计算方面与传统方法相当,并在某些情况下表现更优,但对控制流和高精度字面量处理较弱。
AI作为独立游戏开发中的民主化力量
专题命中 数学推理 :planning(abstract)
AI总结 该研究考察AI对2024-2026年游戏行业分化的影响,发现AI大幅降低独立游戏制作的协调成本,推动第三波民主化浪潮,披露AI的游戏接受度与传统游戏相当,但市场已呈现结构性过剩的前提条件。
MIDAL:用于无障碍学习的数学图像描述
机构 * E.K. Solutions Pvt. Ltd.(E.K.解决方案私人有限公司)
专题命中 数学推理 :reasoning(abstract)
AI总结 该研究推出含2020张多级别数学图像的MIDAL数据集,用于训练视觉语言模型生成无障碍图像描述,还可微调语言模型提升数学推理能力,助力高等教育STEM内容无障碍性建设。
密码分析基准测试:大语言模型能进行密码分析吗?
专题命中 数学推理 :reasoning(abstract)
AI总结 研究探讨大语言模型能否进行密码分析,引入包含六个密码原语家族191个任务的CryptanalysisBench基准测试,五个前沿模型在不同层级有一定破解率,不仅得出已知结果还产生新成果,发布该基准测试以追踪人工智能密码分析进展及压力测试候选方案。
Comments 46 pages, 5 figures, 4 tables
Smart-TCP:基于智能体AI的自主自适应TCP协议
专题命中 数学推理 :reasoning(abstract)
AI总结 提出Smart-TCP框架,利用大/小语言模型与算术逻辑单元协同决策,实现TCP控制逻辑的自适应,实验显示高精度与全生命周期成功率。
Comments Submitted for possible journal publication
TGMS:一种原生代理双时态图管理系统
专题命中 数学推理 :verifier(abstract)
AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。
稀疏-LaViDa:稀疏多模态离散扩散语言模型
机构 * Adobe(Adobe公司) ; UCLA(加州大学洛杉矶分校)
专题命中 数学推理 :reasoning(abstract)
AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。
Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures
SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Macau(澳门大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。
Comments 27 pages, 11 figures
ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导
专题命中 数学推理 :reasoning(abstract)
AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。
没有理解的自动化
专题命中 数学推理 :reasoning(abstract)
AI总结 探讨人工智能产出数学成果但美国削弱相关人才培养渠道这一现象,主张将数学能力视为战略资产,提出要求进行重要推理的人工智能系统以可检查形式公开关键主张,以避免战略错误。
Comments 10 pages. Comments welcome
有界峰度下的精确最坏情况尾概率
专题命中 数学推理 :reasoning(abstract)
AI总结 研究有界峰度下单边尾控制问题,通过AI引导搜索确定最坏情况尾概率的四区域映射,给出各区域表达式及证明度相图,还得到精确最坏情况分位数等。
Comments v2: fixed cross-reference names rendered incorrectly by the arXiv TeX complier and made minor edits. Code, certificates, and the full instance tables are available at https://github.com/xiaoyulics/lemmaforge
证明门与CDCL求解器的效率
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出证明门参数,用于解释CDCL求解器在电路验证中的效率,证明具有小证明门的公式有短的分辨率证明,并展示某些CDCL求解器能高效生成此类证明。
Comments version 2.1
知识增强的智能体漏洞修复
专题命中 数学推理 :reasoning(abstract)
AI总结 提出KeaRepair,一种基于智能体的自动化漏洞修复方法,通过提取历史漏洞知识并利用工具增强的智能体进行诊断,生成并迭代优化补丁,在55个C/C++漏洞上修复率达83.64%。
审计AI投资建议作为可执行行动
专题命中 数学推理 :verifier(abstract)
AI总结 提出将AI投资建议作为可执行金融行动进行审计,通过确定性基线协议评估有效性、稳定性和一致性,发现一致性单独评估具有误导性。