
Meta重返开放量级AI模型领域,推出了新模型《Muse Glimmer》,该模型能在单个消费级GPU内运行,并且响应查询速度极快。
Meta通过蒸馏技术让《Muse Glimmer》适配单个消费级GPU,同时配合一个小型伴随模型来加快响应时间。
《Muse Glimmer》是一个30亿参数的开放量级模型,目标是与谷歌的《Gemma 4》和阿里巴巴的《Qwen 3.6》竞争。
Meta的《Muse Glimmer》有两个突出特点。其一,运行一个30亿参数的全精度模型需要大约60GB内存来存储模型权重。Meta采用量化技术,即通过蒸馏一个更大的模型(Muse Spark)来训练一个更小的模型,赋予它许多能力,将其压缩以减少模型权重的内存需求至20GB。
其二,为了加快令牌生成(响应时间),《Muse Glimmer》使用了一个小型伴随模型——DFlash草稿模型——来预测整块文本,允许《Muse Glimmer》一次性检查答案,保留正确的文本响应同时丢弃错误的。
由于检查答案比生成答案要快得多,这种设计使得在RTX 5090卡上的响应速度提高了3.1倍,在M5 Max上提高了1.8倍,在M4 Max上提高了1.5倍,这是Meta披露的数据。
《Muse Glimmer》的推出对于西方开放量级AI模型格局来说时机非常恰当。根据OpenRouter的数据,中国的LLMs最近首次超过了每周34.25万亿个令牌的水平,DeepSeek的V4 Flash记录了惊人的570%的周增长率。

Meta推出《Muse Glimmer》AI模型,能在单个GPU上运行并快速响应,挑战谷歌和阿里巴巴的AI模型。
关键词:AI、Meta、Muse Glimmer
来源:Wccftech
发布时间:2026-08-11T01:52:48+08:00
0
0