Kolibri 开放 78B MoE 权重与 vLLM 部署插件
Aleph Alpha 宣布 Kolibri 模型开放完整权重,采用 Apache 2.0 许可。该模型为总参数 78B、激活参数约 3B 的混合专家架构,支持推理与工具调用,上下文上限达 1M tokens。自部...
Aleph Alpha 宣布 Kolibri 模型开放完整权重,采用 Apache 2.0 许可。该模型为混合专家(MoE)架构,总参数 78B,激活参数约 3B,支持推理与工具调用。
上下文上限为 1M tokens,但默认服务配置仅为 256K。需要完整上下文的部署必须显式调整相关配置,模型本身不提供替代推理路径。自部署还必须使用配套的 vLLM 插件,增加集成与适配工作量。
对工程团队而言,部署链路涉及插件接入、版本兼容性和参数配置等多个环节。上线前应针对显存占用、吞吐量和输出正确率进行实测,尤其在长上下文场景下,内存与计算开销会随序列长度显著变化。
工具调用能力进一步提高了部署复杂度。除了模型推理本身,还需测试工具调用链路的稳定性,包括参数解析、外部调用失败处理和重试机制是否可靠,这对生产环境尤为关键。
MoE 架构通过仅激活约 3B 参数,在一定程度上平衡模型容量与推理成本。不过,官方未披露具体硬件要求、推荐显存规格或量化方案,也未说明安装渠道和支持语言范围。
信息缺口意味着在正式采用前,技术团队需要通过实际部署验证是否满足自身业务场景。工具调用和长上下文能力在真实任务中的表现,仍需通过实测来判断。

