Naive-N0.5-Flash 开源编码模型发布
Naive-N0.5-Flash 采用 309B MoE 架构、15.5B 激活参数,原生支持百万 token 上下文,权重与推理代码以 MIT 许可开放。配套 NaiveRT 报告八 GPU 单流峰值解码,但明确...
Naive-N0.5-Flash 正式公布,这是一款面向编码和 AI 研发的开放模型,采用 309B 总参数、15.5B 激活参数的 MoE 架构。模型原生支持百万 token 上下文,权重和推理代码均以 MIT 许可开放,允许开发人员直接集成并进行二次开发。
从定位看,该模型主要针对长期代码理解、跨文件检索和复杂 AI 研发工作流。百万 token 上下文意味着单次推理可以覆盖大型代码库或多轮长程任务,但 MoE 架构在推理时仍需根据路由激活部分专家,实际显存占用和资源需求需要结合部署环境自行评估。
配套的 NaiveRT 报告了在八 GPU 环境下的单流峰值解码结果。需要强调的是,这一数据只反映单条请求在峰值条件下的解码表现,不能等同于常规并发部署的吞吐指标。开发者在做容量规划时,应针对实际工作负载重新进行基准测试。
工程上,MIT 许可降低了集成门槛,但权重获取渠道、训练数据细节、八 GPU 环境的具体硬件配置以及推理框架的适配情况尚未在现有材料中披露。百万 token 上下文对推理框架的内存管理和 KV 缓存策略也提出了更高要求,部署前可能需要额外的内核优化或长上下文支持验证。
API 供应方面,当前信息不足以确认公开访问的时间、方式或定价。团队若计划依赖远程接口,应等待官方进一步明确开放状态,避免提前绑定未确认的服务。