Windows ML 实验性接入 GGUF 与原生推理 API
Windows ML 新增实验性 llama.cpp 集成,支持通过文本生成 API 加载 GGUF 或 ONNX 模型,并提供 OpenAI 兼容的本地端点。新的 Runtime API 预览引入显式设备放置和多...
Windows ML 新增了实验性 llama.cpp 集成,开发者可以通过文本生成 API 直接加载 GGUF 或 ONNX 格式的模型。这一变化使得 Windows 平台上的本地模型推理路径更接近常见的 llama.cpp 工作流,同时保留了对 ONNX 生态的兼容。
集成还提供了一个 OpenAI 兼容的本地端点。对于已经围绕 OpenAI 客户端 SDK 构建的工具链,这意味着可以在不大幅改动现有调用代码的情况下切换到本地推理服务。不过该端点目前属于实验性功能,支持的 API 子集尚未明确,接入时需要预留接口变更带来的维护成本。
新的 Runtime API 预览进一步加入了显式设备放置和多模型流水线能力。开发者可以指定某个模型运行在特定设备上,也可以把多个模型串联成流水线执行,这对需要混合使用 CPU、GPU 或未来 NPU 的场景提供了更细粒度的调度空间。原有 ONNX Runtime 接口继续可用,现有基于该接口的应用可以按自身节奏评估迁移。
官方建议上线前核查实验版的支持场景和设备限制。目前版本号、安装方式、依赖要求以及具体设备支持范围均未披露,因此在生产环境中启用前,应先在测试环境覆盖 GGUF/ONNX 模型加载、设备放置和多模型编排等关键路径,避免实验性行为与平台能力不匹配导致意外故障。




