Qwen3.8-Omni-Flash 发布:多模态输入与百万上下文
阿里云上线 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入,最高提供 1M 上下文,可通过 Chat Completions 或 Responses 接入函数调用与联网检索,适合多媒体分析、会...
TechFoco
共 7 篇文章,按时间倒序展示。
阿里云上线 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入,最高提供 1M 上下文,可通过 Chat Completions 或 Responses 接入函数调用与联网检索,适合多媒体分析、会...
智谱 GLM Coding Plan 于 9 月 3 日至 20 日推出夜间畅用活动,每晚 23 点至次日 9 点按北京时间自动生效,覆盖所有付费套餐用户。错峰时段调用 GLM-5.3-Flash,在 ZCode...
World Labs 发布 Atlas,据称是全球首个多模态世界模型,可生成图像和视频帧,支持像素级相机控制并重建为 3D,用于建模世界、移动镜头和模拟时空。官方尚未披露模型规模、许可证、API 与部署方式。
GLM-OCR 将 OCR 全流程整合为单一工具,提供从布局分析到文本识别的完整文档理解方案。在 OmniDocBench V1.5 基准测试中得分 94.62,排名第一。支持复杂表格、公式、代码识别,仅 0.9B...

FullFront 是一个针对多模态大语言模型的前端工程基准测试平台,覆盖设计、理解与代码生成三大核心任务,并提供包含图像渲染与多维度指标分析的自动化评估流水线。

本文介绍由 Docling 团队开发的 SmolDocling-256M-preview 模型。该模型专为文档转换设计,支持全页内容识别与快速推理,并能与 Docling 生态系统兼容。

Omni OCR Benchmark 是一个开源基准测试工具,旨在系统评估多模态模型在 OCR 和数据提取任务上的性能。它支持主流模型,并提供 JSON 准确率与文本相似度等关键指标。
