Claude Fable 5.1 发布:1M 上下文与缓存读取降价
Claude Fable 5.1 于 2026 年 9 月 1 日发布,定位长时程智能体与复杂推理,支持 1M tokens 上下文和 128K tokens 最大输出。输入和输出价格与前代持平,分别为每百万 to...

共 28 篇文章,按时间倒序展示。
Claude Fable 5.1 于 2026 年 9 月 1 日发布,定位长时程智能体与复杂推理,支持 1M tokens 上下文和 128K tokens 最大输出。输入和输出价格与前代持平,分别为每百万 to...

OpenAI 面向企业预览 GPT-5.6 Sol UltraFast 超快模式,运行速度为标准模式的 14 倍,最高每秒生成 750 tokens,定位实时语音、客服、开发智能体、金融研究和安全响应等生产负载。企...

近期 DeepSeek 新模型动态在海外社区引发讨论,官方未提供正式发布页面,开发者已用低成本方案投票。常见做法是让 Claude 规划、DeepSeek 执行,借助上下文缓存压低推理成本。有观点认为模型能力普遍达...

传统 Compaction 虽能腾出 Token 空间,却会破坏 KV Cache 并导致响应变慢、成本上升,还易丢失编程意图。社区开始转向 Pruning 剔除低价值工具日志、/shake 转轻量引用、Snapc...

Anthropic 将 Claude Sonnet 5 的 API 优惠价转为永久定价,维持输入每百万 token 2 美元、输出 10 美元,并取消原定 9 月的涨价计划。这意味着开发者在构建长期生产系统时可获得...
深度求索计划近期整体上调 DS API 调用价格,预计涨幅较大,已提前挂出通知建议用户合理安排使用。具体价格变化尚未公布,此前该公司通常降价或提供优惠,此次涨价极为罕见。

华为在 Hugging Face 开源 openPangu-2.0-Pro,该模型为 505B 参数的 MoE 架构,基于昇腾 NPU 训练,激活参数约 18B,支持 512k 上下文。Thinking 版本在 A...

月之暗面发布全球首个开源 2.8 万亿参数模型 Kimi K3,基于 Delta Attention 与 Attention Residuals 架构,具备原生视觉能力和 100 万 token 上下文窗口。在 F...

一项针对 Gemma 4 的维吉尼亚密码破解测试显示,该模型在明确指令下可进行长时间深度推理,并在无法解决时选择诚实拒绝而非编造答案,其思维深度具有可调节特性。测试也引发了关于如何更全面评估模型原生推理能力与效率的讨论。

一项实验让Codex自主解决一个真实的机器学习研究问题。AI不仅完成了任务,还独立提出了一个文献中未见的新评估方法,揭示了任务设计、奖励黑客和参考点限制等关键教训。


本文基于 Sebastian Raschka 整理的 40 多个开源大模型架构图谱,分析了 2024 年至 2026 年间 LLM 架构的演进趋势。核心观察是设计语言趋同,但具体技术方案呈现分裂与混搭,反映出行业正...

Lossless Claw 是一个为 OpenClaw 设计的开源插件,它采用有向无环图和智能摘要技术管理对话上下文,旨在突破大语言模型的上下文窗口限制,实现消息的无损存储与高效回溯。

近期发现,用户可通过将付费文章链接提供给谷歌AI,使其通过搜索引擎特权通道获取并总结全文。当访问被阻时,上传空PDF文件再贴链接可欺骗系统成功读取。这一现象降低了绕过付费墙的技术门槛,引发了关于内容付费模式与AI伦...

Anthropic 公开指控 DeepSeek 等中国 AI 公司通过大量 API 调用对 Claude 实施“工业级蒸馏攻击”。然而,Anthropic 自身训练数据来源的版权问题同样受到质疑,事件引发了关于技术...


马斯克公开鼓励用户向 Grok 上传医疗数据以获取第二诊疗意见,此举引发对数据隐私、商业动机及用户信任的广泛讨论。核心争议在于用户主动提交的数据不受 HIPAA 等法规保护,存在被滥用风险。



Google Research 研究发现,在不启用推理模式时,将提示词原样重复一遍可显著提升大语言模型在多项基准测试中的表现,且几乎不增加计算成本。
