资讯

DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了

华尔街见闻·2026/9/10 10:49:16🔗 原文

📋总体概括

DeepSeek V4.1 Flash上线,跑分重回国产一哥! 而且这次,是完全重新训练的 非对称模型 新架构。 552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称, 输入激活只有8B,输出激活16B。 这种架构成本显著低于已知的同尺寸模型,难怪这两天测试感觉速度飞快,原来不光是因为用的人少。 这次重新预训练、用了新的数据、

关键信息

  • DeepSeek V4.1 Flash上线,跑分重回国产一哥!
  • 而且这次,是完全重新训练的 非对称模型 新架构。
  • 552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称, 输入激活只有
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文