资讯
DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了
📋总体概括
DeepSeek V4.1 Flash上线,跑分重回国产一哥! 而且这次,是完全重新训练的 非对称模型 新架构。 552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称, 输入激活只有8B,输出激活16B。 这种架构成本显著低于已知的同尺寸模型,难怪这两天测试感觉速度飞快,原来不光是因为用的人少。 这次重新预训练、用了新的数据、
⚡关键信息
- ▸DeepSeek V4.1 Flash上线,跑分重回国产一哥!
- ▸而且这次,是完全重新训练的 非对称模型 新架构。
- ▸552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称, 输入激活只有
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →