DeepSeek 发布 V4 开源模型系列:1.6T 参数与 MIT 许可

Gate News 消息,4 月 24 日——DeepSeek 已在 MIT 许可下发布 V4 系列开源模型,权重现已在 Hugging Face 和 ModelScope 上提供。该系列包含两个专家混合 (MoE) 模型:V4-Pro 总参数 1.6 万亿,按每个 token 激活 49 亿;以及 V4-Flash 总参数 2840 亿,按每个 token 激活 130 亿。两者都支持 100 万 token 的上下文窗口。

该架构包含三项关键升级:一种混合注意力机制,结合压缩稀疏注意力 (CSA) 和高度压缩注意力 (HCA),从而显著降低长上下文开销——V4-Pro 在 1M 上下文下的推理 FLOPs 仅为 V3.2 的 27%,用于在推理过程中存储历史信息的 KV 缓存 (VRAM) 仅为 V3.2 的 10%;用流形约束超连接 (mHC) 替代传统残差连接,以增强跨层信号传播稳定性;以及 Muon 优化器以实现更快的训练收敛。预训练使用了超过 32 万亿 tokens 的数据。

后训练采用两阶段方法:首先通过监督微调 (SFT) 和 GRPO 强化学习训练领域特定专家,然后通过在线蒸馏将它们合并为单一模型。V4-Pro-Max (最高推理模式) 声称是最强的开源模型,拥有顶级代码基准,并在推理和智能体任务上显著缩小了与闭源前沿模型的差距。V4-Flash-Max 在算力充足的情况下实现了 Pro 级推理性能,但在纯知识和复杂智能体任务上受限于参数规模。权重以混合 FP4+FP8 精度存储。

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة من مصادر خارجية ولا تمثل آراء أو مواقف Gate. المحتوى المعروض في هذه الصفحة هو لأغراض مرجعية فقط ولا يشكّل أي نصيحة مالية أو استثمارية أو قانونية. لا تضمن Gate دقة أو اكتمال المعلومات، ولا تتحمّل أي مسؤولية عن أي خسائر ناتجة عن استخدام هذه المعلومات. تنطوي الاستثمارات في الأصول الافتراضية على مخاطر عالية وتخضع لتقلبات سعرية كبيرة. قد تخسر كامل رأس المال المستثمر. يرجى فهم المخاطر ذات الصلة فهمًا كاملًا واتخاذ قرارات مدروسة بناءً على وضعك المالي وقدرتك على تحمّل المخاطر. للتفاصيل، يرجى الرجوع إلى إخلاء المسؤولية.

مقالات ذات صلة

DeepSeek V4 在 Putnam-2025 上取得满分成绩,与 Axiom 在形式化数学推理中并列第一

Gate News 消息,4 月 24 日——DeepSeek V4 已发布来自形式化数学推理评测的结果,在 Putnam-2025 上取得满分 120/120,与 Axiom 并列第一。 在使用 LeanExplore 与受约束采样的实践模式中,V4-Flash-Max 在 Putnam-200 Pass@8 基准测试中得分 81.00

GateNewsمنذ 8 د

ما هي أفضل تقنية ذكاء اصطناعي لإظهار المكانة والهوية؟ تكشف الأبحاث أن دخل مستخدمي Claude يتجاوز دخل منافسيه بكثير، وMeta AI تأتي في ذيل القائمة

أظهرت دراسة Epoch AI أن مستخدمي Claude هم في الغالب من الفئات ذات الدخل المرتفع، حيث تبلغ نسبة 80% من إجمالي الدخل السنوي أكثر من 100,000 دولار أمريكي؛ وتوزيع دخل Meta AI هو الأوسع نطاقًا، إذ أن 36.5% لديهم دخل يتجاوز 100,000، وتُعد نسبة ذوي الدخل المنخفض الأعلى؛ وقد يؤدي ارتفاع سعر Claude واعتماد تسعير مُقسّم إلى زيادة التكاليف، بينما يكون الدخول إلى Meta أسهل. أي نوع من الذكاء الاصطناعي قد يصبح في المستقبل وسمًا ضمنيًا للهوية.

ChainNewsAbmediaمنذ 13 د

V4-Pro在内部自用(dogfooding)测试中实现67%的代码通过率,逼近Opus 4.5性能

Gate News 消息,4月24日——V4已公开披露其V4-Pro模型的内部自用(dogfooding)数据。该公司从50多名工程师处收集了约200项真实世界的工程任务,涵盖功能开发、缺陷修复、重构以及诊断,遍及包括

GateNewsمنذ 28 د

تراقب المملكة المتحدة شركة أنثروبيك للذكاء الاصطناعي لتعزيز أمن سيبراني القطاع المصرفي

تستكشف المملكة المتحدة خطوة كبيرة في الأمن السيبراني المالي من خلال العمل مع شركة الذكاء الاصطناعي Anthropic. تشير المناقشات المبكرة إلى أن الحكومة قد تنشر نموذج Claude Mythos المتقدم من Anthropic عبر البنوك والمؤسسات المالية. تهدف هذه الخطوة إلى تحسين الدفاعات في مواجهة التهديدات السيبرانية

CryptometerIoمنذ 32 د

中国知识产权办公室将AI、半导体和脑机接口纳入加速保护计划

Gate 新闻消息,4月24日——中国国家知识产权局在4月24日宣布,将通过制度改革、优化服务以及扩大应用,针对新兴技术建立全面的知识产权保护体系。该局将优化专利审查政策

GateNewsمنذ 39 د
تعليق
0/400
لا توجد تعليقات