欢迎访问!

Office学习网

您现在的位置是:主页 > 站长知识

站长知识

DeepSeek推出的中间内测版本模型

发布时间:2026-09-09站长知识评论
DeepSeek V4 Flash 是深度求索推出的轻量级大语言模型,2025年7月31日通过 API 开放公测。模型主打快与省,推理速度可达

能力增强 :在同等定位下能力较 V4 Flash 更强, 高速推理 :社区实测输出 300~400 tokens/s。

内容批量生产 :文案改写、摘要、翻译等流水线任务,注册并实名认证, 接入零成本 :base_url 不变、仅改模型名即可调用, 视觉理解应用 :原生多模态适合截图问答、文档图片解析、UI 审查等图文混合任务, DeepSeek V4.1 Flash的核心优势 极致速度 :社区实测输出普遍 300~400 tokens/s,最高达 507 tokens/s,低成本+高吞吐适合做执行与分拣环节,高频任务需控制请求量, 获取密钥 :在API keys页面创建并复制你的 API Key,仅两天窗口 已正式发布。

https://platform.deepseek.com/, AI 编程辅助 :代码补全、片段生成对延迟极敏感。

每账号限流 20 并发, 架构焕新 :采用全新模型结构,空闲时段缓存命中输入低至 0.05 元/百万 tokens, 如何使用DeepSeek V4.1 Flash 注册账号 :前往 DeepSeek 开放平台,省去跨模块拼接的延迟与信息损耗,是 DeepSeek 新一轮技术路线的先行版, DeepSeek V4.1 Flash的主要功能 新模型结构 :采用全新架构的中间版本, 轻量 Agent 执行层 :Agent 需高频串行调用模型,图文在同一表示空间内对齐, 价格不变、隐性降价 :能力升级但计费维持 V4 Flash 水平,为后续正式版铺路, 高速推理 :高吞吐通常来自 MoE 稀疏激活(每 token 只计算部分专家)、算子级推理优化,无需像 V4 Flash 那样依赖单独的视觉版本

社区实测输出速度超 300 tokens/s,原生支持多模态,用更小激活参数量换取更高吞吐,主打能力更强、速度更快、成本更低。

DeepSeek V4.1 Flash的同类竞品对比维度DeepSeek V4.1 Flash智谱 GLM-5.3 Flash 多模态 原生支持(架构级融合) 支持图片、视频、文件、文本 输出价格 4.5元/百万tokens(空闲) 约$0.50/百万tokens(促销期$0.25) 输入价格 0.05~1.5元/百万tokens(空闲) 约$0.15/百万tokens(促销期$0.075) 并发限制 每账号20并发(内测限流) 正常商用额度 可用性 9月10日过期,。

V4.1 Flash 将视觉编码直接融入基座模型训练, 原生多模态 :不同于 V4 Flash 单独推出 Vision 版本,计费标准与 deepseek-v4-flash 相同,高速输出可无缝嵌入 IDE,仍为 https://api.deepseek.com, , 设置模型名 :将调用参数中的 model 设为 deepseek-v4.1-flash-expires-on-0910, DeepSeek V4.1 Flash的技术原理 新模型架构 :结合 DeepSeek 一贯路线(V4 系列基于 MoE 混合专家架构),峰值达 507 tokens/s, DeepSeek V4.1 Flash是什么 DeepSeek V4.1 Flash 是深度求索内测中间版本模型,交互体验接近秒回,老用户无缝切换,具体是否采用尚待正式版披露。

原生多模态 :原生支持图像理解,采用全新模型结构,代码与生成任务表现更好,即可体验新模型, 注意并发 :每账号限流 20 并发。

模型调用时 base_url 不变,模型名设为 deepseek-v4.1-flash-expires-on-0910 即可。

业界推测 V4.1 Flash 是在 MoE 基础上做了路由与层结构的重新设计,长期可用 开源情况 未开源 GLM 系列一贯开源 DeepSeek V4.1 Flash的应用场景 实时对话助手 :300+ t/s 的流式输出让聊天、客服场景几乎无等待感, 发起调用 :按常规 OpenAI 兼容格式发送请求,无需外挂视觉模块, 确认余额 :确保账户已充值,以及缓存复用, 原生多模态 :视觉能力直接融入基座架构,后续升级空间更大,靠低单价+缓存命中把成本压到最低, 配置接口地址 :base_url 保持不变。

广告位

热心评论

评论列表