芜湖家具封边胶厂 实测 DeepSeek V4 Pro 正式版:能力直逼 Fable 5,还藏了个大招

 178     |      2026-08-14 12:15:25
保温护角专用胶

盼星星,盼月亮,我们等来了七月初的月光——

就在今天凌晨,DeepSeek 官网毫预兆地新,DeepSeek V4 Pro 0813 正式登场。依据惯例,需手动调整,现在 API 接入的 deepseek-v4-pro 就会是新模型。

此外,DeepSeek API 使用与 OpenAI/Anthropic 兼容的 API 格式,简单粘贴 API Key,就能在 Codex、Claude Code 和 OpenCode 等三工具中将 DeepSeek 作为后端模型使用。

令人稍显宽心的是,虽然已经通过提前预告的式给用户们了很久「API 即将涨价」的预针,新到 0813 版本后的 DeepSeek V4 Pro 目前依然没有涨价。每百万 token 输入(缓存未命中)与输出的定价分别是 3 元和 6 元,和预览版保持致,也正好是 DeepSeek V4 Flash 的三倍。

事不宜迟,这就来看看在预览版发布的 111 天后,终于问世的 DeepSeek V4 Pro 正式版带来了哪些变化。

Agent 能力,终于支棱起来了

不同于往常偏好在白天流量时段发布新模型,DeepSeek 这次的凌晨新显得有些仓促,看似官网只来得及修改模型参数介绍、API 使用指南等少数文档页,连这回的新日志都还没端上来。进步的新解读,可能要留待今日白天。

但考虑到 V4 Pro 正式版发布的时间只比 7 月 31 日新的 V4 Flash 正式版晚了不到半个月,我们可以有很大把握相信,二者共享了相近的优化思路(如果不是相同的话)。

所以,直接看 V4 Flash 正式版的新日志来 V4 Pro 的变化也未尝不可。

DeepSeek V4 Flash 0731 新日志里引人注目的信息,莫过于官宣称其基模与预览版在模型结构、尺寸上都保持致,仅仅重新进行了后训练,但针对的后训练也确实使得「Agent 能力大幅增强,基准测试远 V4-Pro-Preview」 。

如果今晚的 V4 Pro 正式版也是如此,那我们可以预期观察到它在 Agent 能力上的突飞猛进。

目前网上流传的批跑分结果,很大程度上印证了这预期。在这些与 Agent 强相关的评测集中,V4 Pro 的表现比起预览版可谓突飞猛进,在些项目中接近甚至越了目前的能标杆 Fable 5:

代表 DeepSeek 自软件工程基准的 DeepSWE 从 12.8 分飙升至 62.7 分;代表 DeepSeek 全栈开发基准困难子集的 DSBench-Hard 分数翻了倍多,达到 67.2 分;通过自然语言从生成代码仓库的 NL2Repo 从 38.5 分提至 61.5 分   ……

也就是说,同个 API 名称,昨天基本还不会做的活儿,今天就可以跟全球梯队的代码 Agent 掰掰手腕了。

当然了,有 KIMI K3 珠玉在前,即使是新后的 DeepSeek V4 Pro 正式版也还没坐上开源界的头把交椅(些测试上与 K3 有轻微差距);但众所周知,DeepSeek 的思路向是:

比我强的没我便宜,比我便宜的没我强。

在补上了 Agent 能力短板后,我们的大鲸鱼,再次维护了这圣秩序。

为了好地理解 V4 Pro 的能力,我们把它接入了 Workbuddy,做了些简单的 Agent 任务实测,看看它会交出怎样的结果。

5 个实测案例,自主规划

个任务很简单:接入我的微信读书 Skill,用读取到的数据做个简单的数据报表。利用 Skills 来工作,本来就是 Agent 能力的日常体现。

这点当然难不倒 DeepSeek,令人惊喜的是,它还主动阅读了我此前因为其他工作而放在文件库里的范儿设计规范 Skill,给阅读报告也配上了我们的属配。

接下来两个是网页设计任务:

(1)搜集近日科技新闻芜湖家具封边胶厂,以 THE IFANR POST 为标题,制作个仿照传统新闻媒体的网站页,PVC管道管件粘结胶并为头条制作张的渲染配图;

(2)制作个现代化的设计风格展示网站,展示简、斯堪的纳维亚、新拟物等多种设计风格的 Bento 卡片。

因为时间所限,我没有详细地撰写提示词规定各种约束和指条件,可以说是相当模糊的任务指令。但就结果而言,V4 Pro 都完成得非常好——

在构建新闻页的任务上,它找到了过去几天我们在选题会上讨论过的真实新闻,模仿传统媒体格调的版式设计和衬线字体也非常对味,还「手绘」了张看着很像样的配图。

构思设计风格展示网站时,V4 Pro 「自作主张」地用上了 .style 的网站名称后缀和渐变标题,各种设计风格示例卡片也大体正确,整体来看精致灵动。

将模糊指令重新梳理为清晰需求,并根据这需求自主规划、分步完成项目,DeepSeek V4 Pro 正式版的智能程度可见斑。

至于复杂的交互式实例,V4 Pro 也展现出了不俗实力:

个是基础的俄罗斯块游戏,块的绘制显然相当精美,带有点小小的伪 3D 果。

另个案例则是从我读书记录中的《随椋鸟飞行》中获取灵感,制作了个显示简单规则如何涌现出复杂秩序的「椋鸟群模拟器」,动画果令人惊艳。

为什么是模型来「获取灵感」?那是因为在布置后面几个任务时,我只跟模型说了「我要去睡觉」,要以什么向来构思示例、又应该以何种式来实现,都是 DeepSeek 自己在掂量。

你看,只要模型足够聪明,当媒体老师也不用真的熬夜追热点—— AI Agent 能够自行替我解决大多数问题。

还有个「隐藏大招」

话说回来,DeepSeek V4 Pro 正式版的发布当然是件大事,但如果把时间拉长来看,它可能只是另件大事的前奏。

如果仔细阅读此前官网关于 V4 Flash 正式版的新公告,会发现里面隐藏着条关键信息:

对于公开基准测试集中的 Code Agent 任务,正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 简模式(即将发布)作为框架进行测试,并使用 max 档位,topp=0.95,temperature=1.0

没错,DeepSeek Harness 要来了。

近两年,AI 工程的研究者们逐渐形成了个共识:随着各 AI 模型在理能力上接近天花板,未来真正决定 AI Agent 能力的将不会是底层模型,而是 Harness(运行框架)。

如果说 LLM 是个数字员工的大脑,那 Harness 就是它的办公系统,负责给它分配权限与任务、调取工具、审批流程、检查结果、保存日志等工作。

没有好的运行框架,再强的智能也从发挥,甚或是会让 AI 成为失去管控的脱缰野马。反过来说,套足够好的 Harness,能让平庸的员工发挥出 200 的实力。

如今,随着 V4 Pro 正式版问世,未来 DeepSeek AI Agent 系统的模型部分已到位。那么,Harness 是不是已经准备好了呢?

答案显然是肯定的。论是此前 DeepSeek 招聘 Harness 研发工程师的新闻,还是前天注册「DeepSeek Harness 团队」公众号,切证据都指向:

短至数天、长至数月之内,DeepSeek Harness 就将与我们见面。

或许,新的 DeepSeek 时刻不会太远。相关词条:铝皮保温     隔热条设备     钢绞线厂家玻璃棉    泡沫板橡塑板专用胶

奥力斯    万能胶生产厂家    联系人:王经理    手机:13903175735(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定芜湖家具封边胶厂,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。