当前位置: 首页 » 资讯 » 科技头条 » 正文

DeepSeek Harness开启内测?看来V4正式版也不远了

IP属地 中国·北京 编辑:周伟 字母榜 时间:2026-07-29 22:09:57

从2026年3月崔添翼加入DeepSeek开始组建Harness团队到今天,憋了5个月,DeepSeek的Harness工具这回真的要来了?

一张截图在各大AI社区流传,内容是DeepSeek Harness的内部测试招募通知。

按照截图的说法,Harness计划于本周晚些时候开启内测,首批用户从小范围群组中筛选,入选者需要提交个人资料、签署《保密承诺函》,才能拿到产品访问权限。

并且截图显示,一旦泄密,不只是当次资格取消,还会影响日后DeepSeek各类模型、产品内测以及合作机会的入选。

虽然截图真伪无法验证,但结合DeepSeek此前关于V4正式版发布日期的公告,以及崔添翼曾表示Harness将和V4同时发布,那么这条传闻很有可能是真的。

然而目前市面上没有任何关于DeepSeek Harness产品形态的报道,按照DeepSeek以往的作风来看,Harness是重要产品,它的研发与设计一定是严格保密的。

不过我们还是能通过DeepSeek的各种蛛丝马迹,大致推断出这个产品大概长什么样。

01 DeepSeek Harness到底长什么样

DeepSeek Harness究竟长什么样?目前公开的信息只有两块,第一块是负责人崔添翼的量化背景,第二块是DeepSeek关于Harness部分的招聘职位描述(JD)。

先来说第一块,崔添翼不是做AI出身的。他在Jane Street做了九年的量化交易系统。

在量化交易系统里,最值钱的是执行系统。它讲究的是软件能不能在毫秒级别把策略变成交易?能不能在出了异常的时候自动恢复?能不能在每一步都留下可追溯的日志?

如果把这个思维搬到Harness上,那么其大体逻辑可能会是这样的:

量化交易里,慢一毫秒,钱就被别人赚走了。所以系统的每一步都得抠着毫秒级优化,不能有多余的步骤。

所以Agent循环的每一轮推理-执行-反馈都要快,不能有冗余开销。你跟AI说一句话,它不能半天没反应。从它想一下、到调用工具、到拿到结果、到再想下一步,整个循环必须得快。

同时,量化系统必须得非常可靠。如果量化系统崩了,那亏的是真金白银。所以哪怕行情再诡异、数据再离谱,系统本身不能挂,得能自己恢复。

模型可能会犯错,甚至输出一些离谱的东西给你,但Harness这个框架本身不能崩,得能兜住结果,想办法把模型拉回来继续干活。

其实在量化交易里,网络断了、交易所接口挂了、行情数据异常了,这些都是家常便饭。系统不能一遇到问题就死,得有重试、有备用方案、实在不行就降级,比如实时行情拿不到,就先用延迟数据顶着。

模型也是同理,调用工具失败了、文件读不出来、网络超时了,这些都是常事。好的Harness不会因为一个工具调用失败就整个任务废掉,它会自动重试、换个方法、实在不行就降级处理,继续推进任务。

另外,由于量化系统涉及大量的金钱,交易出问题了,得能查到是哪一步出错的,可能是下单的时候错了,也有可能是行情解析错了。每一步都得有日志,这样才能复盘。

Harness也一样,AI把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想错了?哪个工具调用返回了异常结果?它为什么做了那个错误的决定?

在整个量化系统里,订单状态也非常重要。不能出现“我以为下单了但其实没下”或者“重复下单”这种情况,每一步的状态都得是确定的、一致的。

放到Harness上,在所有人都押注长程任务、复杂任务的当下,能否维持模型中间的状态,将决定整个Harness的成功率。不能前面改了A文件,后面改B文件的时候把A的改动忘了。

最后是风控和安全了,量化交易有熔断机制,行情异常的时候自动停止交易,防止一个bug把钱亏光。另外,高风险的操作必须有审批,不能说下单就下单。

那么回到Harness里,在让AI删文件、格式化硬盘、跑sudo rm -rf这种高危操作之前,就必须得停下来进行确认。不能它自己想干啥就干啥,Harness得有个安全闸门。

02 从DeepSeek的JD里看产品

说完了第一块再说第二块,DeepSeek官方挂出来的岗位JD

JD里提到了KV Cache、长上下文裁剪与压缩算法,说明Harness会做智能的上下文管理。

配合DeepSeek V4的前缀缓存能力,相同上下文的任务不重复计算。长对话中自动对历史消息做摘要,保留关键信息,释放token空间。根据任务复杂度动态调整上下文策略,简单任务用短上下文省成本,复杂任务拉满百万token的长上下文。

相当于是把每一份算力都花在刀刃上,小事能省则省,大事算力拉满。

JD里还提到了向量存储方案选型、会话状态持久化与回放,这也就意味着Harness有长期记忆系统,会记住你项目的架构、编码规范、常用模式,下次打开项目自动加载。

会话持久化代表就算你关掉终端后再打开,之前的对话状态、修改记录、执行轨迹依然都在。甚至DeepSeek Harness还可能记住你的命名风格、喜欢的框架版本,跨对话记忆你的各种习惯。

JD里提到了Tool Use链式调用、错误回退与自动重试,这是指Harness有完整的工具调用编排能力,能编排多步工具调用的有向无环图。工具调用失败自动重试,重试不行就降级换方案,再不行就回滚到上一个稳定状态。

划重点,DeepSeek Harness还可能支持动态注册新工具,Agent能自动发现并学会使用。

JD里提到了多Agent间通信协议设计、任务分解与结果聚合。这说明Harness有子Agent架构,一个主Agent负责任务规划和协调,多个子Agent负责具体执行。

不同子Agent有不同的系统提示词、工具权限、上下文窗口。主Agent把复杂任务拆成子任务,分发给子Agent,再把结果聚合成最终输出。每个子Agent运行在独立上下文或进程中,互不干扰,出错了不影响主流程。

JD里还提到了任务规划图生成、执行路径在线优化。这意味着Harness有规划与自进化的能力。

规划说的是接到任务后先生成执行计划,分几步、每步用什么工具、预期产出是什么。执行过程中根据实际情况动态调整,不是死板地按原计划走。每完成一步就自我检查,不对就自动修正。

而且,DeepSeek Harness很可能有一套内部benchmark,每次架构改动都跑一遍,看是进步了还是退步了,以此实现工具的自我进化。

最有意思的一点在JD最后,DeepSeek说,要让模型与Harness共同进化,实现模型与Harness的深度适配。

这也就代表了,Harness会利用DeepSeek-V4模型的特性,比如V4的稀疏注意力、前缀缓存。它不是通用Harness 框架,而是跟DeepSeek模型深度绑定的一体化产品。

其实这也是OpenAI现在的理念。

此前。OpenAI是有两条独立的后训练线。一条是代码专用的Codex线,一条是通用推理的GPT线。到GPT-5.5的时候,两条线合并了,GPT-5.5-Codex将代码能力和通用推理能力整合进了同一个模型。

这就好比汽车,原厂就像汽车厂家自己做发动机+变速箱,知道发动机的扭矩曲线、转速特性,变速箱换挡逻辑可以精准匹配。但是如果把这事交给第三方来做,发动机对他们来说是黑盒,只能凭感觉调变速箱,这就导致永远调不到原厂那么丝滑。

03 V4正式版,跳票一个月

Harness不是一个人来的。崔添翼曾表示,V4正式版和Harness将同步发布。

4月24日,DeepSeek发布V4 Preview,Pro和Flash两个版本同步开源。两个月后,在6月29日那天,DeepSeek向API用户发送邮件,明确说V4正式版计划于7月中旬上线。结果眼瞅着要到8月了,依然没有任何关于V4正式版的消息。

曾有传闻称,由于7月24日,DeepSeek旧的API deepseek-chat和deepseek-reasoner正式退役,所以V4正式版将会同期发布。毕竟更换API接口,通常是给新版本让路的前置动作。

可V4正式版依然没有发布。只是两个旧模型名正式停用,所有调用必须换成新的deepseek-v4-flash和deepseek-v4-pro。换句话说,API接口名换了,但模型本身还是预览版那套。

那么正式版比预览版强在哪?

综合多个内测信源的说法,称V4正式版在三个方向上做了升级:

核心推理能力再上一个台阶。

日常对话的响应速度明显优化。

Agent能力针对性迭代。

有参与灰度测试的人总结,V4正式版整体表现接近Opus 4.8级别,编码能力不弱于GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同样的任务比Claude Fable 5迭代轮数还少。

不过这些说法都来自非官方渠道,DeepSeek没有公开确认。

预览版的问题其实社区里讨论得不少。V4 Preview在编程能力上和Kimi K2.7、GLM 5.1接近,但仍然逊色当前的主流模型。

尤其是在那些复杂的任务上。有测试者发现,即便要求模型“不使用外部依赖”,模型依然引用了外部CDN。

遇到真正复杂的任务,需要手动加reasoning_effort=max(推理强度最高)才能拿到更深的思考深度,但变成agent往往会忽略这个提示词,导致模型思考的强度不够。

还有一点,虽然目前DeepSeek已上线识图模式(OCR),不过DeepSeek-V4的多模态能力也是短板。

按照DeepSeek官方的说法,预览版是纯文本,正式版首次原生支持图像推理,DeepThink引擎可以在同一个思考流程中分析图片、解读截图。这变相也增加了Harness工具的压力。

以及V4正式版会加入一些企业功能,但具体如何,DeepSeek官方并没有进一步透露。

再说价格,这是争议最大的部分。

V4正式版将引入峰谷定价机制,高峰时段(北京时间9:00-12:00和14:00-18:00)API价格直接翻倍。具体来看,V4 Pro缓存命中输入平时0.025元/百万 token,高峰0.05元;缓存未命中平时3元,高峰6元;输出平时6元,高峰12元。V4 Flash 缓存命中平时0.02元,高峰0.04元;缓存未命中平时1元,高峰2元;输出平时2元,高峰4元。

峰谷定价这件事,往好了说是把算力选择权还给用户,不急的任务挪到低谷时段跑,成本更低。可另一方面,在平时的办公时间,跑相同的任务,成本就会增加。

这不是DeepSeek第一次在定价上换思路。

2025年2月搞过夜间错峰优惠,V3五折、R1二五折。2025年9月 V3.1发布,取消夜间优惠,全天统一价,输出价格还往上抬了50%。

但关键问题不在于价格涨没涨,而在于结合Harness之后,整体使用成本会如何?

第三方测试显示,不同的harness 在完成同样任务时,token消耗差异巨大。测试机构用DeepSeek V4 Flash,分别测试了Claude Code、OpenCode和Pi这三个市面上最常见的Harness工具。发现,三种工具的代码质量基本一致,但Claude Code 每个任务平均跑约70次工具调用,OpenCode只有约22次。

此外,同一个任务,在弱Harness(Pi)里失败了,换到强Harness(Claude Code)里居然成功了。

因此,如何去平衡价格与性能,这是DeepSeek做Harness必须要面对的问题。

不过有一点我很放心,在省钱这件事上,梁文锋还是太权威了。

标签: harness deepseek 模型 agent 上下文 jd 工具 行情 高峰 崔添翼

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。