目录

AI大模型选择与趋势

模型迭代速度还是太快了,平均一两个月就出一个版本,目前各家的方向还都是重点训练 FunctionCalling(或者说工具调用能力) 和安全挖掘方向的能力,个人认为实际还是编程方向的特化,通用知识方面目前看已经很难有大的进步了。

这篇就是来更新记录当前环境下流行的模型、工具,仅代表主观感受。

最近正好看到有个新闻,说是用小学内的知识集来训练 LLM,最终的成品很难回答超过知识范围的东西,即无法提升超出知识范围的能力

于是有人说现在的 LLM 也类似,实际上没有突破现有知识的边界;当学生过于依赖 LLM 时,会导致学习能力上的退化,意思就是有 AI 能考 100 分,没有 AI 的辅助就只能 80 分。

另一部分网友类比计算器,计算器会导致心算能力下降,但是并不影响创造力,反而提高效率,关键还是要有节制的使用;

这个类比不是很恰当,但是提供了另一个角度(认知卸载,计算器是卸载执行,LLM 可以卸载理解)。

还有一个角度是说当知识量范围达到某一个量级才会出现“智能的涌现”,也就是说小学知识面太窄,达不到,不能说明 LLM 创造力的问题。

评分参考: https://artificialanalysis.ai

来解决复杂问题和长任务编排,如:GPT-5.6 Sol Max、Claude Fable 5

根据 Pi 发布的研究,现在模型和 Harness 的绑定越来越深,也就是你用 GPT 的模型,那么只有搭配官方的 Codex 才能达到最佳效果;A\ 也是一样的道理,使用其他的 Harness 在工具调用等方面会出现幻觉,可能和训练方向有关。

能处理绝大部分的问题,如:GPT-5.6 Terra、GLM-5.2 / GLM-5.3、Kimi-k3

其他的例如 gemini-3.7-flash 当作备用也非常不错,速度快,成本低。

阿里的 qwen3.8-max 体感也不错,和 5.2 搭配使用效果更好,但是价格太贵。

多模态方面 grok-4.5、grok-4.6 好像挺不错,智力也够,价格也没那么离谱,也是一个不错的选择。

得益于模型的越来越聪明(起码是编程方向),普通的模型搭配任意的 Harness 就可以处理大部分的任务,如果不是特别复杂的任务,作为主力模型是个不错的选择

能处理绝大部分简单任务,非常便宜,速度飞快(很重要!):deepseek-v4-flash、GPT-5.6-luna、GLM-5.3-Flash、Qwen3.8-Flash

这一部分模型就主打一个便宜,一般的任务也都能用,在额度紧张时当作主力也问题不大。

体感方面 GLM-5.3-Flash 思考太慢了,Qwen3.8-Flash 可能是更好的选择,不过这个层级,还是谁便宜用谁。

涨价后的 deepseek-v4-flash 性价比不高了,甚至本地部署 qwen 3.8-27b 可以平替,3.8 27b 这个版本确实强。

之前是 qwen 3.6 系列,现在 qwen 3.8-27b 出来后相当惊艳,从可用到了能有不错的体验。

需要注意的是,这里说的是个人部署,相比 DeepSeek V4、Kimi K3 这类开源模型,参数量过于恐怖,别说个人,一般公司能部署的也没几个,部署上甚至综合成本都比官方价格高,除了云计算厂商和特殊需要本地化的场景,对个人用户没有什么意义。

但是 qwen 系列的小模型对个人来说就很香了,尤其是真能干活,开源小模型方面无敌。

图像、视频生成方向成本太高,暂时不关注,个人可以搞个本地部署的玩玩就行了。

ASR 可以直接用 Mimo 或者阿里的千问系列,Mimo 更便宜,10 块钱就能用好久,或者这种直接自己部署就行了,参数量少都能跑得动。TTS 也是一样的道理。

我整理了一篇本地部署的文章,还没弄好 TODO

目前来看,编程和通用 Agent 已经趋于整合一起,不再单独细分,只是界面的调整,内部逻辑区别不大,这也符合 AI 模型进化的趋势,因为通用 Agent 往往也要先掌握编程能力才做得成复杂任务。

并且,当模型足够聪明,上下文足够多,Agent 的差异也不会太大了。

顶级:Codex(改名 ChatGPT)

极简:Pi,DeepSeek Harness(DSH)

CLI:Grok Build、Codex CLI、Claude Code CLI

细分:Reasonix(DeepSeek)、Claude Code(claude)

开源的套壳方向:

  • Cherry Studio
  • Cindy
  • Alma
  • Waku

安卓推荐:Kelivo

其他可以考虑的: