AI大模型选择与趋势
模型迭代速度还是太快了,平均一两个月就出一个版本,目前各家的方向还都是重点训练 FunctionCalling(或者说工具调用能力) 和安全挖掘方向的能力,个人认为实际还是编程方向的特化,通用知识方面目前看已经很难有大的进步了。
这篇就是来更新记录当前环境下流行的模型、工具,仅代表主观感受。
最近正好看到有个新闻,说是用小学内的知识集来训练 LLM,最终的成品很难回答超过知识范围的东西,即无法提升超出知识范围的能力;
于是有人说现在的 LLM 也类似,实际上没有突破现有知识的边界;当学生过于依赖 LLM 时,会导致学习能力上的退化,意思就是有 AI 能考 100 分,没有 AI 的辅助就只能 80 分。
另一部分网友类比计算器,计算器会导致心算能力下降,但是并不影响创造力,反而提高效率,关键还是要有节制的使用;
这个类比不是很恰当,但是提供了另一个角度(认知卸载,计算器是卸载执行,LLM 可以卸载理解)。
还有一个角度是说当知识量范围达到某一个量级才会出现“智能的涌现”,也就是说小学知识面太窄,达不到,不能说明 LLM 创造力的问题。
评分参考: https://artificialanalysis.ai
天花板
来解决复杂问题和长任务编排,如:GPT-5.6 Sol Max、Claude Fable 5
根据 Pi 发布的研究,现在模型和 Harness 的绑定越来越深,也就是你用 GPT 的模型,那么只有搭配官方的 Codex 才能达到最佳效果;A\ 也是一样的道理,使用其他的 Harness 在工具调用等方面会出现幻觉,可能和训练方向有关。
编程主力
能处理绝大部分的问题,如:GPT-5.6 Terra、GLM-5.2 / GLM-5.3、Kimi-k3
其他的例如 gemini-3.7-flash 当作备用也非常不错,速度快,成本低。
阿里的 qwen3.8-max 体感也不错,和 5.2 搭配使用效果更好,但是价格太贵。
多模态方面 grok-4.5、grok-4.6 好像挺不错,智力也够,价格也没那么离谱,也是一个不错的选择。
得益于模型的越来越聪明(起码是编程方向),普通的模型搭配任意的 Harness 就可以处理大部分的任务,如果不是特别复杂的任务,作为主力模型是个不错的选择
编程性价比
能处理绝大部分简单任务,非常便宜,速度飞快(很重要!):deepseek-v4-flash、GPT-5.6-luna、GLM-5.3-Flash、Qwen3.8-Flash
这一部分模型就主打一个便宜,一般的任务也都能用,在额度紧张时当作主力也问题不大。
体感方面 GLM-5.3-Flash 思考太慢了,Qwen3.8-Flash 可能是更好的选择,不过这个层级,还是谁便宜用谁。
涨价后的 deepseek-v4-flash 性价比不高了,甚至本地部署 qwen 3.8-27b 可以平替,3.8 27b 这个版本确实强。
本地部署
之前是 qwen 3.6 系列,现在 qwen 3.8-27b 出来后相当惊艳,从可用到了能有不错的体验。
需要注意的是,这里说的是个人部署,相比 DeepSeek V4、Kimi K3 这类开源模型,参数量过于恐怖,别说个人,一般公司能部署的也没几个,部署上甚至综合成本都比官方价格高,除了云计算厂商和特殊需要本地化的场景,对个人用户没有什么意义。
但是 qwen 系列的小模型对个人来说就很香了,尤其是真能干活,开源小模型方面无敌。
特殊领域
图像、视频生成方向成本太高,暂时不关注,个人可以搞个本地部署的玩玩就行了。
ASR 可以直接用 Mimo 或者阿里的千问系列,Mimo 更便宜,10 块钱就能用好久,或者这种直接自己部署就行了,参数量少都能跑得动。TTS 也是一样的道理。
我整理了一篇本地部署的文章,还没弄好 TODO
Agent(Harness)
目前来看,编程和通用 Agent 已经趋于整合一起,不再单独细分,只是界面的调整,内部逻辑区别不大,这也符合 AI 模型进化的趋势,因为通用 Agent 往往也要先掌握编程能力才做得成复杂任务。
并且,当模型足够聪明,上下文足够多,Agent 的差异也不会太大了。
好用的工具
顶级:Codex(改名 ChatGPT)
极简:Pi,DeepSeek Harness(DSH)
CLI:Grok Build、Codex CLI、Claude Code CLI
细分:Reasonix(DeepSeek)、Claude Code(claude)
开源的套壳方向:
- Cherry Studio
- Cindy
- Alma
- Waku
安卓推荐:Kelivo
其他可以考虑的:
- omp(oh-my-pi)
- DimAgent
- Hermes Studio
- Hermes Web UI