API 贵得肉疼,大厂今年开始流行“抠算力”了?
坐标某互联网大厂,最近组里推算账,发现这几个月的 API 账单有点压不住。跟同行交流了一圈,发现大家今年风向全变了。前两年还在盲目迷信谁的参数量大、谁的模型脑子更灵光,今年一开春,老板们天天盯着的是单卡吞吐量和推理成本。比如最近圈里都在传,像亚马逊这类巨头,已经在开始琢磨把 Alexa 的一部分调用从 Claude 那边切回自研模型,顺便把底层架构压榨了一遍,单卡利用率直接拉了几倍。 说白了,前几年的大模型热是“烧钱买规模”,现在直接被逼成了“精细化抠门”。当老板开始跟你算“一次对话几厘钱”的时候,纯靠堆算力的路子确实快走到头了。大家平时自己搞项目或者接商用 API,现在最头疼的是推理成本还是延迟?来评论区吐个槽。