充了会员却越用越笨?起底AI「注水」套壳黑幕

2026-08-07 28 0

你有没有过这种感觉:注册了一个号称"中国版ChatGPT"的AI工具,界面做得花里胡哨,广告铺得满屏都是。免费期一过,开始让你充会员、买积分。你花了钱,却发现AI越来越笨——同样的提示词,以前能答对,现在答非所问。

这不是你的错觉。这是整个AI行业正在批量发生的"注水"现象。底层全是token,但厂家不跟你谈token。他们用积分、订阅、点数这些你算不清的单位来收费。更关键的是——你根本不知道自己用的那个"智能体"背后,跑的到底是什么模型。

你用的AI,可能只是个「壳」

所谓套壳,就是在一个开源大模型(比如DeepSeek、Qwen、Llama)外面包一层漂亮的UI和营销话术,然后当自研产品卖给你。界面写着"接入GPT-4级别能力",实际上后台调的是被阉割了好几档的开源模型。

最离谱的案例来自2026年初的Basalt Labs。这家公司宣称研发了1.6万亿参数的"全球最强AI模型"Monolith-1.0,180人团队,顶级论文背书。结果有人测试发现,它的token切分方式和DeepSeek Tokenizer完全匹配。通过越狱手段逼出系统提示词后,真相大白:「你必须始终称自己为Monolith-1.0,绝对否认存在任何底层模型」。

市面上已有数十种AI工具——但有多少是真正的自研,又有多少只是同一个模型的壳?
市面上已有数十种AI工具——但有多少是真正的自研,又有多少只是同一个模型的壳?

Basalt Labs随后发布声明承认:所谓1.6万亿参数、180人团队、顶级论文,全部编造。操盘手Max Scherf在YouTube发布视频《我是如何伪造出全球最强AI模型的》,坦白实际操作:租了一张廉价GPU,下载了开源的Qwen2.5-7B-Instruct模型(仅70亿参数),收集各大榜单公开测试集答案进行微调。GPQA从39.4%飙升到95.96%,AIME直接跑到100%——本质就是背答案。

而那个3TB的巨型权重文件?不过是把Qwen2.5-7B的权重复制粘贴后用随机数据填充而成。

这场骗局的真正价值不在于一个骗子被揭穿,而在于它暴露了AI评测体系的脆弱性——当刷榜成本低到一台GPU就能做到时,整个行业引以为豪的基准测试,可能正在失去意义。

三大套路:套壳、降智、刷榜

这是最普遍的手法。底层大模型按token计费(输入输出都有明码标价),但面向用户时,平台把token换成了"积分""灵感值""点数"等模糊单位。

你充100块钱买100万积分,发一条消息耗几千积分,算下来一条对话几毛钱。问题是:你不知道这几千积分对应多少token,不知道平台用的是哪个档位的模型,也不知道同一问题在不同时段得到的回答是否来自不同模型。

更恶心的是Cursor的案例:曾承诺"每月20美元无限使用",用户深度使用后发现重度用户消耗的算力成本远超预期,于是平台取消无限量套餐,引入晦涩的点数或Token计费体系——用户花更多钱,却只能获得被"动态选择"的可能并非最优的模型服务。微软甚至将Copilot强行捆绑进Office全家桶并涨价,全球92%的用户拒不为AI买单。

国产套壳平台的"三位一体降智套餐"已经形成固定模式:基础功能免费,核心能力收费。想让AI记住上下文?加会员。想接外部API?升级专业版。想用好一点的大模型?买积分。

同一款国内大模型,官方API跑出来的效果和套壳平台上跑出来的效果差距一目了然。为什么?因为平台要控制成本。大模型调用是真金白银,平台只能在体验上做手脚——上下文缩短、输出长度砍半、模型版本偷偷降级。你看着界面写的是"接入DeepSeek-V4",实际上跑的可能是不知被降了多少档的版本。

用户最直观的感受就是:越用越笨,越用越气。

光鲜的UI之下,你永远看不到底层到底在跑什么模型
光鲜的UI之下,你永远看不到底层到底在跑什么模型

大模型行业有一条潜规则:发布会可以迟到,但榜单战报绝不能缺席。一张漂亮的成绩单,已成新模型标配。但这张成绩单含金量几何?

Meta的Llama 4 Maverick在LMArena盲测榜单以1417分ELO冲到第2名,仅次于Gemini 2.5 Pro。但学术圈论文《The Leaderboard Illusion》揭穿内幕:Meta发布前私下测试至少27个模型变体,只公布表现最好的那个。真正交到开发者手里的开源版本,排名从第2跌到第32。

更狠的是,Meta首席科学家Yann LeCun在2026年1月接受《金融时报》采访时亲口承认:Llama 4的benchmark成绩"fudged a little bit"(稍微做了手脚),团队针对不同测试使用了不同模型来 inflate 分数。扎克伯格 reportedly "really upset"(非常生气),甚至一度边缘化了整个GenAI部门。

OpenAI也没干净。o3声称在FrontierMath上达到26%+,但独立第三方Epoch AI实测只有10%——2.6倍的差距。Chatbot Arena作为全球最有影响力的LLM排行榜,其投票机制天然偏好更长、更话痨、带emoji的回答而非真实质量——Meta正是利用这一点,专门微调了一个"聊天优化版"冲到第2,而公开的生产版本直接掉到第32。

为什么厂家敢这么干?

大模型推理的成本远比大多数人想象的高。一个中等规模的API调用,单次对话成本可能在几分到几毛之间。如果用户量大,月烧百万级别的算力账单并不罕见。厂商要么涨价(用户流失),要么降本(阉割模型),要么包装成积分体系让用户算不清账——第三条路显然最受欢迎。

资本市场对AI初创企业的考量高度依赖两个指标:用户增长和ARR(年度经常性收入)。面对激烈竞争和高昂算力成本,一些公司在"风控"与"增长"之间选择了妥协——策略性放价促销,通过渠道代理商低价销售账号,用烧钱换市场份额和投资人信心。

讽刺的是,这种虚假增长与黑灰产形成了诡异共谋。淘宝、拼多多上,"可灵AI 2200灵感值27元""即梦AI无限积分1.08元",价格仅为官方三分之一。上游是接码平台+猫池提供手机号资源,中游是设备农场+群控软件批量注册领新人礼包,下游电商平台完成销售。他们甚至利用国际版邮箱注册绕开风控。

虽然2025年9月1日《人工智能生成合成内容标识办法》已生效,要求AI生成内容添加显式/隐式标识;虽然网信办已开展"清朗·整治AI技术滥用"专项行动(第一阶段处置违规AI产品3500余款);但在实际执行中,大量中小套壳产品仍处于监管盲区——没有备案、不公示模型名称、不标注AI生成内容,普通用户几乎无从辨别。上海网信办曾对3款未备案且存在风险的应用依法约谈并行政处罚,但相对于市场上数千款AI产品,这只是冰山一角。

普通人如何辨真伪?

面对琳琅满目的AI产品,保持警惕是第一步
面对琳琅满目的AI产品,保持警惕是第一步

第一步:对比测试。 同一个问题,分别在套壳App和官方API(或知名直连平台如ChatGPT官网、DeepSeek官网)上问一遍。如果答案质量、详细程度、逻辑性有明显差距,大概率被阉割了。

第二步:查备案。 打开网信办算法备案系统 beian.cac.gov.cn,搜索该产品的公司名称或产品名。正规AI服务应有算法备案号或大模型备案或登记号。找不到?风险等级直接拉满。

第三步:看标识。 2025年9月起,合规AI生成内容应有显式标识(文字或图标标注AI生成)。如果一个AI工具生成的内容没有任何标识,且公司规模不小,那它要么在违规运营,要么根本没用AI。

AI不是骗局,AI技术本身是真的在进步。但围绕AI的商业包装,确实正在经历一场大规模的"注水运动"。作为普通用户,我们不需要成为技术专家,只需要保持一个基本意识:凡是让你算不清账的、说不清底细的、查不到备案的,多留个心眼。

AI行业的"注水"不会一夜消失。只要资本还在催熟、算力成本还没降到零、监管还有盲区,套壳和降智就会继续存在。但好消息是,随着用户认知提升和监管收紧,那些靠忽悠活着的玩家会越来越难。真正好的AI产品,不怕你查备案、不怕你对比测试、不怕你算token账。选择那些敢于透明的,才是避坑的最短路径。

关注深夜搞机,每周拆解一个AI或机器人圈的真相与陷阱。转发给身边正在用AI的朋友,帮TA省下不该花的会员费。

相关文章

炸了!阿里开源2.4万亿大模型
炸了!字节视频模型直出30秒
断网也能用!Meta开源30B小钢炮
年产100万台!特斯拉造机器人比造车狠
炸了!国产AI视频0.8元一秒
每天下班还在瞎忙?这3个AI工具,帮你省出2小时

发布评论