从 Token-Maxxing,到 Token-Minimizing最近,各家都掏出了 flash 版的口粮模型:又快又好又便宜,干啥都不心疼无论国内的 DeepSeek V4.1-Flash、GLM-5.3-Flash,抑或是海外的 Gemini 3.8 Flash,都被各家作为便宜大碗的主力模型进行推广,让那些需要做,但投入产出评估上不值得 Fable 一类模型出马的事情,变得值得落地了
这个的背后,其实有个小小的时代变化:从 Token-Maxxing,到 Token-Minimizing
Token-Maxxing
Token-Maxxing 这个词是今年上半年传开的,直白一点就是「把 Token 猛猛地烧起来」,尽可能多的并发,尽可能多地去搞;到了国内,这个词还有个变形「全民养虾」
在当时,Meta 内部一个按 Token 用量给员工排名的看板,还会授予“Token Legend”这样的称号,大抵能翻译成「词元天尊」,用来表达对“先进个人,先用 token”的激励
在当时各个大厂都在想着法地让人去用 token,毕竟虽然 Agent 并不能 100% 搞定任务,但它可以并行几十种方案去探索,即便是没搞定也能让员工更好地积累经验。都是行业的早期阶段,浪费一些计算,好过错失一些可能,万一探索出来点东西,比如省了团队半年的开发,怎么看都是赚的
但到了这里,事情也开始分叉:有些人开始 token 空烧比如写一个脚本,每天上班的时候让他的 10 个 Agent 并行去「帮我解答哥德巴赫猜想」...然后在 1 小时内消耗掉了他的所有额度,进而美美去摸鱼了,更有甚者...把公司的 token 资源代理一下,成为了中转站大佬
于是,业内开始了一轮反思:我们应该如何更有效地利用 token?我们使用 token,本质上也是在做一种智力分配,在一些值得探索的问题投入更多的智力,而不是为了证明自己很会用 AI 而去消耗
于是,我们进入了下一种思潮:Token-Minimizing,去细致地核算每一份智力的产出
Token-Minimizing
任何公司都希望大家把 AI 用起来、去完成更多的任务,但任何公司的预算都是有限的,在这里就有了 Token-Minimizing 的提出:要压低每份合格交付的总成本,对不同的任务进行不同的预算规划,去降低每个任务的总成本
注意,这里用的是「总成本」,也就是「人力+token」的总消耗;假如是为了省下一百元的 Token,而去耗掉一万块的人力,这叫煞笔
也正是趁着更多模型跨过可用门槛,我们的模型厂商也顺势推出了甜品型 flash 模型,标准大概是:
智力在 Opus 4.6 以上
价格在头部模型的 1/10 以内
速度通常在 100 token/s 或者更快
比如 DeepSeek 的 V4.1-Flash 的价格,就只有 Opus 4.8 的 1/10;而 GLM-5.3-Flash(也就是牛来)则甚至做到了 Opus 4.8 的 1/40,斩杀了当时绝大多数的模型
于是,一个非常朴素的问题出现了:没有其他特殊要求的话,我为什么选你?一个模型不必赢过所有对手,但必须在斩杀线外找到一个位置。
因此,模型的比赛开始同时往两个方向走:
继续向上,探索此前做不到的事情
也努力向左,用更低成本完成已经能做到的事情
讨论于外滩大会
前几天我在外滩大会,在台上台下参与了很多场的分享,其中的部分场次也提到了「Token-Minimizing」的一些话题
百灵团队聊到阿福选模型的一个变化:过去优先使用最大、最好的模型,现在一些较小的模型也能跨过业务要求的“水位线”,成本和响应速度就开始影响选型
这个变化其实挺能说明问题:Token-Minimizing 如果只理解成“省 Token”,还是说窄了。
阿福技术负责人进捷说得很直接。用户规模起来以后,推理成本会变得非常高;而且 C 端应用还有一个特别现实的问题——用户不会一直等你。模型可能只是在 Benchmark 上慢了几秒,但放到产品里,等 5 秒用户可能就走了。
所以当小模型也能跨过业务水位线之后,问题自然就从“谁最聪明”,变成了:谁能在足够聪明的情况下,更快、更便宜、更稳定地把事情办完,真正重要的是“端到端的任务成功率”。
单轮回答得又快又便宜,但最后任务没办成,前面省下来的 Token 也没什么意义。
外滩大会上,还有另一个模型的介绍,是百灵上个月发布的金融增强模型 Ling-3.0-flash-Fin。它沿用 Ling-3.0-flash 的架构,124B 总参数、5.1B 激活参数,再通过金融语料训练、领域后训练和工具使用优化,强化信息检索、研究推理、估值建模与研报撰写。它要交付的东西,包括能追溯数据、保留公式、继续编辑的研究文件
其中有一个 Google 2026 Q2 财务模型更新的演示:模型读取财报和一份包含 7 张工作表、5,000 余个公式的 Excel,把该季度的预测值更新为实际披露值,同时处理公式切换、跨表依赖和图表,最后交回仍可编辑的工作簿
沿着这个例子,思考还可以进一步展开:越来越多的任务,会便宜到不值得人陪同虽然 Flash 能够有效降低执行成本,但假如每次都需要研究员先发现变化,再不断检查,实际上也是一种浪费。于是可以构想出未来的一种工作方式:核心任务交给检验 Harness,把无法通过检验的任务再交给工作人员
对应着放出来的,还有蚂蚁集团联合中金打造了 FinFIRST(Financial Information Retrieval, Sourcing and Traceability)。该评测基准由 50 余名金融专业人士深度参与设计,从结果、过程和证据三个层面,系统评估答案是否准确完整、研究口径与计算是否合理,以及关键数据与结论能否回溯至权威原始资料
FinFIRST 与代表性金融 Benchmark 的能力维度对比
在这个过程中,机构可以把模型接进自己的数据和工具环境,用来帮助判断问题出在哪一步,其背后思考的理念也便是 Token-Minimizing对于金融这类需要严格把关的行业,除了要在高频调用下节省 token 外,还需要有效地降低复核和返工的用时,这样才能算是真的 Token-Minimizing
毕竟,在金融这种场景里,这个成本可能比 Token 贵多了。
百灵团队聊模型边界时提到一个挺反直觉的问题:现在很多 Benchmark 会鼓励模型“尽量答”。不知道也猜一个,反正猜中了有分,不回答反而没分,反正就是很“舔狗”。
但真实世界完全不是这么回事。
百灵金融模型负责人月引举了一个金融评测里的现象:有些模型碰到不确定的问题,会一口气给出几十种口径;从 Benchmark 的角度看,它可能覆盖到了正确答案,但一个真正的研究员不可能拿着几十个互相冲突的判断去做决策。
所以在严肃场景里,百灵反而会提高对拒答的奖励——不知道的时候,宁愿告诉用户不知道。
这其实也是另一种 Token-Minimizing:
不是少说几个字,而是少制造一次错误,少让一个人花半小时帮 AI 擦屁股。
FinFIRST 候选题依次经过专家编写、独立复答、交叉验证、Rubric 审核、压力测试和一致性检查,最终保留 123 道任务
或许,站在 5 年前的视角看现在,一切都有点魔幻:人工智能在自我递归迭代,并在产生各种可被执行的需求如果再沿着百灵的思路补半句,或许是:真实世界最终会告诉模型,什么才叫“把事做成”
最后
我们甚至可以假设:即便是今天强如 Fable,也未必打得过六个月后的 Gemini Flash(虽然也,反正我是觉得旗舰的溢价里,很大一部分是时间优势
然后随着模型智能水位的不断提升,叠加到并不是所有的厂商都能够占据最头部的智能生态位,我们便会看到许多的模型以 Flash 的名义被推出(或许这些模型本就应该标记为 pro),对于所有模型都做得到的工作,其实并没必要多瞎花钱
于是,那些原本需要人做,或者 Fable 级别模型来做,以至于 ROI 很难看的事情,现在便有了规模化的可能,大抵便是:Pro 告诉我们啥事儿能交给 AI,Flash 告诉我们啥事儿值得交给 AIRobinhood 上线 BILL 等三种新代币Techub News 消息,加密货币交易所 Robinhood 宣布在其专业交易平台 Robinhood Legend 新增支持 BILL 等三种数字资产交易。用户现可通过该平台买卖这些新上线的代币。
这是 Robinhood 近期扩展加密货币资产业务的最新举措,旨在丰富平台交易品种。目前该平台持续增加对更多数字资产的支持,以满足用户多样化的投资需求。跨链协议 Everclear 与 ZERO Network 宣布关闭Techub News 消息,据 Cointelegraph 报道,跨链清算协议 Everclear 宣布因未能实现可持续商业收入且资金耗尽,正逐步关闭基金会及实验室;同日 ZERO Network 团队宣布关闭网络,转而专注加密货币钱包服务。
Everclear 表示曾探索多种收购方案但未成功,现考虑开源协议供社区选择是否继续运行。近期加密货币行业出现多起项目关闭案例,包括 Legend、Step Finance、Polynomial 等,反映出市场整合趋势。链上金融应用 Legend 宣布停止运营Techub News 消息,据 WuBlockchain 报道,链上金融应用 Legend 宣布将在运营两年后正式关闭。该应用将继续维持 60 天,并于 7 月 12 日正式下线,目前已停止新用户注册。
Legend 是一款链上金融应用,用户可通过该平台进行链上金融活动。此次关闭意味着该项目将终止运营,提醒现有用户需在服务终止前妥善处理相关资产。链上交易者竞技平台 Legend.Trade 完成 350 万美元种子轮融资,Electric Capital 领投Techub News 消息,链上交易者竞技平台 Legend.Trade 宣布完成 350 万美元种子轮融资,Electric Capital 领投,参投方包括 Amber Group 与 GSR Markets。目前,该平台的累计融资额已超 500 万美元。Legend Trading 爱尔兰子公司获爱尔兰央行颁发的 MiCA 牌照Techub News 消息,数字资产金融服务公司 Legend Trading 宣布其爱尔兰子公司获得爱尔兰央行颁发的 MiCA 牌照,可向 27 个欧盟国家的 4.5 亿用户提供加密货币交易与结算服务。
Techub News 此前报道,Legend Trading 爱尔兰子公司于去年 11 月获爱尔兰央行颁发的 VASP 牌照。Web3 赛车游戏 Auto Legends 完成 100 万美元战略融资,Coinbase Ventures 旗下公司参投Techub News 消息,据 VentureBeat 报道,Web3 赛车游戏 Auto Legends 完成 100 万美元战略融资,参投方包括 Coinbase Ventures 的 Base Ecosystem Fund、 Operating Group 和 Draper Dragon ,此轮融资是其去年 8 月完成的 800 万美元融资的补充。
Auto Legends 正在准备推出其首个 NFT 铸造,为早期支持者提供游戏内奖励。此外,Auto Legends 聘请了 Scott Probin,他是一位在 AAA 游戏制作方面拥有超过 35 年经验的游戏行业资深人士。DeFi 平台 Legends 完成 1500 万美元融资,a16z 和 Coinbase Ventures 参投Techub News 消息,据《财富》报道,由 Compound 前首席执行官 Jayson Hobby 与其他两位前 Compound 高管创立的 DeFi 平台 Legend 完成 1500 万美元融资,参投方包括 a16z 和 Coinbase Ventures。所筹资金将用于扩大团队并专注于市场营销,加速开发 Legend 应用。Hobby 表示,Legend 将尝试成为一款比 Metamask 或 Coinbase Wallet 等现有钱包更实用的自托管钱包。Legend Trading 子公司获爱尔兰央行颁发的 VASP 牌照Techub News 消息,加密货币交易平台 Legend Trading 子公司 Legend Financial Ireland Limited 已被爱尔兰中央银行批准为虚拟资产服务提供商(VASP)。此外,Legend Trading 正申请《加密资产市场监管条例》(MiCA)的加密资产服务提供商(CASP)牌照。在爱尔兰,2024 年 12 月 30 日之前注册并运营的 VASP 可以在 MiCA 规定的过渡措施下继续其业务,同时提交 CASP 授权申请。链游开发商 Legend of Arcadia 完成 400 万美元种子轮融资Techub News 消息,据 The Block 报道,链游开发商 Legend of Arcadia 完成 400 万美元种子轮融资,参投方包括 Animoca Brands、OKX Ventures、Arche Fund、Selini Capital 等。Compound CEO、CTO 等三名高管离职创立新 DeFi 协议 LegendTechub News 消息,Compound CEO Jayson Hobby 在 X 平台发文表示,他与CTO Geoffery Hayes及产品副总裁 Mykel Pereira 离职,共同创立新的 DeFi 协议 Legend。Legend 旨在解决区块链的 UX 问题。最近,各家都掏出了 flash 版的口粮模型:又快又好又便宜,干啥都不心疼无论国内的 DeepSeek V4.1-Flash、GLM-5.3-Flash,抑或是海外的 Gemini 3.8 Flash,都被各家作为便宜大碗的主力模型进行推广,让那些需要做,但投入产出评估上不值得 Fable 一类模型出马的事情,变得值得落地了 这个的背后,其实有个小小的时代变化:从 Token-Maxxing,到 Token-Minimizing Token-Maxxing Token-Maxxing 这个词是今年上半年传开的,直白一点就是「把 Token 猛猛地烧起来」,尽可能多的并发,尽可能多地去搞;到了国内,这个词还有个变形「全民养虾」 在当时,Meta 内部一个按 Token 用量给员工排名的看板,还会授予“Token Legend”这样的称号,大抵能翻译成「词元天尊」,用来表达对“先进个人,先用 token”的激励 在当时各个大厂都在想着法地让人去用 token,毕竟虽然 Agent 并不能 100% 搞定任务,但它可以并行几十种方案去探索,即便是没搞定也能让员工更好地积累经验。都是行业的早期阶段,浪费一些计算,好过错失一些可能,万一探索出来点东西,比如省了团队半年的开发,怎么看都是赚的 但到了这里,事情也开始分叉:有些人开始 token 空烧比如写一个脚本,每天上班的时候让他的 10 个 Agent 并行去「帮我解答哥德巴赫猜想」...然后在 1 小时内消耗掉了他的所有额度,进而美美去摸鱼了,更有甚者...把公司的 token 资源代理一下,成为了中转站大佬 于是,业内开始了一轮反思:我们应该如何更有效地利用 token?我们使用 token,本质上也是在做一种智力分配,在一些值得探索的问题投入更多的智力,而不是为了证明自己很会用 AI 而去消耗 于是,我们进入了下一种思潮:Token-Minimizing,去细致地核算每一份智力的产出 Token-Minimizing 任何公司都希望大家把 AI 用起来、去完成更多的任务,但任何公司的预算都是有限的,在这里就有了 Token-Minimizing 的提出:要压低每份合格交付的总成本,对不同的任务进行不同的预算规划,去降低每个任务的总成本 注意,这里用的是「总成本」,也就是「人力+token」的总消耗;假如是为了省下一百元的 Token,而去耗掉一万块的人力,这叫煞笔 也正是趁着更多模型跨过可用门槛,我们的模型厂商也顺势推出了甜品型 flash 模型,标准大概是: 智力在 Opus 4.6 以上 价格在头部模型的 1/10 以内 速度通常在 100 token/s 或者更快 比如 DeepSeek 的 V4.1-Flash 的价格,就只有 Opus 4.8 的 1/10;而 GLM-5.3-Flash(也就是牛来)则甚至做到了 Opus 4.8 的 1/40,斩杀了当时绝大多数的模型 于是,一个非常朴素的问题出现了:没有其他特殊要求的话,我为什么选你?一个模型不必赢过所有对手,但必须在斩杀线外找到一个位置。 因此,模型的比赛开始同时往两个方向走: 继续向上,探索此前做不到的事情 也努力向左,用更低成本完成已经能做到的事情 讨论于外滩大会 前几天我在外滩大会,在台上台下参与了很多场的分享,其中的部分场次也提到了「Token-Minimizing」的一些话题 百灵团队聊到阿福选模型的一个变化:过去优先使用最大、最好的模型,现在一些较小的模型也能跨过业务要求的“水位线”,成本和响应速度就开始影响选型 这个变化其实挺能说明问题:Token-Minimizing 如果只理解成“省 Token”,还是说窄了。 阿福技术负责人进捷说得很直接。用户规模起来以后,推理成本会变得非常高;而且 C 端应用还有一个特别现实的问题——用户不会一直等你。模型可能只是在 Benchmark 上慢了几秒,但放到产品里,等 5 秒用户可能就走了。 所以当小模型也能跨过业务水位线之后,问题自然就从“谁最聪明”,变成了:谁能在足够聪明的情况下,更快、更便宜、更稳定地把事情办完,真正重要的是“端到端的任务成功率”。 单轮回答得又快又便宜,但最后任务没办成,前面省下来的 Token 也没什么意义。 外滩大会上,还有另一个模型的介绍,是百灵上个月发布的金融增强模型 Ling-3.0-flash-Fin。它沿用 Ling-3.0-flash 的架构,124B 总参数、5.1B 激活参数,再通过金融语料训练、领域后训练和工具使用优化,强化信息检索、研究推理、估值建模与研报撰写。它要交付的东西,包括能追溯数据、保留公式、继续编辑的研究文件 其中有一个 Google 2026 Q2 财务模型更新的演示:模型读取财报和一份包含 7 张工作表、5,000 余个公式的 Excel,把该季度的预测值更新为实际披露值,同时处理公式切换、跨表依赖和图表,最后交回仍可编辑的工作簿 沿着这个例子,思考还可以进一步展开:越来越多的任务,会便宜到不值得人陪同虽然 Flash 能够有效降低执行成本,但假如每次都需要研究员先发现变化,再不断检查,实际上也是一种浪费。于是可以构想出未来的一种工作方式:核心任务交给检验 Harness,把无法通过检验的任务再交给工作人员 对应着放出来的,还有蚂蚁集团联合中金打造了 FinFIRST(Financial Information Retrieval, Sourcing and Traceability)。该评测基准由 50 余名金融专业人士深度参与设计,从结果、过程和证据三个层面,系统评估答案是否准确完整、研究口径与计算是否合理,以及关键数据与结论能否回溯至权威原始资料 FinFIRST 与代表性金融 Benchmark 的能力维度对比 在这个过程中,机构可以把模型接进自己的数据和工具环境,用来帮助判断问题出在哪一步,其背后思考的理念也便是 Token-Minimizing对于金融这类需要严格把关的行业,除了要在高频调用下节省 token 外,还需要有效地降低复核和返工的用时,这样才能算是真的 Token-Minimizing 毕竟,在金融这种场景里,这个成本可能比 Token 贵多了。 百灵团队聊模型边界时提到一个挺反直觉的问题:现在很多 Benchmark 会鼓励模型“尽量答”。不知道也猜一个,反正猜中了有分,不回答反而没分,反正就是很“舔狗”。 但真实世界完全不是这么回事。 百灵金融模型负责人月引举了一个金融评测里的现象:有些模型碰到不确定的问题,会一口气给出几十种口径;从 Benchmark 的角度看,它可能覆盖到了正确答案,但一个真正的研究员不可能拿着几十个互相冲突的判断去做决策。 所以在严肃场景里,百灵反而会提高对拒答的奖励——不知道的时候,宁愿告诉用户不知道。 这其实也是另一种 Token-Minimizing: 不是少说几个字,而是少制造一次错误,少让一个人花半小时帮 AI 擦屁股。 FinFIRST 候选题依次经过专家编写、独立复答、交叉验证、Rubric 审核、压力测试和一致性检查,最终保留 123 道任务 或许,站在 5 年前的视角看现在,一切都有点魔幻:人工智能在自我递归迭代,并在产生各种可被执行的需求如果再沿着百灵的思路补半句,或许是:真实世界最终会告诉模型,什么才叫“把事做成” 最后 我们甚至可以假设:即便是今天强如 Fable,也未必打得过六个月后的 Gemini Flash(虽然也,反正我是觉得旗舰的溢价里,很大一部分是时间优势 然后随着模型智能水位的不断提升,叠加到并不是所有的厂商都能够占据最头部的智能生态位,我们便会看到许多的模型以 Flash 的名义被推出(或许这些模型本就应该标记为 pro),对于所有模型都做得到的工作,其实并没必要多瞎花钱 于是,那些原本需要人做,或者 Fable 级别模型来做,以至于 ROI 很难看的事情,现在便有了规模化的可能,大抵便是:Pro 告诉我们啥事儿能交给 AI,Flash 告诉我们啥事儿值得交给 AI
