Frontier · 投资人 1-pager
消费端打开之后,稀缺的是 context
AI agent 让不会写代码的人也能调 API,另类数据的买方不再只有 30–40 家机构。模型人人可用,token 人人同价;差的是同一个问题、有没有金融 context,给出的判断能不能据此行动。Frontier 做的是挂在模型外面的这层 context:从核心用户的讨论里长出来,人能回溯,agent 能调用。
一家供应商往往只服务 30–40 家机构
只有机构消化得了大批量数据。所以数据必须高价值、高难度、高价格,生意才成立。买方少,不是因为数据没用,是被消费能力卡住。
所有人都能调用,消费端不再是瓶颈
AI agent 把调 API 的能力交给了不会写代码的人。数据能被所有人消费之后,卡住的位置往上移:不再是谁买得起数据,而是谁能给模型补上对的 context。
判断差额,不是 token 价差
输入 token 人人同价,输出 token 的单价也人人同价。差的不是价格,是同一次调用吐出的判断值不值得据此行动。金融问题上,有没有这层 context,输出的决策价值差巨大。这个判断差额,是值得被捕获的那部分。它不来自更长的 prompt;很多信噪比判断是权重里的东西,写不成一段话。
供给窄,分发宽
| 以前 · 另类数据 | 现在 · Frontier | |
|---|---|---|
| 供给 | 窄:少数供应商 | 窄:核心用户的判断 |
| 分发 | 窄:30–40 家机构 | 宽:任何能调 API 的人和 agent |
供给端一直是窄的,变的是分发端。位置就在这两个之间。
脊柱 · 从核心用户的讨论到数据供应
- 01核心用户讨论一二级金融机构、互联网、AI 从业者。他们先为自己看。
- 02留在平台的语料讨论、截图、链接、引用、反驳,都带着谁、何时。
- 03加权语料 / 信噪比判断哪条是信号,哪条是噪音。后训练只训这一个判断。
- 04Context 层权重说不出来,但每条判断能回溯到谁、何时、说了什么。
- 05筛选 / 检索 / 问答人走 Frontier App,agent 走 API。同一套底。
- 06数据供应卖给所有能调 API 的人,不只 30–40 家机构。
为什么换模型不够
- 权重说不出来。很多信噪比判断是向量里的权重,不是一段能写进 prompt 的话。
- 金融场景模型能力趋同。再换一个更大的通用模型,在这类问题上边际有限。
- 所以把 context 外挂在模型外面,可能是解法。判断做在语料和检索里,模型换了它还在。
- 模型权重
- 后训练只动信噪比判断这一项,不训全能金融模型。
- 加权语料
- 讨论按来源、时间、被引用和被反驳的情况加权。
- 向量检索
- 查找时带着这些权重,不只按字面相似。
一个例子 · 外卖监管文件
模型读到媒体报道,把报道当事实复述,接着往下推对外卖平台的影响。
有人点开官方链接,发现官方链接、媒体表述、文件状态三者对不上。讨论转向:是假消息,还是被撤回?事件成立吗?影响哪些公司?下一步去哪验证?
这条进语料时带着谁、何时、查了什么。之后任何人或 agent 再问同一件事,拿到的不是标题,是「状态待验证」和验证路径。
同一个模型,同一条新闻。差的是判断,不是 token。
三个阶段 · 顺序不能反
先服务核心用户自己。他们在这里看、聊、存、引用,是因为 App 先解决了他们自己看信息的问题,不是为了贡献数据。贡献者留下,语料才留下。没有持续捕获,context 层会枯竭。
语料加权,后训练只训信噪比判断,检索带着权重。不训全能模型。每条判断可回溯到谁、何时、说了什么,模型换了这层还在。
把 context 层做成可调用的数据。消费端已经打开,卖给所有能调 API 的人和 agent,不只 30–40 家机构。前两步跑通,这一步才有东西可供。
站在哪一层
不按功能重做 Bloomberg。Bloomberg 覆盖已标准化的信息;Frontier 占的是它之前的上游 context——突发、非标准、还没被标准化的那一段。也不是 X,也不是普通社群:X 上的语料留不下来也不带权重,普通社群的讨论不为回溯和调用设计。
设计约束 · human-verifiable, agent-consumable
权重不可言说,但每条进入 context 层的判断都能回溯到谁、何时、说了什么。人可以核对,agent 可以调用。同一套底,两个出口。