AI 炒股,数据到底从哪儿来:零元到一年三万九,全测了一遍
挺多朋友在拿 AI 炒股、做投资分析,技术好一点的还在做量化。但这类活模型聪明是次要的,信息源才是命根子——AI 手里那个价格是几点的,它自己不交代,也不报错。我实测免费 MCP 问茅台,给的是前一天的收盘价;港股同一个接口,代码差两个字母,价格差二十二分钟。
这一期把给 AI 喂交易数据的所有路子摸了一遍:三层架构(通道/方法/查询)怎么分工、免费三源为什么能交叉自证、价格阶梯从零元到一年三万九每档买到什么、三条让数据能信的规矩。策略是人算的,AI 只是执行提效——这期只谈技术,不构成投资建议。完整对照表挂在文末下载。
先立两个前提
策略是人算出来的,AI 干的是执行提效的活儿——帮你把找数据、盯盘、跑流程加速,它不会替你变出来一个能赚钱的策略。所以这期不是投资建议,不推票、不讲买卖时机,只谈技术:AI 到底怎么拿数据、拿到的数据怎么才能信。
信息源其实分两块:交易数据和舆情。舆情水更深,这期不展开,只谈交易数据。
三层架构:选错层,全白忙
给 AI 喂股市数据,市面上是几条完全不同的路。很多人以为拿数据就是找个接口,真不是这样——这里面是三层。
通道层:命令行接口或直连 API,拿到的是 tick 级到秒级的行情,而且几乎不占 AI 的脑子。腾讯、新浪、东方财富的公开行情接口都在这一层。
方法层:各种 Skills 技能包——技术分析、缠论、希腊字母。技能包本身不产生数据,它有多新鲜,完全看背后连的是哪条通道:接到秒级通道上就能算秒级的东西,接到隔天数据上,算出来的就是隔天的。
查询层:各种 MCP。财报、股东、宏观数据是它的强项,但免费的 MCP 实测下来大多给的是十五分钟延迟甚至隔天的数据——它擅长的是广度,不是实时性。
免费这条路:一行命令,还能交叉自证
A 股秒级数据,零成本,一行命令就接上,门槛低到离谱。实测三个源同时打同一只票(茅台),三家的价格一分钱都不差——免费的东西还能交叉自证,这是这次调研最大的惊喜。
港股的坑更值得记住:同一个域名,代码前面多加两个字母拿到的是实时价(盘中实测与墙上的钟同一秒);不加那两个字母,给你的是二十二分钟前的价,而且不报错。免费 MCP 问茅台,给的是前一天的收盘价,它也不报错、也不觉得有问题——这种「不报错但给你旧数据」比直接报错更危险。
还有一笔隐形账:Tushare 官方 MCP 两百多个工具、长桥一百四十多个,全量常驻在 AI 的上下文里。装得越多,AI 越容易挑错工具,Token 烧得也越快——上一期讲过的「工具税」。
价格阶梯:每一档钱买到什么
- 零元:A 股秒级 + 免费三源交叉验证,盘中看价够用
- 十九到二十九美金/月:买历史和广度(回测用),数据还是十五分钟延迟
- 九十九美金/月:美股全交易所真实时的最低门槛
- 一百九十九美金/月:tick 级数据 + 二十年历史 + 期权
- 万元级人民币/年:万得那种终端(单账号一年三万九千八,几年前媒体报道口径)——买的不只是数据,是授权、稳定、能对外引用的合规口径
券商是另一条路:长桥出了官方命令行工具,明说是给 AI 用的,tick 级、带盘口和经纪队列、能直接下单、有交易所授权;富途走本地网关同一个思路。机构那条路(Anthropic 金融版接 FactSet、标普全球、伦交所、晨星)报价不公开,知道有就行。
三条规矩:拿到数据不等于能信
一、每个数字必须带自己的时间戳回来,不许 AI 只说「最新价」——要几点几分几秒。
二、重要的数字两三个源同时打,对得上再往下走,对不上就停。
三、很多接口超了额度不报错,给你空值或者旧值,比报错更危险——拿时间戳自己验新鲜度。
二〇一〇年五月六号美股九分钟跌了近千点,监管报告里有个细节:纽交所的报价传到全国行情系统最多慢了五分钟,可报价上带的时间写的却是「当前」(报告结论说这个延迟不是当天暴跌的主因,但确认了现象真的发生过)。连官方系统都有时间戳名不副实的时候,自己接数据怎么能不验。
FinanceBench(二〇二三年的基准)发现:同一个模型,把原始财报整篇喂给它,跟让它自己去检索,成绩能差四倍。模型没换,变化的只是它拿到信息的方式。
这套方法论不只是股票——汇率、油价、竞品价格、库存,凡是要喂实时数据给 AI 的场景,思路都一样:先摸清数据来源的层次,再按场景选路,最后立好用数据的规矩。
商用红线
免费公开接口没有交易所授权、没有服务承诺,源站一改版就失效——只适合自己研究做原型。要进产品、对外发布,走券商或商业数据源,先谈许可。
来源:EP0070 数字人口播(pinpinvoice0717b 音色) · 文本=口播定稿真值 · 时间码 gemini-2.5-pro 逐句对齐(切段并发 ASR, 覆盖 98.2%)
[00:00] AI 炒股,数据到底从哪儿来? 这个问题我最近花了 几天时间,从根上摸了一遍。 市面上所有能拿数据的路子, 我逐家实测, 价格逐家去官网核实, 最后做成了一个网页对照表。 价格、实时性、准确性, 三个维度拉出来横评, 挂在我的博客上, 大家可以去取用。 这期视频呢, 就是把我这次调研的成果, 梳理出来分享给大家。 那在正式开始之前, 有两件事我必须先讲清楚。
[00:27] 第一,策略是人算出来的,AI 干的是执行提效的活儿, 它不会替你变出来一个 能赚钱的策略。 这个认知大家一定要有。 第二,这期内容不是投资建议, 我不推票,不讲买卖时机, 我们只谈技术, 只谈怎么让 AI 把数据这件事儿干得更靠谱。 另外信息源其实分交易 数据和舆情两块,舆情水更深, 今天不展开, 我们只谈交易数据。 其实给 AI 喂股市数据, 市面上是几条完全不同的路,
[00:54] 差别特别大。 很多人以为, 拿数据不就是找个接口嘛, 但真不是这样。 我把它分成了三层架构, 大家可以理解成三个不同的层次。 最底层,我管它叫通道层。 就是那种命令行接口, 或者直连的 API, 拿到的是 tick 级到秒级的行情, 而且几乎不占 AI 的脑子。 像腾讯、新浪、 东方财富的公开行情接口, 都属于这一类。 它们的优势就是快,实时性高。 往上一层,是方法层, 也就是各种 Skills 技能包。
[01:21] 什么技术分析、缠论、希腊字母, 这些技能包本身不产生数据, 它们的数据有多新鲜, 完全看背后连的是哪条通道。 你给它接到秒级通道上, 它就能算秒级的东西; 接到隔天数据上, 算出来的就是隔天的。 再往上,是查询层,也就是各种 MCP。 财报、股东、宏观数据,这些是 MCP 的强项。 但是免费的 MCP,我实测下来, 大多给的是 十五分钟延迟甚至隔天的数据。
[01:48] 它擅长的是广度,不是实时性。 所以你看,同样是拿数据, 这三层架构的延迟、深度、 授权、价格,差别巨大。 这个认知如果没建立起来, 后面很容易踩坑。 那我们先说最让人意外的 一条路,就是免费的这条路。 A 股秒级数据,零成本, 一行命令就接上了, 门槛低到离谱。 我实测了三个源,腾讯、 新浪、东方财富的 公开行情接口。 一行命令打下去, 拿回来的数据带秒级时间戳,
[02:16] 还有五档盘口。 我把这三家同时打同一只票,茅台, 三家的价格一分钱都不差。 免费的东西,还能交叉自证, 这个是我这次调研最大的惊喜。 实话实说,我在测之前, 完全没想到免费接口能 做到这个程度。 那港股的坑就比较有意思了。 同一个域名, 你代码前面多加两个字母, 拿到的是实时价。 我盘中实测, 跟墙上的钟是同一秒。 不加那两个字母,它给你的, 是二十二分钟前的价,
[02:43] 而且不报错。 你如果不拿时间戳去验, 你根本不知道这个数据是旧的。 这个坑我踩了, 所以我一定要告诉大家。 那免费的 MCP 呢? 我拿它去问茅台,它给我的, 是前一天的收盘价, 隔天的数据。 它也不报错,也不觉得有问题。 这种不报错但给你旧数据的 情况,比直接报错更危险, 因为你压根儿不知道出了问题。 而且还有一个问题, 就是工具说明书占脑子。 像 Tushare 的官方 MCP,两百多个工具,
[03:10] 长桥的,一百四十多个, 都是全量常驻在 AI 的上下文里。 你装得越多,AI 越容易挑错工具, Token 烧得也越快。 这个事儿我在上一期视 频里专门讲过, 我管它叫工具税。 所以不是工具越多越好, 你要按需来接。 那说完免费的, 我们来看整个价格阶梯, 以及不同的场景, 你到底该怎么选。 A 股盘中看价, 用免费三源交叉验证, 一分钱不花,秒级数据。 如果你需要历史和广度, 比如做回测,那价格是
[03:37] 十九到二十九美金一个月, 但数据还是十五分钟延迟的。 美股要真实时行情, 最低门槛是 九十九美金一个月, 这是全交易所真实时的最低档。 再往上,一百九十九美金 一个月,tick 级数据, 外加二十年历史, 期权数据也有。那再往上, 就是万元级人民币一年的 终端了,像万得那种, 一个账号一年三万九千八, 几年前媒体报的数。 它买的不只是数据, 是授权、稳定、 还有能对外引用的合规口径。 那券商这条路呢,
[04:05] 长桥出了官方的命令行工具, 明说了是给 AI 用的,tick 级, 带盘口和经纪队列, 还能直接下单,有交易所授权。 富途走本地网关, 也是这个思路。 港美股的深度盘口是 要花钱买的,这个大家要知道。 机构那条路, Anthropic 自己有个金融版, 今年五月上的, 接的是 FactSet、 标普全球、伦交所、晨星这些, 机构报价不公开, 那个不是个人玩的, 知道有这条路就行。 所以,不同的场景,
[04:31] 你选的路完全不一样。 我给大家几个典型的 决策参考:A 股盘中看价, 免费三源交叉,零成本。 美股要真实时行情, 九十九美金那档。 要 tick 级和期权, 一百九十九美金那档。 港美股要盘口深度还要下单, 走券商。 A 股财报、股东、宏观批量研究, Tushare 的积分制, 社区口径大概两百到五百元。 那有人可能就会问了, 为什么价格差这么多? 其实背后的核心,
[04:57] 是授权、数据的深度和广度、 还有服务承诺。 免费接口没有授权, 没有承诺,源站一改版就失效。 商业数据源, 你花钱买的是 稳定性和合规性。 那拿到数据不等于能信, 你一定要立规矩。 我这次调研下来, 给自己定了三条铁律。 第一条,每个数字必须带 自己的时间戳回来。不许 AI 只说最新价, 我要看到那个时间戳, 我自己验新鲜度。 第二条,重要的数字, 两三个源同时打,
[05:25] 对得上再往下走。 免费三源交叉验证, 就是这条规矩的实践。 第三条,很多接口超了 额度不报错,给你空值, 或者给你旧值。 这个比报错更危险。 所以你一定要拿时间戳自己验。 那说到这,我想起一个案例。 二〇一〇年五月六号, 美股九分钟跌了将近一千点, 后来监管报告里有个细 节:纽交所的报价, 传到全国行情系统, 最多慢了五分钟, 可报价上带的时间, 写的却是当前。 报告结论说, 这个延迟不是当天暴跌的
[05:51] 主要原因, 但它确认了这个现象真的发生过。 你看,连官方系统都有这 种时间戳名不副实的情况, 我们自己接数据, 怎么能不验呢? 还有一个研究,叫 FinanceBench, 二〇二三年的基准。 它发现同一个模型, 你把原始财报整篇喂给它, 跟让它自己去检索, 成绩能差四倍。模型没换, 变化的只是它拿到信息的方式。 这恰恰说明,数据喂法本身, 就是能力的一部分。 你喂的数据不准、不及时,
[06:18] AI 再聪明也给不出靠谱的结果。 那最后一点,商用红线。 免费公开接口, 没有交易所授权, 没有服务承诺, 源站一改版就失效。 只适合自己研究做原型。 你要进产品,对外发, 一定要走券商, 或者商业数据源,先谈许可。 这个雷不能踩。 搞清楚这套东西,AI 才能真正帮你干活。 而且这个方法论, 可以平移到一切实时数据上。 汇率、油价、竞品价格、库存,
[06:46] 但凡需要实时信息的场景, 思路都是一样的 先摸清数据来源的层次, 再按场景选路, 最后立好用数据的规矩。 完整的对照表,价格、实时性、 准确性横评, 我放在博客里了, 大家 Google 搜张拼拼就能找到。 这期内容就是这样, 我们下期再见,拜拜。