mt logoMyToken
ETH Gas
EN

90%访客不是人:一个30年电影数据站的"截肢"求生

Favoritecollect
Shareshare

2026 年 3 月 5 日,电影数据网站 The Numbers 突发下线。

对于一个运行了 30 年、拥有约 200 万个页面、积累了 78396 部电影和 236176 人数据的资料库来说,这并不是一次常规的停机维护。一周后的 3 月 13 日,网站以精简版恢复上线,但历史图表、单部电影详情页以及核心的 Report Builder 功能均被移除。

据 Stephen Follows 报道转述创始人 Bruce Nash 的说法,导致这一切的直接原因是 AI 爬虫与智能体流量占其总流量的 90%,服务器持续过载崩溃。与此同时,系统日志还记录到针对后门的恶意攻击行为——攻击的动机可能与预测市场有关,因为 Polymarket 等平台以 The Numbers 的数据作为结算依据,抢先获取数据意味着交易优势。但攻击的具体技术细节和攻击者身份至今未披露,Bruce Nash 本人也没有对此做更多展开。

当人类访客成了零头,流量从资产变成了负债。一个核心问题浮出水面:传统网站是否都面临 The Numbers 式的重构,这个判断的边界在哪里?

截肢求生:一个30年数据站的8天断电史

The Numbers 不是一家初创公司,它是一个活化石。

1997 年 10 月 17 日,Bruce Nash 在 Geocities 上创建了这个网站。那时候互联网还是一片荒原,网页数量稀少,搜索引擎刚刚起步,"爬虫"这个词还没有被赋予今天这种令人焦虑的含义。The Numbers 从一个个人项目慢慢长成了一个行业工具——它追踪票房、记录发行数据、为电影从业者和媒体提供权威的数字参考。

在 AI 爬虫大军压境之前,The Numbers 的年访客量超过 800 万。对于一个垂直数据网站来说,这是一个相当可观的规模。它的数据库里存着 78396 部电影、178375 条发行记录和 236176 人的信息,页面总量约 200 万,源文件约 16 万个。这些数字在人类浏览时代是宝贵的数据资产,是网站的核心竞争力。

但在 2026 年 3 月的那 8 天里,这个老牌站点经历了一场断电式的生存危机。

Bruce Nash 透露,在旧系统时代,团队 90% 的时间都花在了维持网站运行上,而不是开发新功能或优化数据。这个数字本身就说明了很多问题:一个运行了 30 年的系统,其技术债务已经积累到了令人窒息的程度。16 万个源文件意味着无数的依赖关系、过时的框架、被遗忘的脚本和没人敢动的"黑箱"模块。每修一个 bug 可能引发三个新的崩溃,每加一个功能可能拖垮一个未知的子系统。

当 AI 爬虫的流量洪峰到来时,这个旧架构显得毫无招架之力。

这里需要理解一个关键的技术细节:传统数据型网站的架构通常是为人类浏览设计的。一个用户访问一个页面,服务器渲染一次 HTML,返回一次响应,用户停留几秒后离开。这种模式下,服务器的并发压力是可控的,因为人类浏览有天然的"节流"机制——人需要时间阅读,不会在一秒内请求几百个页面。

但 AI 爬虫没有这种节流。它们以机器速度运作,可以在极短时间内发起海量请求,不需要"阅读"时间,不需要等待页面渲染完成,甚至不需要遵守合理的请求间隔。当一个为人类浏览设计的旧架构,遭遇以机器速度发起的指数级请求时,结果就是服务器持续过载、数据库连接池耗尽、响应时间飙升,最终崩溃。

The Numbers 的旧系统在这种冲击下,已经没有修补的空间。你可以优化一个查询,但 16 万个源文件中可能藏着无数个低效查询;你可以加一台服务器,但旧架构可能不支持水平扩展;你可以加缓存,但 200 万个页面的缓存命中率在长尾分布下极低。修补旧系统的边际成本,远高于在全新基础设施上重建。

恢复上线的精简版网站,不是一次功能升级,而是一次截肢式收缩。砍掉历史图表和详情页,意味着放弃了大量长尾内容——那些页面恰恰是 AI 爬虫最喜欢抓取的目标,因为它们包含结构化的、可被直接消费的数据。移除 Report Builder,意味着砍掉了核心的付费工具属性,牺牲了产品的商业价值来换取基础设施的生存。

这种决绝的收缩背后,是旧架构在新型流量面前已无修补价值的残酷现实。放弃 30 年的积累,本身就是判断"重构必要性"的最好样本。

1:38000的掠夺:被打破的流量默契

要理解 The Numbers 为什么会被压垮,必须看清 AI 爬虫与传统搜索引擎爬虫在行为逻辑上的本质区别。

在过去的互联网生态中,网站与搜索引擎之间存在一种心照不宣的价值交换默契:网站允许搜索引擎抓取内容,搜索引擎则通过搜索结果为网站带来人类访客。这种默契建立在相对合理的"交换比"之上。据 Cloudflare 数据显示,Google 每发送 1 个人类访客,大约会抓取 5 个页面。这个比例意味着,网站为搜索引擎付出的带宽成本,可以通过搜索引擎回流的人类流量来变现——通过广告、通过订阅、通过品牌曝光。这是一笔算得过来的账。

然而,AI 爬虫的出现彻底打破了这种平衡。

同样是 Cloudflare 的数据,OpenAI 每发送 1 个访客,会抓取超过 1000 个页面;而 Anthropic 的交换比更是达到了惊人的 1:38000 以上。这意味着什么?意味着一个 AI 爬虫在消耗你服务器资源的同时,几乎不带来任何等价的人类流量回馈。它拿走你的数据,用来训练模型或生成搜索摘要,但用户最终消费这些数据的场景不在你的网站上——他们在 ChatGPT 里提问,在 AI 搜索引擎里看摘要,你的网站只是数据供应链上一个看不见的底层供应商。

这种单向的掠夺式抓取,直接导致了流量结构的倒挂。

据 Cloudflare 雷达数据,截至 2026 年 6 月,机器人占 HTML 页面请求的比例已经达到 57.5%,人类流量成了少数。HUMAN Security 的 2026 年报告更是指出,智能体流量在 2025 年增长了 7851%,AI 驱动流量整体增长了 187%,自动化流量的增速是人类流量的 8 倍。Thales 的 Bad Bot Report 也给出了类似的判断:2025 年机器人占全球网页流量的 53%。

这些数字指向一个共同的结论:互联网的流量主体已经从人类变成了机器。

在 The Numbers 的案例中,90% 的流量来自机器。这些机器访客不点广告、不买订阅、不产生任何商业价值,却真实地消耗着带宽和算力。传统的"允许抓取以换取流量"的商业逻辑,在 1:38000 的交换比面前彻底失效。数据型网站的生存根基——用免费内容吸引人类流量,再通过人类流量变现——正在被这种不对等的流量结构动摇。

更值得警惕的是,这种流量结构的变化不是暂时的。随着越来越多的 AI 应用依赖实时数据抓取——AI 搜索、AI 助手、AI 智能体——机器流量的占比只会继续上升。据 Cloudflare 数据,2026 年上半年的 AI 爬虫请求中,52.3% 用于训练,34.2% 用于混合用途,10.1% 用于搜索,只有 2.6% 是用户触发的。这意味着绝大多数 AI 流量是"主动抓取"而非"被动响应",它们不会因为人类用户减少而减少。

算不清的服务器账:机器访客的真实成本

机器流量到底要花多少钱?The Numbers 并未公开具体的带宽或服务器成本金额,但我们可以从其他同类案例中窥见一斑。

开源文档托管平台 Read the Docs 曾在官方博客中披露过一个令人震惊的数字:单个 AI 爬虫在一个月内就给他们带来了 73TB 的带宽消耗,成本超过 5000 美元。对于一个非营利组织来说,这是一笔足以危及生存的额外开支。更令人愤怒的是,Read the Docs 发现这些爬虫并不总是遵守 robots.txt 的规则——它们可以无视网站的抓取限制,以自己的节奏和方式获取数据。

维基媒体基金会的处境更为典型。据其官方博客透露,多媒体内容的带宽需求自 2024 年初增长了 50%,而其中 65% 的昂贵流量来自机器人,尽管这些机器人仅占页面浏览量的 35%。这意味着维基百科在为机器访客支付不成比例的基础设施成本。更严峻的是,由于 AI 搜索摘要的普及,用户越来越不需要点击进入 Wikipedia 页面就能获得答案——Wikipedia 的人类流量在 2025 年 5 至 8 月间同比下降了 8%。流量成本在上升,而能够变现的人类流量在下降,这种剪刀差正在吞噬内容平台的利润空间。

维基百科的情况揭示了一个更深层的问题:AI 不仅在消耗网站的带宽,还在截断网站的人类流量来源。当 AI 搜索引擎直接在搜索结果页面给出答案摘要,用户就没有理由再点击原始链接。这意味着网站不仅为 AI 爬虫付了带宽费,还因为 AI 搜索摘要的存在而失去了本应回流的人类访客。这是一种双重打击:成本上升,收入下降。

对于中小团队来说,情况更为绝望。代码托管服务 SourceHut 的创始人 Drew DeVault 在博客中愤怒地表示,他每周有 20% 到 100% 的运维时间都在用于对抗爬虫,网站每周因此发生数十次短暂宕机。他的愤怒是直接而真实的:"停止把你的成本外部化到我脸上。"这不是一个技术问题,而是一个公平问题——AI 公司把数据抓取的成本转嫁给了内容生产者。

LWN 的编辑 Jonathan Corbet 甚至直接将这种爬虫流量定性为"就是 DDoS 攻击"。Triplegangers,一个只有 7 人的电商公司,曾因 OpenAI 的 GPTBot 在营业时段疯狂抓取而导致网站宕机,其 CEO 称这"基本就是 DDoS 攻击"。iFixit 则记录到 Anthropic 的 ClaudeBot 在单日内对其网站发起了近 100 万次请求。

这些案例证明,机器流量不是虚拟的数字,它是真实的带宽费用、真实的 CPU 占用、真实的运维人力。当 The Numbers 的服务器在 90% 的机器流量下持续过载崩溃时,Bruce Nash 面对的不是一个技术优化问题,而是一个算不清账的生存问题。

可以做一个粗略的推演:如果 The Numbers 的年访客量超过 800 万,而机器流量占 90%,那么机器请求量至少是数千万级别甚至更高(考虑到爬虫的抓取深度远超人类浏览)。即使每次请求的成本极低,累积起来的带宽和算力消耗也足以让一个没有企业级基础设施支撑的独立团队入不敷出。Bruce Nash 选择放弃旧系统,不是因为他不懂技术,而是因为在旧的成本结构下,这个网站已经无法维持。

哪些网站最脆弱?重构必要性的判断边界

The Numbers 的倒下,是否意味着所有网站都必须立即重构?答案是否定的。重构的必要性取决于网站的类型和流量结构。

最脆弱的是像 The Numbers 这样的数据密集型网站。它们通常具备几个共同特征。

第一,长尾页面多。The Numbers 有 200 万个页面,每一个页面都是 AI 爬虫可以抓取的目标。长尾页面越多,爬虫的抓取面就越大,服务器需要响应的请求就越多。一个只有几十个页面的企业官网,即使被爬虫盯上,也不会有太大的带宽压力。

第二,内容可静态抓取。The Numbers 的数据页面无需登录即可访问,爬虫可以直接获取结构化的票房数据、演员信息、发行记录。这种"裸奔"的数据暴露面,是 AI 爬虫最理想的数据源。

第三,高度依赖人类流量变现。The Numbers 的商业模式建立在"免费内容吸引人类访客→人类访客产生广告收入或付费转化"的逻辑上。当 90% 的流量变成机器流量,这个商业逻辑就失效了——机器不点广告、不买订阅。

Box Office Mojo 和 IMDb 虽然是同类电影数据网站,但它们的抗风险能力远高于独立运营的 The Numbers。Box Office Mojo 被 Amazon 收购后有企业级基础设施支撑,可以承受远超独立站点的流量冲击;IMDb 同属 Amazon 旗下,且有登录墙和付费层(IMDbPro),部分核心数据隐藏在认证之后,爬虫无法像对待 The Numbers 那样无障碍抓取。

相对安全的是几类网站。

交互型网站,如社交平台,其核心内容产生于用户互动,且大量数据隐藏在登录之后,爬虫难以大规模获取。即使爬虫抓取了公开页面,也无法复制社交关系的动态网络。

实时服务类网站,如电商和 SaaS 产品。电商网站的库存和价格实时变动,静态抓取的数据价值有限且时效性极差;SaaS 产品的核心价值在于服务而非数据,爬虫无法直接复制其业务逻辑和后端集成。

有付费墙或认证机制的网站。登录墙天然就是一道流量过滤器,未认证的爬虫只能获取有限的公开内容,无法像对待 The Numbers 那样对全站进行无差别抓取。

因此,判断一个网站是否面临重构压力,关键看两个指标:数据暴露面和流量变现依赖度。如果一个网站的数据可以被轻易抓取(无需登录、内容静态、长尾页面多),且其商业模式高度依赖这些数据带来的人类流量(广告或免费转付费),那么它就是 AI 爬虫的下一个目标。对于这类网站,重构不仅仅是技术架构的升级,更是商业逻辑的重写:如何在机器访客占主导的世界里,找到新的成本分担和价值变现机制。

反过来,如果一个网站的数据暴露面小(登录墙后、实时变动、交互产生),或者其商业模式不依赖人类浏览量变现(B2B 服务、API 授权、企业级合同),那么它暂时不需要像 The Numbers 那样进行截肢式重构。它需要做的是基础的流量监控和防护,但不是推倒重来。

防线与出路:站长的应对路径

面对 AI 爬虫的洪流,站长和开发者能做什么?

最直觉的反应是修改 robots.txt。但现实是,这层防线已经名存实亡。Read the Docs 的案例显示,许多 AI 爬虫可以直接无视 robots.txt 的规则。HUMAN Security 的报告也指出,大量爬虫甚至伪装成合法身份来规避检测。据 Cloudflare 数据,目前只有 7.9% 的 AI 爬虫请求被服务器主动通过 403 状态码拒绝。单靠应用层的规则,已经无法阻挡基础设施层面的流量冲击。

robots.txt 的失效,本质上是因为它是一种"君子协定"——它依赖于爬虫运营商自觉遵守。在搜索引擎时代,Google 等公司有商业动机遵守 robots.txt,因为它们需要与网站保持良好的合作关系以获取持续的内容供给。但 AI 公司的动机不同:它们需要尽可能多的数据来训练模型,遵守 robots.txt 意味着放弃部分数据来源,这在激烈的模型竞赛中是一种竞争劣势。当遵守规则的代价高于违反规则的代价时,君子协定就会崩溃。

真正的应对必须从基础设施层入手。

2025 年 7 月,Cloudflare 推出了 Pay-per-Crawl 机制,允许网站对 AI 爬虫的抓取行为收费。据其官方公告,从 2026 年 9 月 15 日起,Cloudflare 将默认屏蔽未付费的"混合用途"爬虫。这是行业层面试图重建价值交换机制的重要尝试——如果 AI 公司需要数据来训练模型或提供搜索摘要,它们就必须为获取这些数据的带宽和算力成本买单。这个机制的落地效果还有待观察,但它代表了一个正确的方向:将机器流量的成本从内容生产者转移回数据消费者。

对于独立站长和中小创业团队来说,应对路径可以分为几个层次。

第一层是识别。通过日志分析明确 AI 流量的占比和来源,不要把服务器崩溃简单归结为业务增长。很多站长在网站变慢或宕机时,第一反应是升级服务器或优化代码,但如果不识别出机器流量是根因,升级服务器只是用更高的成本延缓崩溃,治标不治本。The Numbers 的案例中,Bruce Nash 发现 90% 流量来自机器,这个认知本身就是决策的起点。

第二层是隔离。利用边缘计算和 WAF(Web 应用防火墙)规则,将机器流量导向静态缓存或轻量级响应,避免直接冲击数据库和动态渲染逻辑。对于数据密集型网站,这意味着将高频请求的页面预渲染为静态文件,让爬虫拿到的是缓存的 HTML 而非实时查询的结果。这不解决根本问题,但可以为重构争取时间。

第三层是重构商业模型。如果 90% 的访客不再是人,那么基于人类浏览量的广告模式就必须调整。可能的出路包括:API 付费访问(让 AI 公司为结构化数据接口付费)、数据授权(将数据作为产品直接授权给 AI 公司)、更深的登录墙(将核心数据移至认证之后,减少暴露面)。这些方向都不是简单的技术调整,而是对网站商业模式的重新定义。

The Numbers 用放弃 30 年旧系统的代价,为整个行业敲响了警钟。在 AI 作为浏览量主力的新时代,流量不再是单纯的资产,它可能是一笔需要仔细核算的负债。传统网站的重构,不是要不要做的问题,而是如何在算清这笔账之后,找到新的生存边界。对于数据密集型、依赖人类流量变现的独立网站来说,The Numbers 的今天可能就是它们的明天。而对于那些数据暴露面小、商业模式不依赖浏览量变现的网站来说,现在要做的,是保持警觉,持续监控流量结构的变化,在机器流量真正成为负担之前,提前布局防线。

互联网的流量主体已经换了。网站的主人,是时候重新算账了。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup