《AI 的网络数据基础设施:模型为何需要实时网页数据》
文章讨论 AI 应用对实时网页数据的依赖,以及发现、访问、转换和治理网络数据如何成为新的基础设施层。
🧠 agentic reading|1️⃣ 精准输入
导语
这篇 MIT Technology Review Insights 的赞助内容讨论 AI 基础设施的新瓶颈:模型越来越强,但企业真正需要的是能持续取得新鲜、相关、可信的网页数据。文章把网页数据访问描述成一个正在形成的基础设施层:它要帮助模型发现、访问、整理和治理不断变化的公共网络信息。
1. AI 的下一阶段依赖新的网络数据基础设施层
AI 应用每天都在增加,但企业要利用这些能力,必须拥有大规模数据。现实问题是,很多相关信息被访问限制挡住,或者以非结构化形式散落在网页里,模型难以直接使用。文章指出,网页本来不是为自动发现和检索而设计的;要让 AI 应用可靠使用网页,就需要专门基础设施。
2. 访问新鲜、相关、可信的数据
2.1 静态训练快照已经不够
- 早期 AI 突破主要来自训练数据和模型规模扩张,但企业现在遇到的新瓶颈,是如何跟上动态、非结构化、持续变化的网页数据。AI 输出越来越依赖计算、网络、检索和数据工程的组合能力,也就是系统快速可靠取得新鲜、相关、可信数据的能力。
- 传统训练依赖某个时间点收集的信息快照。对需要追踪竞争对手价格、消费者情绪、市场趋势的企业来说,静态数据已经不足够。它们需要持续的新信息流,还要带着相关上下文进入模型。
2.2 实时性影响商业决策和用户信任
- Bright Data 首席执行官 Or Lenchner 说,如果模型不能检索实时信息,就缺少上下文;在商业环境中,陈旧答案会导致糟糕决策和失望用户。速度不只是方便问题,因为价格、库存、市场、安全威胁和客户行为都在持续变化。
- 高质量实时网页数据还能减少幻觉,因为模型拥有更贴近当前情况的知识基础。文章引用一项调查:56% 的 AI 从业者认为,企业需要访问实时网页数据来提升用户对 AI 输出的信任。
2.3 检索增强生成仍然需要“AI 就绪数据”
- 即便有检索增强生成,许多 AI 系统仍难以在运营场景中给出当前、相关、可信的结果。Gartner 的说法是,到年底,60% 没有 AI 就绪数据支撑的 AI 项目会被放弃;这里的 AI 就绪数据指准确、结构化、有组织、带上下文的数据。
- 大规模检索本身不能解决问题。系统既要大规模检索,又要实时返回;否则终端用户等待输出时,延迟会变成产品问题。企业还常把公共网页、API、授权数据集和内部专有数据混合使用,这要求把碎片化来源整合成及时可用的知识层。
3. 新基础设施承诺解决什么
3.1 它不只是增加算力,而是模拟真实浏览并结构化网页
- 文章把新基础设施的核心能力概括为:发现数据、实时访问、并按具体上下文裁剪。Lenchner 的说法是,要在规模化、超低延迟、不被阻断的条件下收集数据。
- 这种平台不是单纯靠更多计算,而是模拟人的浏览行为,访问可公开获得的内容,把原始网页代码转成结构化数据流。它需要处理重 JavaScript 网站、反机器人软件、地理位置、语言、格式和访问规则差异。
3.2 规模和合规同样是基础设施问题
- Lenchner 用一个极端规模例子说明难度:基础设施要像真实网页用户一样呈现 IP 地址、位置和上千个参数,并且每天在数百万网站上重复 800 亿次。这里的难点不是“抓一次网页”,而是在巨大规模上持续以网站预期的方式访问和转化数据。
- 持续检索也带来治理问题。文章提出的合规边界包括遵守欧盟通用数据保护条例和加州消费者隐私法案,只处理公开可访问的信息,避免付费墙或私人登录,使用经过审查且基于同意的网络,并给 IP 地址所有者提供激励。
4. 为什么许多公司会寻求专门平台
这种能力很复杂。Lenchner 认为,当它成为公司的关键基础设施时,内部自建会变成一个全职工程问题,并与真正的 AI 工作竞争资源。因此,许多组织会寻找专门用于数据检索、编排和可观测性的工具平台。
Beta Free
注册芝士内参,免费阅读全部文章
内测期全部免费开放,正式版 ¥9.9/月 · ¥99/年。
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。