Extrio · AI 网页数据采集平台 | 邓枭雄项目案例
精选案例

个人项目 · 自托管 Alpha · 官网已上线

Extrio · AI 网页数据采集平台

AI 辅助接入,人工审核规则,持续采集可追溯数据

面向标讯与公开信息采集,让 AI 辅助生成和修复规则,由人审核发布;生产采集执行冻结规则,保留样本、质量判断与来源证据。

我的工作:产品定义 · 规则与运行模型 · 全栈实现与验证

从候选规则到可信采集

本地历史记录展示 AI 修复、人工审核后的冻结规则,以及生产样本的质量判断。

Extrio AI 规则修复任务与样本结果
候选规则与样本结果:AI 任务记录候选规则、样本验证、模型调用与审核结果。图中是一次本地历史任务,不是通用性能基准。
01 / 03

交付与验证

将来源接入、AI 规则生成、样本检查、人工审核、确定性采集与质量交付组织为同一流程;实现真实前后端、运行记录、数据检索、导出及证据追溯。

真实采集与审核流程
前后端、SQLite/PostgreSQL 专项与浏览器路径已有验证
生产执行不依赖 LLM
AI 用于接入和修复,已发布采集按冻结规则运行

自托管 Alpha,核心流程已有实现与本地验证。

2026-09-06 交付记录包含前后端测试、真实鉴权 API、筛选导出和桌面页面检查。字段版本与迁移、完整外部交付、生产恢复和规模验证仍有后续工作,不能把界面或自动化通过视为完整生产验收。

项目性质

个人研发项目,与任职期间的标讯产品原型分开。截图来自本地系统中的历史公开网页样本和运行记录,不包含公司内部业务数据,也不代表当前网站兼容性、客户采用或商业规模。

关键产品决策

01

为什么不让 LLM 每次直接采集?

选择: AI 在接入或规则失效时提出候选;人工审核后冻结规则,生产执行确定性流程。

取舍: 相同页面应得到可复现的提取结果,也需要控制持续运行成本。代价是网站变化后要修复并重新审核规则,而不是让模型在生产中自由改变行为。

02

采到数据之后,为什么还要允许拒绝?

选择: 将抓取成功与质量接收分开,保留原文、字段证据、拒绝原因和运行版本。

取舍: 缺字段或不符合要求的结果不能只因请求成功就进入下游。可解释的拒绝比表面高成功率更有价值,同时需要运营人员处理真正有意义的异常。

项目背景与实现范围

业务问题

多源网页持续变化,手工维护采集规则成本高;直接让模型处理每一页又难以稳定复现。产品需要兼顾接入效率、运行成本与数据质量,并让人工接管发生在明确位置。

esc