AI 标讯采集平台 | 邓枭雄项目案例
公司项目 · 已进入研发阶段

AI 标讯采集平台

从入口 URL 开始完成 AI 规则识别、样本回归、人工审核、生产采集和失败恢复;4 周从需求沟通推进到研发阶段,目前处于开发中。

我的工作

4 周从需求沟通完成产品结构、Agent 工作流和交互原型,并进入研发阶段,目前处于开发中;在线原型可演示接入、审核、采集与失败恢复。

可核验证据
4 周进入研发阶段 完成需求沟通、产品结构、Agent 工作流和交互原型
故障 → 诊断 → 恢复 可恢复问题自动重试,结构与访问问题进入人工诊断
公开边界

面向标讯采集业务的公司项目。我负责产品结构、Agent 工作流、规则与运行模型及交互原型,4 周从需求沟通推进到研发阶段,目前处于开发中。在线演示只使用模拟数据,不含公司、客户或真实标讯信息,也不公开内部代码。

75 秒产品导览

从 URL 接入到失败恢复。

用三个关键界面走完标讯网站的接入与运行闭环:先让 AI 生成并验证规则,再核对采集结果,最后处理生产故障。

标讯智采平台 AI 分析工作台,展示字段规则、置信度、样本回归和人工审核
01 / AI 接入

在同一页完成字段识别、样本回归与人工审核

输入网站入口后,Agent 识别标题、详情链接、发布时间和原始数据规则,并展示置信度与试采集样本;人工确认后再发布。

01 / 03
案例主线

从产品问题到可验证交付。

01 / 业务问题

网站结构持续变化,规则生成、结果核对和失败排查都依赖人工。

招投标信息来源分散,不同网站在页面结构、访问方式和字段质量上差异很大。一次性脚本难以维护,采集失败后也缺少统一上下文。

核心问题:接入效率、生产稳定性和结果可核对性需要在同一套工作流中解决。
02 / 我的判断

把 AI 放在识别与诊断环节,把发布与接管留给人。

产品以网站为中心组织规则、计划和运行记录。Agent 生成规则并运行样本回归,人负责发布;系统再按故障类型决定自动重试或进入人工诊断。

关键取舍:不追求无人值守,而是让自动化拥有清晰的人工作业点与失败出口。
03 / 可验证交付

4 周完成产品方案并进入研发阶段。

从需求沟通到产品结构、Agent 工作流和交互原型在 4 周内完成;项目目前处于开发中,在线原型覆盖 URL 接入、AI 字段识别、样本回归、规则审核、采集记录、原文查看和失败队列。

当前可核验:4 周产品交付周期、研发阶段状态、在线交互原型和三组关键业务界面。

对象模型

01

AI Analysis

从入口 URL 创建分析任务,识别页面结构、采集字段与访问约束,并用样本回归验证结果。

02

Site Workspace

以网站为中心组织接入信息、采集计划、采集规则和历史运行,减少跨对象查找成本。

03

Collection Execution

记录每次采集的类型、状态、产出与原文样本,让结果能够从批次回到具体内容。

04

Failure Recovery

按故障类型区分自动重试与人工诊断,并把修复、回归和恢复结果留在同一条处理链路中。

关键产品决策

01

Agent 负责识别,人负责发布

选择:Agent 分析页面结构、生成字段规则并运行样本回归,人工查看置信度、样本和原始数据后决定是否发布。

理由:页面识别可以自动化,但生产规则需要明确的人工作业点,避免低质量规则直接进入采集。

02

以网站工作区收拢规则与运行

选择:采集计划、采集规则、访问配置和运行记录都挂在网站下,列表导航只保留接入、运行和治理三组主任务。

理由:官网演示和日常使用都需要快速理解对象关系,以网站为中心比平铺规则、任务和来源对象更直接。

03

采集结果从批次回到原文

选择:执行记录展示批次事实和采集样本,原文库保留正文、来源地址和对应运行记录。

理由:标讯结果需要被核对;从批次直接查看内容,比只展示成功数量更能证明采集质量。

04

失败按自动与人工两条路径处理

选择:超时和临时服务错误进入自动重试,规则失效、反爬拦截等问题进入 AI 辅助的人工诊断。

理由:不同故障需要不同责任边界,先分流再处理可以减少人工噪声,也保留必要的接管能力。

下一步

查看完整经历,继续聊聊产品与岗位。

下载与当前方向匹配的简历,或通过邮件、电话直接联系。

下一个案例 · 05 / 10 Multica AI Coding 开源实践
esc