数据生成

专为你所创造的 AI 模型深度服务

从全网爬取、三阶段流水线筛选、自动生成高质量问答数据。不依赖任何外部模型 API,全部推理在本地完成。

SCROLL
0
总产出问答对
0
搜索关键词
0
数据平台
0
分类维度

每一道数据
都经过三重审视

原始爬取数据依次通过问答判断、质量筛选、内容优化三个阶段,每一阶段使用本地训练的逻辑回归权重进行推理,不依赖任何外部模型 API。

STAGE 01

问答判断

识别内容是否为有效的问答对。通过问题标记词、问答配对特征、文本长度等三维特征评分,过滤非问答内容。

Features3
Threshold0.500
ModelLogReg
STAGE 02

质量筛选

对已确认的问答对做二次质量评估。低质量灌水、WAF 拦截页、付费墙截断、重复与近似冗余内容在此阶段被剔除。

Features3
Threshold0.500
DedupSimHash
STAGE 03

内容优化

对高质量问答进行格式规范化。统一问答标记、去除抓取噪声与多余空白、修复截断,输出结构一致的最终数据。

FormatJSONL
Fields6
RulesRule-based

一次完整任务
的生命周期

从关键词分发到落盘,全流程异步并发。以下为单个批次(约 300 条目标)在 4 核 8G 环境下的典型耗时。

00:00任务分发

关键词分桶 & 上下文创建

将关键词池按哈希切分为互不重叠的桶,每个平台领取独立词桶;单浏览器实例内创建多个隔离上下文,共享渲染进程以压低内存占用。

7 上下文 · 并发就绪
02:40并发采集

Playwright 异步抓取

异步事件循环下驱动各上下文,按平台反爬强度动态调节请求间隔与滚动深度;遇到验证码或 WAF 拦截时自动跳过并计入失败计数。

约 120 页 / 分钟
08:15流水线处理

三阶段推理与去重

逐条执行问答判断、质量筛选、内容优化;全量文本过 SimHash 做近似去重,跨平台的同一问题只保留质量分最高的一条。

通过率约 34%
09:02落盘输出

结构化写入 & 索引更新

写入 JSONL 主文件并同步更新分类倒排索引与统计缓存,供前端秒级查询与分页导出,无需重跑流水线。

JSONL / JSON / CSV

七大平台
并发采集

通过 Playwright 异步 API 在单个浏览器实例下并发多个上下文,每个平台分配不重叠的搜索词桶,实现高效并行爬取。

CSDN 博客
技术文章
312
CSDN 问答
技术问答
486
掘金
开发者社区
294
博客园
技术博客
271
V2EX
创意工作者社区
218
腾讯云社区
云开发社区
205
InfoQ
架构师社区
192
更多平台
持续扩展中

二十四个
技术分类

每条数据按关键词与语义规则自动归入分类,支持按分类维度单独导出子集用于定向微调。

模型与工程
两条腿走路

左侧是推理侧的三个逻辑回归模型,右侧是采集与调度侧的运行参数。整套系统离线可跑,无外部依赖。

推理层 · Model

三个独立训练的逻辑回归模型,串联成流水线
  • 分类器类型Logistic Regression
  • 特征维度3 (qa / pair / len)
  • 激活函数Sigmoid
  • 判定阈值0.500
  • 外部模型 API0 次调用
  • 单条推理耗时~0.02 ms

采集层 · Crawler

Playwright 异步驱动,多上下文并发
  • 浏览器实例1 × Chromium
  • 并发上下文7
  • 关键词池9,000
  • 去重算法SimHash 64-bit
  • 输出格式JSONL / JSON / CSV
  • 字段数6

试试看

输入一段文本,前端完整复现三阶段流水线的推理过程——包括特征值、z 值、sigmoid 概率与最终优化结果。

等待输入...

生成数据

输入需要生成的问答对数量,点击生成即可预览并下载。支持 JSONL、JSON、CSV 三种格式。

注:本页为纯前端演示,数据在浏览器本地合成;接入后端后可直连真实数据库。生成内容请自行审核后使用。

生成数量
格式
已生成0 条
平均质量分
大小
状态就绪
数据源本地演示
正在生成问答数据… 0%
数据预览 · 前 5 条

你可能想问

为什么要自己训练逻辑回归,而不直接调用大模型?+

三个阶段的判定任务本质上都是低维特征的二分类,逻辑回归足够胜任且可控。调用外部模型 API 意味着每条数据都要付一次推理成本、引入网络延迟,还会让产出的判定标准不可复现。本地权重文件几 KB,可以在任何环境离线跑。

通过率只有 34%,是不是浪费了大量爬取带宽?+

大部分损耗发生在"问答判断"阶段——网页里真正成对出现的问答只占抓取文本的一小部分。后续版本会在解析层就做结构化抽取,把明显非问答的内容在进入流水线前丢掉,从而把带宽用在刀刃上。

生成的数据能直接用于微调吗?+

建议先做一轮人工抽检。流水线能保证格式一致、去重和基本的问答结构,但无法保证答案的技术正确性——爬来的内容本身就可能有错。按分类维度导出子集、小批量试训、看效果再放量,是比较稳妥的路径。

怎么接入自己的关键词或新平台?+

关键词是一个纯文本池,按哈希分桶后分发给各平台,直接往池子里加词即可。新增平台需要补一个解析器,说明列表页选择器、详情页正文选择器和翻页逻辑,其余并发调度与后处理流程可以复用。