从全网爬取、三阶段流水线筛选、自动生成高质量问答数据。不依赖任何外部模型 API,全部推理在本地完成。
原始爬取数据依次通过问答判断、质量筛选、内容优化三个阶段,每一阶段使用本地训练的逻辑回归权重进行推理,不依赖任何外部模型 API。
识别内容是否为有效的问答对。通过问题标记词、问答配对特征、文本长度等三维特征评分,过滤非问答内容。
对已确认的问答对做二次质量评估。低质量灌水、WAF 拦截页、付费墙截断、重复与近似冗余内容在此阶段被剔除。
对高质量问答进行格式规范化。统一问答标记、去除抓取噪声与多余空白、修复截断,输出结构一致的最终数据。
从关键词分发到落盘,全流程异步并发。以下为单个批次(约 300 条目标)在 4 核 8G 环境下的典型耗时。
将关键词池按哈希切分为互不重叠的桶,每个平台领取独立词桶;单浏览器实例内创建多个隔离上下文,共享渲染进程以压低内存占用。
异步事件循环下驱动各上下文,按平台反爬强度动态调节请求间隔与滚动深度;遇到验证码或 WAF 拦截时自动跳过并计入失败计数。
逐条执行问答判断、质量筛选、内容优化;全量文本过 SimHash 做近似去重,跨平台的同一问题只保留质量分最高的一条。
写入 JSONL 主文件并同步更新分类倒排索引与统计缓存,供前端秒级查询与分页导出,无需重跑流水线。
通过 Playwright 异步 API 在单个浏览器实例下并发多个上下文,每个平台分配不重叠的搜索词桶,实现高效并行爬取。
每条数据按关键词与语义规则自动归入分类,支持按分类维度单独导出子集用于定向微调。
左侧是推理侧的三个逻辑回归模型,右侧是采集与调度侧的运行参数。整套系统离线可跑,无外部依赖。
输入一段文本,前端完整复现三阶段流水线的推理过程——包括特征值、z 值、sigmoid 概率与最终优化结果。
输入需要生成的问答对数量,点击生成即可预览并下载。支持 JSONL、JSON、CSV 三种格式。
注:本页为纯前端演示,数据在浏览器本地合成;接入后端后可直连真实数据库。生成内容请自行审核后使用。
三个阶段的判定任务本质上都是低维特征的二分类,逻辑回归足够胜任且可控。调用外部模型 API 意味着每条数据都要付一次推理成本、引入网络延迟,还会让产出的判定标准不可复现。本地权重文件几 KB,可以在任何环境离线跑。
大部分损耗发生在"问答判断"阶段——网页里真正成对出现的问答只占抓取文本的一小部分。后续版本会在解析层就做结构化抽取,把明显非问答的内容在进入流水线前丢掉,从而把带宽用在刀刃上。
建议先做一轮人工抽检。流水线能保证格式一致、去重和基本的问答结构,但无法保证答案的技术正确性——爬来的内容本身就可能有错。按分类维度导出子集、小批量试训、看效果再放量,是比较稳妥的路径。
关键词是一个纯文本池,按哈希分桶后分发给各平台,直接往池子里加词即可。新增平台需要补一个解析器,说明列表页选择器、详情页正文选择器和翻页逻辑,其余并发调度与后处理流程可以复用。