澜雨星河

让每一条数据,都经得起检验。

澜雨星河是一家 AI 数据服务公司,为模型研发团队与企业提供数据标注、RL / 后训练数据与 Benchmark 评测数据。

合作保障

为模型研发团队生产训练与评测数据。从理解任务、组建团队,到审核与验收,每一步都有规范、有记录、可追溯。

按项目组建团队

每个项目,都有匹配的人

根据任务所需的领域、语言与难度,筛选标注、专家与审核人员,培训考核通过后才上岗。

了解团队与领域
任务需求 · 人员匹配演示数据
领域 · 数学推理语言 · 中文 / 英文难度 · 专家级
  • E-0315数学 · 博士
  • A-1024数学 · 研究生
  • A-1186统计 · 研究生
  • A-2077物理 · 本科
  • A-3302英语 · 本科
经专标标审团队已组建 · 待培训考核
01 / 04·继续滚动查看下一项

核心服务

三条数据主线,覆盖从训练到评测

从传统感知任务到大模型后训练与评测,同一套人员组织与质量体系,支撑不同类型的数据交付。

标注工具 · frame_000128已标注 0 / 6
#1 car#4 pedestrian

属性

car

遮挡 · 无

截断 · 否

依据规范 v1.3

本图进度提交审核

01 · Annotation

传统数据标注

面向感知与理解类模型,完成图像、视频、语音、文本与点云等数据的标注、清洗与结构化。

任务形式

  • 分类与属性标注
  • 目标检测与分割
  • 关键点与轨迹
  • 语音转写与切分
  • 实体、关系与意图
  • 清洗、去重与筛选

交付内容

  • 按约定格式的标注结果
  • 标注规范与版本说明
  • 质检与验收记录
偏好判断 · 科普问答第 42 / 200 条

提示词 · 用一句话向初中生解释:为什么天空是蓝色的?

回答 A

因为天空反射了海洋的颜色,所以看起来是蓝色。

回答 B

阳光里的蓝光更容易被空气散射到四面八方,所以天空是蓝色。

判断A 更好相当B 更好
理由事实准确表达易懂回答完整

写下判断理由…

提交

02 · Post-training

RL / 后训练数据

为大模型的监督微调与强化学习阶段提供人工撰写、对比判断与专业反馈数据。

任务形式

  • SFT 指令与回答撰写
  • 偏好对比与排序
  • 回答批改与改写
  • 推理过程审校
  • 工具调用与多步任务轨迹
  • 安全与红队数据

交付内容

  • 训练样本与元数据
  • 判断理由与依据
  • 一致性与抽检统计
评测题 #207 · 数学 · 专家级评审 A

求函数 f(x) = x³ − 3x 在区间 [−2, 2] 上的最大值,并说明理由。

模型回答 · 令 f′(x) = 3x² − 3 = 0,得 x = ±1;f(−1) = 2,所以最大值为 2,在 x = −1 处取得。

  • 结论正确:最大值为 22
  • 正确求导并找到驻点 x = ±13
  • 比较驻点与区间端点,取值完整3
  • 推理过程清晰、无多余结论2
得分0 / 10评审 B:7 / 10 · 一致

03 · Evaluation

Benchmark 与评测数据

构建难以靠捷径解决的评测任务,用清楚的评分标准和专家判断度量模型的真实能力。

任务形式

  • 任务与题目构建
  • 参考答案与依据
  • 评分标准(Rubric)设计
  • 专家评测与盲评
  • 难度与一致性校验
  • 版本与泄漏控制

交付内容

  • 评测任务集
  • 参考答案与评分说明
  • 评审记录与一致性报告

参与 Agents’ Last Exam(ALE)、Humanity’s Last Exam(HLE)相关项目的数据工作。

数据样例

每类数据,都有明确的交付结构

以下为演示数据,展示三类任务的标注方式与交付格式,可以直接操作。正式合作前,我们会按你的需求制作试标样例。

拖动滑块,对比原始图像与标注结果。

演示用街景:近处一辆银色轿车、斑马线上的行人与红色信号灯
原始图像标注结果
演示图像由 AI 生成,不含真实个人信息
交付文件 · frame_000128.json
1// 每张图交付一条记录;字段与坐标约定写在《道路场景标注规范 v1.3》
2{
3 "image": "frame_000128.jpg", "size": [1586, 992],
4 "objects": [
5 // 框 bbox = [左上角 x, 左上角 y, 宽, 高],单位像素
6 {"id": 1, "label": "car", "bbox": [85, 506, 527, 320], "occluded": 0},
7 // 远处的小目标同样要标:规范要求最短边 ≥ 20 像素即需标注
8 {"id": 2, "label": "car", "bbox": [981, 558, 38, 32], "occluded": 0},
9 {"id": 3, "label": "car", "bbox": [1034, 557, 35, 31], "occluded": 0},
10 // 行人:框 + 11 个关键点 [x, y, 是否可见],并记录动作
11 {"id": 4, "label": "pedestrian", "bbox": [1145, 475, 151, 250], "action": "crossing", "keypoints": [[1220, 492, 2], …]},
12 // 属性随类别而定:信号灯需记录当前灯色
13 {"id": 5, "label": "traffic_light", "bbox": [1401, 44, 68, 164], "state": "red"},
14 // 区域类目标用多边形顶点表示
15 {"id": 6, "label": "crosswalk", "polygon": [[612, 683], [1458, 683], [1586, 736], …]}
16 ],
17 // 审核留痕:由谁标注、由谁审核、经过几轮
18 "qa": {"annotator": "A-17", "reviewer": "R-03", "rounds": 2, "result": "pass"}
19}
6 个目标 · 4 类 · 2 轮审核通过。交付格式按项目约定,如 COCO、YOLO 或自定义 JSON;悬停任一行可在左图定位。

团队与领域

按项目组建专业的数据团队

我们组织大量标注与专业人员,并按项目所需的领域、语言与难度单独组建团队。所有人员完成培训与考核后才进入生产,由审核与质检人员全程把关。

选择任务领域

适合任务

图像、文本、语音等通用任务

筛选与上岗

  1. 1规范考试
  2. 2试标合格后上岗
  3. 3持续抽检与复训

团队构成

通用标注
  • PM项目经理
  • 标注标注员
  • 审核审核员
  • QA质检

人员组织方式

  1. 01

    招募筛选

    按领域、语言与学历背景定向招募。

  2. 02

    培训考核

    围绕项目规范培训,考核通过后进入试标。

  3. 03

    试标校准

    与审核结果比对,持续校准判断尺度。

  4. 04

    分级上岗

    按准确率与稳定性分级,匹配不同难度任务。

质量体系

六个环节,保障每一批交付的质量

每个环节都有明确的参与人员、检查点和产出物。左侧是各环节产出物的样例;正式项目中,进度与质检记录按约定同步给你。

  1. 01

    需求澄清

    明确任务目标、数据范围、交付格式与验收标准,确认双方对「好数据」的定义一致。

    参与人员
    项目经理 · 你的项目负责人
    检查点
    目标、范围、格式、验收标准逐项书面确认
    产出
    需求确认单

    需求确认单示例

    任务类型2D 目标检测 + 行人关键点
    数据规模约 20,000 张道路图像
    标签体系12 类,含遮挡、截断、灯色等属性
    交付格式COCO JSON,每批附质检报告
    质量要求抽检准确率 ≥ 98%
    交付节奏每周一批,共 6 批
    验收方式双方各抽检 5%,结论书面确认
  2. 02

    规范制定

    编写标注规范,为每个标签写清定义、正例与反例,整理边界案例与争议处理方式。

    参与人员
    项目经理 · 领域专家
    检查点
    每个标签都有定义、正例与反例
    产出
    标注规范 v1.0

    标注规范 v1.0示例

    1. 1任务说明
    2. 2标签体系(12 类)
    3. 3框选规则
    4. 4属性定义
    5. 5边界案例(36 例)
    6. 6质检标准

    4.2 遮挡(occluded)

    可见部分超过一半时正常框选;不足一半时只框可见部分,并将 occluded 记为 1。

    ✓ 正例:只框可见车身✕ 反例:按想象补全
  3. 03

    小样试标

    先小批量试做,由你确认结果;按反馈修订规范,再决定是否放量。

    参与人员
    标注员 · 审核员 · 你
    检查点
    试标结果经你确认后才进入批量生产
    产出
    试标反馈与规范 v1.1

    试标反馈与规范 v1.1示例

    200

    试标条数

    9

    发现问题

    3

    规范修订

    框选偏差4
    漏标小目标3
    属性错误2

    客户反馈:远处车辆也需要标注。→ 规范 v1.1 新增 2.4「小目标」规则

  4. 04

    校准培训

    按最终规范统一培训与考核,比对标注员之间的一致性,达标后才上岗。

    参与人员
    全体标注与审核人员
    检查点
    考核成绩与两两一致率均达到约定线
    产出
    培训考核记录

    培训考核记录示例

    • A-1196 达标
    • A-1494 达标
    • A-1793 达标
    • A-2091 达标
    • A-2388 复训
    • A-2695 达标
    • 竖线为上岗线 90 分

    两两一致率,颜色越深越一致

  5. 05

    生产与多级审核

    生产中逐级审核与抽检,问题条目退回返修,每批出具质检报告。

    参与人员
    标注员 · 一审 · 二审 · 质检
    检查点
    每批按比例抽检,不达标整批返修
    产出
    质检报告

    质检报告示例

    500

    第 3 批抽检

    98.6%

    抽检准确率

    7

    退回返修

    框选偏差3
    属性错误2
    漏标2

    各批抽检准确率

    第1批 96.9%
    第2批 98.1%
    第3批 98.6%
  6. 06

    验收交付

    按约定格式分批交付,附质检报告与变更记录,配合你抽检验收。

    参与人员
    项目经理 · 你
    检查点
    你抽检通过后才算完成该批交付
    产出
    交付包与验收记录

    交付包与验收记录示例

    • annotations_b03.json3,200 条标注
    • images_b03.csv图像清单
    • spec_v1.1.pdf标注规范
    • qa_report_b03.pdf质检报告
    • changelog_b03.md变更记录

    客户抽检 160 条✓ 第 3 批验收通过

代表案例

代表项目

项目按保密约定匿名呈现,说明客户面对的问题、我们承担的工作与交付内容。

Benchmark · HLE 相关项目 01

高难度跨学科评测题目构建

问题
需要一批模型难以通过检索或套路解决、但人类专家可以给出确定答案的题目。
我们的角色
题目征集与初筛、专家审核、参考答案与依据核验。
交付内容
题目、参考答案、解题依据与审核记录。

结果

待补充可公开的结果

Agent 评测 · ALE 相关项目 02

长流程职业任务的评测设计

问题
评测智能体完成真实职业任务的能力,任务步骤长,结果难以用单一答案判定。
我们的角色
任务场景设计、评分标准撰写、专家评测与一致性复核。
交付内容
任务说明、评分标准、评审记录与一致性报告。

结果

待补充可公开的结果

后训练数据项目 03

多领域偏好对比与回答批改

问题
模型团队需要稳定、可解释的人类偏好信号,用于后训练阶段。
我们的角色
领域人员匹配、判断标准校准、偏好标注与理由撰写、抽检返修。
交付内容
偏好对数据、判断理由与一致性统计。

结果

待补充可公开的结果

关于我们

关于澜雨星河

澜雨星河是一家 AI 数据服务公司。我们组织多领域的标注、专家与审核人员,为模型研发团队、AI 企业和研究机构生产训练与评测数据。

我们以项目制或长期合作的方式承接需求,按双方确认的规范、周期与验收标准交付,并对数据与项目信息严格保密。

合作方式

  • 01

    项目制交付

    按单个项目确定范围、规范、周期与验收标准。

  • 02

    长期合作团队

    为持续迭代的数据需求保留稳定的人员与流程。

  • 03

    评测专项

    围绕一次评测或 Benchmark 建设组织专家团队。

人才招募 · 独立入口

加入澜雨星河

标注员、领域专家、审核质检与项目经理

从一次小样试标开始

告诉我们数据类型、规模与质量要求,项目负责人会与你确认需求,并安排小样试标。