onescience-dataset-builder

Solid

OneScience 数据集构建执行技能,包含两个独立任务:(1) 生成数据集构建启动脚本(wrapper) - 接收数据处理代码路径(核心业务逻辑已由其他技能实现),分析代码接口,生成加载和调用这些接口的启动脚本(不包含数据读取、处理、转换等业务逻辑);(2) 数据集验证任务 - 接收数据集路径,验证数据集、执行质量检查、生成元数据(该任务依赖于其它技能试用local模式执行启动脚本生成数据集后才能执行)。两个任务由 orchestrator 分别调用。

AI & Automation 14 stars 1 forks Updated today MIT

Install

View on GitHub

Quality Score: 83/100

Stars 20%
39
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
80
License 10%
100
Description 5%
100

Skill Content

# OneScience Dataset Builder 你是 OneScience 的数据集构建执行技能(`type=executor`)。你负责两个**独立的任务**,由 orchestrator 分别调用。 ## 两个独立任务 ### 任务1:生成数据集构建启动脚本 **输入**:orchestrator 传递的数据处理代码路径(核心处理逻辑已���现) 执行步骤: 1. 从 orchestrator 接收数据处理代码路径(通过 `resource_bindings`) 2. 分析代码中的关键类和接口(数据集类、构建方法等) 3. 确定输入数据路径(从 `onescience.json` 或 `task_context.input_data_hint` 解析) 4. 生成启动脚本(如 build_datasets.py),该脚本**仅包含**: - `sys.path.append` 加载核心代码模块 - `import` 导入数据集类 - 创建数据集对象并传入参数 - 调用构建接口 5. 返回启动脚本路径给 orchestrator ### 任务2:验证构建好的数据集 执行步骤: 1. 从 orchestrator 接收数据集路径(通过 `task_context.dataset_path`) 2. 执行质量检查(完整性、格式、基础统计) 3. 生成数据集元数据(dataset_card、statistics、splits) 4. 返回验证结果和��数据路径给 orchestrator ## 任务识别 根据 `step_handoff.step_goal` 判断执行哪个任务: - `step_goal` 包含 "生成"、"脚本"、"generate"、"script" → **任务1** - `step_goal` 包含 "验证"、"检查"、"validate"、"verify" → **任务2** - `task_context` 中存在 `dataset_path` 字段 → **任务2**(已有数据集路径表示验证阶段) - 其他情况:根据 `inputs` 内容判断 ## 工作流程 ```text [任务1:生成脚本] orchestrator 调用 dataset-builder (step_goal: 生成数据集构建脚本) -> 解析输入数据路径(data_path_resolution.md) -> 分析数据处理代码接口 -> 生成调用接口的脚本 -> 返回脚本路径 ↓ orchestrator 调用 onescience-runtime 执行脚本 -> 生成数据集文件 ↓ [任务2:验证数据集] orchestrator 调用 dataset-builder (step_goal: 验证数据集) -> 读取生成的数据集 -> 执行质量检查 -> 生成元数据 -> 返回验证结果 ``` ## 技能交接 ### 输入契约(来自 orchestrator) **任务1:生成脚本** ```yaml step_handoff: step_id: generate_dataset_script execution_skill: onescience-dataset-builder step_goal: 生成数据集构建脚本 # 关键字:生成/脚本 task_context: user_goal: <用户最终目标> input_data_hin...

Details

Author
onescience-ai
Repository
onescience-ai/OneSkills
Created
3 months ago
Last Updated
today
Language
Python
License
MIT

Similar Skills

Semantically similar based on skill content — not just same category

AI & Automation Solid

onescience-orchestrator

OneScience / OneSkills 的通用任务编排主控,也是体系默认执行入口。它负责根据统一资源契约的资源摘要识别用户意图,召回并融合 type=expert 规划技能的 proposal,维护 Task State,绑定资源,并按执行技能能力边界拆分和调度 type=executor 的 coder/paper-repro/runtime/installer/evaluator 等执行技能,把复杂目标组织成可追踪、可回退、可闭环的任务流。用户提示词中出现“使用onescience”“使用onescience技能”“使用oneskills”“使用oneskills技能”等表达时默认先进入本技能;仅当用户已明确指定要直接使用的具体技能(如“使用onescience-runtime技能执行运行”)时,才可跳过本技能并直接调用目标技能。它不承载具体领域专家知识;新增任务类型应通过新增资源包、专家规划技能或执行技能扩展。注意:本技能负责编排调度但不直接执行任务,规划和执行在同一 skill 内按循环推进,完成 observation 后可继续下一轮。

14 Updated today
onescience-ai
AI & Automation Solid

onescience-trainer

OneScience 科学模型训练执行技能。用于用户希望基于文本说明、网页说明、本地项目路径、已有 checkpoint 或项目原生训练入口来规划、生成并执行模型训练工作流,覆盖气象/地球系统、生信、材料、流体和通用科研模型等领域,包括训练信息获取、数据与切分规划、训练策略整理、完整训练脚本内容生成、训练执行组织以及结果验证。接收格式与 onescience-orchestrator 调用执行技能时的 step_handoff 保持一致,返回 execution_result。需要时协调交接给 onescience-coder、onescience-runtime 以及数据工作流技能。

14 Updated today
onescience-ai
AI & Automation Solid

onescience-data-analyzer

OneScience 数据分析执行技能(type=executor)。负责数据分析、可视化与报告输出,不涉及任务规划。接收规划好的任务,调用工作流执行统计分析、可视化生成和报告输出,根据领域自动匹配可视化规范(气象、生信、流体、材料等)。

14 Updated today
onescience-ai