onescience-parallel
Solid将 PyTorch 模型改造为支持 Pipeline Parallelism (PP) + Tensor Parallelism (TP) 的分布式训练模型。 适用场景:单机单卡模型改多卡分布式、模型拆分为多个 pipeline stage、替换 nn.Linear 为并行线性层、 编写 forward_step_func / model_provider / dataset_provider、配置 PipelineTensorShapeConfig、 创建 Distributed 版本模块(DistributedFuser / DistributedAttention / DistributedMlp)。 当用户提到以下任何关键词时,务必使用此 skill: "流水线并行"、"pipeline parallel"、"模型并行改造"、"分布式训练"、"stage 拆分"、 "ColumnParallelLinear"、"RowParallelLinear"、"pretrain 接口"、"forward_step_func"、 "model_provider"、"TP 并行"、"张量并行"、"多卡训练"、"Megatron"。
Install
Quality Score: 84/100
Skill Content
Details
- Author
- onescience-ai
- Repository
- onescience-ai/OneSkills
- Created
- 5 months ago
- Last Updated
- yesterday
- Language
- Python
- License
- MIT
Similar Skills
Semantically similar based on skill content — not just same category
ai-distributed-training
Guides multi-GPU pre-training: DDP, FSDP2, ZeRO, tensor/pipeline/expert parallelism, fp8/Muon. Use when scaling a run, training MoE, or reproducing GPT-2 on rented GPUs.
ml-mlops-deployment
模型上线后的生命周期纪律:部署策略、监控三层、再训练触发与回滚预案。当模型要从 notebook 走向线上、问"影子/金丝雀/A-B 怎么选"、上线后效果下滑怀疑漂移、纠结 PSI 阈值/什么时候重训、或线下好线上差已排除泄漏时激活。核心:training-serving skew 是 线上线下鸿沟主因;业务指标滞后数周,静默失败比崩溃危险。不适用于实验期记账、训练期 污染(ml-experiment-tracking / ml-leakage-defense)。触发词: MLOps, 模型上线部署, skew, data drift 漂移, concept drift, PSI, shadow 影子, canary 金丝雀
onescience-infer
OneScience 科学模型推理执行技能。用于用户希望运行或构建 HuggingFace 模型、官方文档模型、本地 checkpoint 或项目原生 runner 的推理工作流时,覆盖气象/地球系统、生��、材料、流体和通用科研模型等领域,包括模型卡与配置发现、输入数据准备、checkpoint 加载、推理入口生成或复用、执行、结果验证、可视化和 baseline 对比。接收格式与 onescience-orchestrator 调用执行技能时的 step_handoff 保持一致,返回 execution_result。需要时协调交接给 onescience-coder、onescience-runtime 以及数据准备类技能。