Mit der kontinuierlichen Abstimmung können Sie ein bereits abgestimmtes Modell oder einen Modell-Checkpoint weiter abstimmen, indem Sie weitere Epochen oder Trainingsbeispiele hinzufügen. Wenn Sie ein bereits abgestimmtes Modell oder einen Checkpoint als Basismodell verwenden, können Sie effizienter experimentieren.
Sie können das kontinuierliche Tuning für die folgenden Zwecke verwenden:
- Ein vorhandenes abgestimmtes Modell mit mehr Daten abstimmen, wenn es unterangepasst ist.
- Um die Leistung zu steigern oder das Modell mit neuen Daten auf dem neuesten Stand zu halten.
- Ein vorhandenes optimiertes Modell weiter anpassen.
Unterstützte Muster für die kontinuierliche Abstimmung
Die folgenden Muster für die kontinuierliche Abstimmung werden unterstützt:
- Überwachte Feinabstimmung → Abstimmung für Reinforcement Learning
- Reinforcement Learning-Abstimmung → Reinforcement Learning-Abstimmung
Kontinuierliches Optimieren konfigurieren
Wenn Sie einen kontinuierlichen Abstimmungsjob konfigurieren möchten, fügen Sie dem Anfragetext einen preTunedModel-Block hinzu, der auf das zuvor abgestimmte Modell (und optional einen bestimmten Prüfpunkt) verweist. Der Rest der Anfrage folgt demselben Schema wie ein neuer Job zur Feinabstimmung von Reinforcement Learning.
{
"description": string,
"tunedModelDisplayName": string,
"reinforcementTuningSpec": {
"trainingDatasetUri": "TRAINING_DATASET",
"validationDatasetUri": "VALIDATION_DATASET",
"hyperParameters": "HYPER_PARAMETERS",
"singleRewardConfig": "REWARD_CONFIG"
},
"preTunedModel": {
"tunedModelName": "projects/PROJECT_ID/locations/LOCATION_ID/models/PRETUNED_MODEL_ID",
"checkpointId": "CHECKPOINT_ID"
}
}
Die Platzhalter im Text sind:
- TRAINING_DATASET: Cloud Storage-URI der JSONL-Datei des Trainingsdatensatzes.
- VALIDATION_DATASET: Cloud Storage-URI der JSONL-Datei des Validierungs-Datasets. Optional.
- HYPER_PARAMETERS: Hyperparameterkonfiguration für den kontinuierlichen Abstimmungsjob. Weitere Informationen finden Sie auf der Seite Hyperparameter.
- REWARD_CONFIG: Belohnungskonfiguration. Weitere Informationen finden Sie auf der Seite Belohnungsfunktionen.
- PROJECT_ID: Ihre Google Cloud Projekt-ID
- LOCATION_ID: Die Standort-ID.
- PRETUNED_MODEL_ID: Die Modell-ID des zuvor optimierten Modells, mit dem fortgefahren werden soll.
- CHECKPOINT_ID: Die ID eines bestimmten Prüfpunkts des zuvor optimierten Modells. Optional: Wenn diese Option nicht angegeben wird, wird der letzte Prüfpunkt des vortrainierten Modells verwendet.
Nächste Schritte
- Abstimmungs-Dataset für den kontinuierlichen Abstimmungsjob vorbereiten
- Konfigurieren Sie Hyperparameter und Belohnungsfunktionen für den kontinuierlichen Abstimmungsjob.
- Jobstatus und ‑messwerte überwachen, während die kontinuierliche Abstimmung ausgeführt wird.