Skip to main content

model_evaluation_runs

Creates, updates, deletes, gets or lists a model_evaluation_runs resource.

Overview

Namemodel_evaluation_runs
TypeResource
Iddigitalocean.genai.model_evaluation_runs

Fields

The following fields are returned by SELECT queries:

A successful response.

NameDatatypeDescription
namestringName of the evaluation run. (example: example name)
candidate_model_namestring (example: example name)
dataset_namestring (example: example name)
eval_preset_namestring (example: example name)
judge_model_namestring (example: example name)
candidate_inference_configobjectInference configuration for the candidate model during evaluation.
candidate_model_sourcestringWhether inference runs against the serverless platform, a dedicated deployment, or a model router. (CANDIDATE_MODEL_SOURCE_SERVERLESS, CANDIDATE_MODEL_SOURCE_DEDICATED, CANDIDATE_MODEL_SOURCE_ROUTER) (default: CANDIDATE_MODEL_SOURCE_SERVERLESS, example: CANDIDATE_MODEL_SOURCE_SERVERLESS)
candidate_model_uuidstringCandidate model being evaluated. (example: 123e4567-e89b-12d3-a456-426614174000)
completed_atstring (date-time) (example: 2023-01-01T00:00:00Z)
created_atstring (date-time) (example: 2023-01-01T00:00:00Z)
dataset_uuidstringDataset used for the evaluation. (example: 123e4567-e89b-12d3-a456-426614174000)
error_descriptionstringError description if the run failed or partially succeeded. (example: example string)
eval_preset_uuidstring (example: 123e4567-e89b-12d3-a456-426614174000)
eval_run_uuidstringUUID of the evaluation run. (example: 123e4567-e89b-12d3-a456-426614174000)
judge_model_uuidstringJudge model used to score responses. (example: 123e4567-e89b-12d3-a456-426614174000)
metricsarrayMetrics selected for this evaluation.
progressobjectPer-phase progress for a model evaluation run. The candidate phase invokes the candidate model once per dataset row; the judge phase scores each candidate-success row with the configured metrics. Counts grow as the run advances; compare against total_rows to render a progress bar.
result_summaryobjectAggregated result summary for a completed model evaluation run.
star_metricobject
started_atstring (date-time) (example: 2023-01-01T00:00:00Z)
statusstringModel Evaluation Run Statuses (MODEL_EVALUATION_RUN_STATUS_UNSPECIFIED, MODEL_EVALUATION_RUN_QUEUED, MODEL_EVALUATION_RUN_RUNNING_DATASET, MODEL_EVALUATION_RUN_EVALUATING_RESULTS, MODEL_EVALUATION_RUN_CANCELLING, MODEL_EVALUATION_RUN_CANCELLED, MODEL_EVALUATION_RUN_SUCCESSFUL, MODEL_EVALUATION_RUN_PARTIALLY_SUCCESSFUL, MODEL_EVALUATION_RUN_FAILED) (default: MODEL_EVALUATION_RUN_STATUS_UNSPECIFIED, example: MODEL_EVALUATION_RUN_STATUS_UNSPECIFIED)

Methods

The following methods are available for this resource:

NameAccessible byRequired ParamsOptional ParamsDescription
genai_get_model_evaluation_runselecteval_run_uuidpage, per_pageTo retrieve a model evaluation run, send a GET request to /v2/genai/model_evaluation_runs/{eval_run_uuid}.
genai_list_model_evaluation_runsselecteval_preset_uuid, status, page, per_page, statuses, candidate_types, search, sort_by, sort_directionTo list model evaluation runs, send a GET request to /v2/genai/model_evaluation_runs.
genai_create_model_evaluation_runinsertTo create a model evaluation run, send a POST request to /v2/genai/model_evaluation_runs.
genai_update_model_evaluation_runupdateeval_run_uuidTo update a model evaluation run's display name, send a PATCH request to /v2/gen-ai/model_evaluation_runs/{eval_run_uuid}.
genai_cancel_model_evaluation_runreplaceeval_run_uuidTo cancel an in-progress model evaluation run, send a PUT request to /v2/gen-ai/model_evaluation_runs/{eval_run_uuid}/cancel.
genai_delete_model_evaluation_rundeleteeval_run_uuidTo delete a model evaluation run, send a DELETE request to /v2/gen-ai/model_evaluation_runs/{eval_run_uuid}. The run must be in a terminal status (successful, partially_successful, failed, or cancelled). For runs still in progress, either wait for the run to finish or cancel it, then retry the delete once the run reaches a terminal status.

Parameters

Parameters can be passed in the WHERE clause of a query. Check the Methods section to see which parameters are required or optional for each operation.

NameDatatypeDescription
eval_run_uuidstringUUID of the model evaluation run to delete. The run must be in a terminal status (successful, partially_successful, failed, or cancelled). For runs still in progress, either wait for the run to finish or cancel it, then retry the delete. (example: "123e4567-e89b-12d3-a456-426614174000")
candidate_typesarrayFilter by one or more candidate model source types (serverless, dedicated, router). Empty means no candidate-type filter. (example: [CANDIDATE_MODEL_SOURCE_SERVERLESS])
eval_preset_uuidstringUUID of the evaluation preset to filter by. (example: 123e4567-e89b-12d3-a456-426614174000)
pageintegerPage number. (example: 1)
per_pageintegerItems per page. (example: 1)
sort_bystringField to sort by. Defaults to creation date when unspecified. (example: MODEL_EVALUATION_RUN_SORT_FIELD_UNSPECIFIED)
sort_directionstringSort direction. Defaults to descending when unspecified. (example: SORT_DIRECTION_UNSPECIFIED)
statusstringFilter by evaluation run status. (example: MODEL_EVALUATION_RUN_STATUS_UNSPECIFIED)
statusesarrayFilter by one or more statuses. Empty means no status filter. (example: [MODEL_EVALUATION_RUN_STATUS_UNSPECIFIED])

SELECT examples

To retrieve a model evaluation run, send a GET request to /v2/genai/model_evaluation_runs/{eval_run_uuid}.

SELECT
name,
candidate_model_name,
dataset_name,
eval_preset_name,
judge_model_name,
candidate_inference_config,
candidate_model_source,
candidate_model_uuid,
completed_at,
created_at,
dataset_uuid,
error_description,
eval_preset_uuid,
eval_run_uuid,
judge_model_uuid,
metrics,
progress,
result_summary,
star_metric,
started_at,
status
FROM digitalocean.genai.model_evaluation_runs
WHERE eval_run_uuid = '{{ eval_run_uuid }}' -- required
AND page = '{{ page }}'
AND per_page = '{{ per_page }}'
;

INSERT examples

To create a model evaluation run, send a POST request to /v2/genai/model_evaluation_runs.

INSERT INTO digitalocean.genai.model_evaluation_runs (
candidate_inference_config,
candidate_model_name,
candidate_model_source,
candidate_model_uuid,
dataset_uuid,
eval_preset_uuid,
judge_model_uuid,
metric_uuids,
name,
preset_name,
preset_save_sections,
save_as_preset,
source,
star_metric
)
SELECT
'{{ candidate_inference_config }}',
'{{ candidate_model_name }}',
'{{ candidate_model_source }}',
'{{ candidate_model_uuid }}',
'{{ dataset_uuid }}',
'{{ eval_preset_uuid }}',
'{{ judge_model_uuid }}',
'{{ metric_uuids }}',
'{{ name }}',
'{{ preset_name }}',
'{{ preset_save_sections }}',
{{ save_as_preset }},
'{{ source }}',
'{{ star_metric }}'
RETURNING
eval_run_uuid
;

UPDATE examples

To update a model evaluation run's display name, send a PATCH request to /v2/gen-ai/model_evaluation_runs/{eval_run_uuid}.

UPDATE digitalocean.genai.model_evaluation_runs
SET
eval_run_uuid = '{{ eval_run_uuid }}',
name = '{{ name }}'
WHERE
eval_run_uuid = '{{ eval_run_uuid }}' --required
RETURNING
run;

REPLACE examples

To cancel an in-progress model evaluation run, send a PUT request to /v2/gen-ai/model_evaluation_runs/{eval_run_uuid}/cancel.

REPLACE digitalocean.genai.model_evaluation_runs
SET
eval_run_uuid = '{{ eval_run_uuid }}'
WHERE
eval_run_uuid = '{{ eval_run_uuid }}' --required
RETURNING
run;

DELETE examples

To delete a model evaluation run, send a DELETE request to /v2/gen-ai/model_evaluation_runs/{eval_run_uuid}. The run must be in a terminal status (successful, partially_successful, failed, or cancelled). For runs still in progress, either wait for the run to finish or cancel it, then retry the delete once the run reaches a terminal status.

DELETE FROM digitalocean.genai.model_evaluation_runs
WHERE eval_run_uuid = '{{ eval_run_uuid }}' --required
;