From a1f45fa33ac1129e743ca4f525c818d281052b8d Mon Sep 17 00:00:00 2001 From: Ajax Davis Date: Mon, 19 Jan 2026 05:20:05 +1000 Subject: [PATCH] fix: switch scenario evaluator to gpt-4.1-mini Changed default evaluator from claude-3-5-haiku-latest to gpt-4.1-mini since OPENAI_API_KEY is configured in production but ANTHROPIC_API_KEY is not. --- apps/web/src/lib/scenarios/evaluate.ts | 9 ++++++--- apps/web/src/lib/scenarios/execute.ts | 2 +- 2 files changed, 7 insertions(+), 4 deletions(-) diff --git a/apps/web/src/lib/scenarios/evaluate.ts b/apps/web/src/lib/scenarios/evaluate.ts index a2f74bb..e86b77e 100644 --- a/apps/web/src/lib/scenarios/evaluate.ts +++ b/apps/web/src/lib/scenarios/evaluate.ts @@ -24,7 +24,8 @@ export type EvaluatorModelId = | 'claude-3-5-sonnet-latest' | 'claude-3-5-haiku-latest' | 'gpt-4o' - | 'gpt-4o-mini'; + | 'gpt-4o-mini' + | 'gpt-4.1-mini'; /** * Get the model instance for an evaluator model ID @@ -39,12 +40,14 @@ function getEvaluatorModel(modelId: EvaluatorModelId) { return openai('gpt-4o'); case 'gpt-4o-mini': return openai('gpt-4o-mini'); + case 'gpt-4.1-mini': + return openai('gpt-4.1-mini'); default: - return anthropic('claude-3-5-haiku-latest'); + return openai('gpt-4.1-mini'); } } -const DEFAULT_EVALUATOR: EvaluatorModelId = 'claude-3-5-haiku-latest'; +const DEFAULT_EVALUATOR: EvaluatorModelId = 'gpt-4.1-mini'; /** * Evaluate if a scenario execution was successful diff --git a/apps/web/src/lib/scenarios/execute.ts b/apps/web/src/lib/scenarios/execute.ts index a9524ee..d2894ea 100644 --- a/apps/web/src/lib/scenarios/execute.ts +++ b/apps/web/src/lib/scenarios/execute.ts @@ -14,7 +14,7 @@ import { runAssertions, } from './evaluate'; -const DEFAULT_EVALUATOR: EvaluatorModelId = 'claude-3-5-haiku-latest'; +const DEFAULT_EVALUATOR: EvaluatorModelId = 'gpt-4.1-mini'; const MAX_RETRIES = 1; interface ExecutionOptions {