Zarządzanie promptami

Twórz prompty na podstawie danych, zanim trafią do produkcji.

Wersjonuj prompty, zamieniaj sprawdzone wywołania produkcyjne w testy, porównuj modele na tych samych danych, a następnie uruchamiaj testy A/B i zmieniaj etykiety bez ponownego wdrażania.

Przed odnogą
  • Prompty zaszyte w ponad 100 funkcjach Edge Function.
  • „Kto zmienił prompt welcome wczoraj?” — git blame.
  • Chcesz przetestować nowe sformułowanie → branch, PR, deploy, oglądasz logi.
  • Rollback = revert commit, redeploy, modlitwa, że nic innego się nie zmieniło.
Z odnogą
  • Prompty żyją w rejestrze, wołane po slugu.
  • Każdy zapis to wersja z autorem i diffem.
  • Odpalasz A/B po procencie ruchu; przed wyborem porównujesz ruch, niezawodność, opóźnienia i koszt.
  • Wycofanie zmiany to przepięcie etykiety. Atomowo, bez ponownego wdrażania.
  • Porównujesz 2–8 modeli na tych samych zamrożonych danych przed ruchem produkcyjnym.
Laboratorium ewaluacji

Porównaj jakość, koszt i szybkość na danych z własnego produktu.

Uczciwe porównanie zaczyna się od jednej wersji promptu i tych samych zamrożonych testów dla każdego modelu — nie od zbioru niepowiązanych demo.

01

Przechwyć lub utwórz

Uzbrój jedno realne wywołanie lub wpisz zmienne ręcznie.

02

Sprawdź i zamroź

Usuń wrażliwe wartości i określ warunek zaliczenia.

03

Uruchom 2–8 modeli

Każdy model otrzymuje identyczną wersję i zestaw testów.

04

Sprawdź wyniki

Porównaj odpowiedzi, zaliczenia, tokeny, naliczony koszt i opóźnienia.

Prywatność jest celowa: przechwytywanie jest jednorazowe i uruchamiane przez administratora. Wywołania nieudane, streamowane, z cache i laboratoryjne są pomijane. Przed zapisem sprawdzasz i redagujesz zmienne; niezapisany materiał wygasa w ciągu 24 godzin.

W Twoim kodzie

Wywołujesz prompt tak samo jak funkcję.

const r = await ai.prompts.chat({
  slug: 'welcome-email',
  label: 'production',          // or 'staging', or 'experiment-v3'
  variables: { name: 'Ada', plan: 'Pro' },
});

console.log(r.text);
console.log(r._meta.promptVersion);   // version that served this call
console.log(r._meta.costUsd);

Wersjonowane prompty

Każdy zapis tworzy wersję z podglądem zmian. Przeglądaj historię, porównuj i przywracaj.

Etykiety: production, staging

Publikujesz wersję, przepinając etykietę. SDK odwołuje się do etykiety, a nie identyfikatora wersji.

A/B po procencie ruchu

Dzielisz ruch między dwie wersje. Obserwujesz metryki. Wypuszczasz zwycięzcę.

Natychmiastowe wycofanie

Jedno kliknięcie przywraca poprzednią etykietę production. Bez ponownego wdrażania i bez PR-a.

Nadpisania dla organizacji

Dla wybranej organizacji możesz przypisać inny prompt bez tworzenia osobnej wersji kodu.

Zmienne, typowane

Przekazujesz zmienne; odnoga podstawia po stronie serwera i loguje finalny prompt.

Laboratorium ewaluacji

Uruchamiaj te same zamrożone przypadki na 2–8 modelach i porównuj odpowiedzi, wyniki testów, tokeny, naliczony koszt i opóźnienia.

Przechwytywanie realnych wywołań

Jawnie przechwyć jedno udane wywołanie produkcyjne, sprawdź i zredaguj zmienne, a potem zapisz je jako test wielokrotnego użytku.

Analityka wersji

Śledź ruch, niezawodność, opóźnienia, koszt i feedback dla każdej wersji promptu przed zmianą produkcji.

FAQ

Najczęstsze pytania

Czym to się różni od LangSmith / PromptLayer?

To dodatkowe narzędzia do obserwowalności. Rejestr promptów odnogi jest częścią bramki — wywołania są kierowane i mierzone razem z wersją promptu i organizacją, bez dodatkowego SDK ani osobnego systemu rozliczeń.

Czy mogę porównać modele na tym samym prompcie i danych?

Tak. Laboratorium ewaluacji zamraża jedną wersję promptu i jej testy, a następnie uruchamia identyczny zestaw na 2–8 wybranych modelach. Panel pokazuje każdą odpowiedź, wynik sprawdzenia, tokeny wejściowe i wyjściowe, naliczony koszt oraz czas odpowiedzi.

Czy mogę zamienić prawdziwe wywołanie produkcyjne w test?

Tak, jawnie. Uzbrój przechwytywanie dla promptu, wykonaj kolejne udane wywołanie bez streamingu i cache, a potem sprawdź i zredaguj zmienne przed zapisem. Niezapisany materiał wygasa w ciągu 24 godzin.

Jak ewaluacja łączy się z testem A/B?

Ewaluacja testuje zamrożony zestaw przed publikacją. A/B mierzy dwie wersje promptu na realnym ruchu. Użyj wyników laboratorium, by zawęzić wybór, a danych produkcyjnych, by zdecydować o promocji lub wycofaniu.

Czy nie-inżynier może edytować prompty?

Tak. Prompty żyją w panelu z dostępem RBAC. Inżynierowie wdrażają slug, a zespoły produktowe i operacyjne rozwijają prompt bez zmiany kodu.

Co dzieje się po wycofaniu wersji — czy trwające wywołania są przerywane?

Nie. Przepięcie etykiety jest atomowe. Nowe wywołania korzystają z nowej wersji, a rozpoczęte kończą się na poprzedniej.

Testuj na dowodach. Wdrażaj z kontrolą.