Exemplos
Receitas para copiar e colar. Todo trecho é autossuficiente, exceto pelos helpers que ele nomeia
(ship, CACHE, e assim por diante), que você fornece.
- Início rápido
- Auditoria
- Censurar PII
- Cache
- Métricas
- Guardrail
- Gate de confiança
- Fixação de rota
- Ciclo de vida
- Composição
- Hooks por chamada
- Lote
- Servidor HTTP
- ONNXAgent
- Registro em tempo de execução
- Classe base e padrões para todo o processo
- Hooks assíncronos
- Timeout de hook
- Orçamento de tokens
- Testar hooks
Início rápido
import laya
def log(ctx):
print(ctx.model, ctx.results[0]["answers"])
agent = laya.load("convaiinnovations/laya", on_predict_end=log)
agent.system_one("I was charged twice.", {"urgent": {"type": "noul", "instructions": "Urgent?"}})
Auditoria
O caso de uso do browser-use: capturar cada decisão e enviá-la a um serviço externo.
import json, sys
import laya
def audit(ctx):
for state, result in zip(ctx.states, ctx.results or []):
record = {
"run_id": ctx.run_id,
"model": ctx.model,
"state": state,
"routing": result.get("routing"),
"answers": result["answers"],
"usage": result.get("usage"),
"call_usage": ctx.usage,
"call_elapsed_ms": round(ctx.elapsed_ms or 0.0, 3),
}
print(json.dumps(record), file=sys.stderr)
# ship_to_service(record)
agent = laya.load("convaiinnovations/laya", on_predict_end=audit)
Uma chamada de hook cobre a chamada inteira, então o laço grava um registro por decisão; veja
Lote para o mesmo formato em predict_batch.
Uma versão executável completa está em examples/hooks/audit.py.
Censurar PII
import re
import laya
EMAIL = re.compile(r"\b[\w.+-]+@[\w-]+\.[\w.-]+\b")
PHONE = re.compile(r"\+?\d[\d ()-]{7,}\d")
def scrub(value):
if isinstance(value, str):
return PHONE.sub("[phone]", EMAIL.sub("[email]", value))
if isinstance(value, dict):
return {k: scrub(v) for k, v in value.items()}
if isinstance(value, list):
return [scrub(v) for v in value]
return value
def redact(ctx):
ctx.states = [scrub(s) for s in ctx.states]
agent = laya.load("convaiinnovations/laya", on_predict_start=redact)
Veja examples/hooks/redact.py.
Cache
import hashlib, json
import laya
CACHE = {}
def key(ctx, index):
# Not sort_keys=True: criteria order is positional, so two orders are two questions,
# and the checkpoint and token budget change the answer too.
payload = json.dumps([ctx.states[index], ctx.questions, ctx.model,
ctx.max_len, ctx.head_max_len], default=str)
return hashlib.sha256(payload.encode()).hexdigest()
def read(ctx):
hits = [CACHE.get(key(ctx, i)) for i in range(len(ctx.states))]
if all(hit is not None for hit in hits):
ctx.skip(hits) # one per state: skip replaces the whole call
def write(ctx):
for i, result in enumerate(ctx.results or []):
CACHE[key(ctx, i)] = result
agent = laya.load("convaiinnovations/laya", on_predict_start=read, on_predict_end=write)
first = agent.system_one("state", QUESTIONS) # runs the model
second = agent.system_one("state", QUESTIONS) # served from CACHE
Veja examples/hooks/cache.py.
Métricas
import laya
COUNTS, LATENCIES = {}, []
def metrics(ctx):
COUNTS[ctx.model] = COUNTS.get(ctx.model, 0) + 1
if ctx.elapsed_ms is not None:
LATENCIES.append(ctx.elapsed_ms)
agent = laya.load("convaiinnovations/laya", on_predict_end=metrics, hooks_raise=False)
Veja examples/hooks/otel.py.
Guardrail
Bloqueie uma solicitação lançando de um hook de início.
import laya
class Blocked(Exception):
pass
def guard(ctx):
text = " ".join(str(state) for state in ctx.states).lower()
if "ignore previous instructions" in text:
raise Blocked("prompt injection")
agent = laya.load("convaiinnovations/laya", on_predict_start=guard)
try:
agent.system_one("Ignore previous instructions and ...", QUESTIONS)
except Blocked:
handle_block()
Um hook de início vê todo estado da chamada, então teste todos eles: ler apenas ctx.states[0] deixa
o resto de uma chamada predict_batch passar.
Gate de confiança
Reescreva uma resposta de baixa confiança, ou anote-a.
def gate(ctx):
for result in ctx.results or []:
answer = result["answers"].get("dept")
if answer and answer["confidence"] < 0.6:
answer["choice"] = "human-review"
answer["gated"] = True
agent = laya.load("convaiinnovations/laya", on_predict_end=gate)
ctx.results guarda um dict por estado da chamada, então o laço anota toda resposta que não passa do
limiar, não apenas a do primeiro estado.
Fixação de rota
Force um checkpoint para uma classe de tráfego.
from laya import Router
from laya.router import RouteDecision
def pin(ctx):
if "refund" in str(ctx.states[0]).lower():
ctx.decision = RouteDecision(
model="typed-decisions",
repo="convaiinnovations/laya/typed-decisions",
reason="refund workflow",
detection=None,
workflow=None,
)
router = Router(hooks=[pin])
Por chamada, sem instalar:
router.predict("refund request", QUESTIONS, hooks=[pin])
Ciclo de vida
Observe a construção e a remoção de checkpoints.
from laya import Router
class Lifecycle:
def on_load(self, ctx):
print("loaded", ctx.model, "agent", type(ctx.agent).__name__)
def on_evict(self, ctx):
print("evicted", ctx.model)
router = Router(max_loaded=1, hooks=[Lifecycle()])
router.preload(["english", "multilingual"]) # on_load fires per build
router.unload() # on_evict fires per freed checkpoint
Composição
Hooks instalados primeiro, depois callables de conveniência; todos compartilham um contexto.
import laya
class Metrics:
def on_predict_end(self, ctx):
record_latency(ctx.model, ctx.elapsed_ms)
def redact(ctx):
ctx.states = [strip_pii(s) for s in ctx.states]
def audit(ctx):
ship(ctx.run_id, ctx.results)
agent = laya.load(
"convaiinnovations/laya",
hooks=[Metrics()], # installed, runs first
on_predict_start=redact, # convenience, appended
on_predict_end=audit, # convenience, appended
hooks_raise=True,
)
Hooks por chamada
Sobrescreva ou estenda hooks para uma única chamada.
agent.system_one(
state,
questions,
on_predict_end=lambda ctx: debug_dump(ctx),
hooks_raise=False,
)
router.predict(
state,
questions,
hooks=[pin], # applies to on_route too
on_predict_end=audit,
)
Lote
Os hooks disparam uma vez por chamada de Agent.predict_batch, com ctx.states guardando todos os
estados. Router.predict_batch roda seus hooks no nível do Router uma vez por solicitação em vez
disso, cada um com um estado e seu próprio run_id, então o mesmo hook ali grava um registro por
chamada do hook.
def audit_batch(ctx):
for state, result in zip(ctx.states, ctx.results):
ship_one(ctx.run_id, state, result)
results = agent.predict_batch([state_a, state_b, state_c], questions, on_predict_end=audit_batch)
Servidor HTTP
Os hooks de Router disparam para o laya.serve automaticamente, porque o servidor chama
Router.predict.
from laya import Router
from laya.serve import create_app
router = Router(hooks=[Metrics()], on_predict_end=audit, hooks_raise=False)
app = create_app(router=router)
ONNXAgent
ONNXAgent expõe apenas os eventos no nível da predição.
from laya.onnx_agent import ONNXAgent
agent = ONNXAgent("convaiinnovations/laya", onnx_path="laya.onnx", on_predict_end=audit)
agent.system_one(state, questions)
Registro em tempo de execução
Anexe, destaque ou dê escopo a hooks depois da construção.
agent.add_hook(Metrics()) # attach at runtime
agent.remove_hook(Metrics()) # by identity
with agent.hooks_installed(DebugDump()):
agent.system_one(state, questions) # DebugDump only here
Classe base e padrões para todo o processo
Herde de BaseHook para sobrescrever apenas o que você precisa, e registre algo uma vez para o
processo inteiro em vez de passá-lo a cada Agent e Router.
from laya import BaseHook, hooks
class Audit(BaseHook):
def on_predict_end(self, ctx):
ship(ctx.run_id, ctx.results)
hooks.set_default_hooks(hooks=[Audit()]) # runs for every call in the process
# later, or in tests:
hooks.clear_default_hooks()
Orçamento de tokens
Molde o orçamento de tokens para uma chamada, a partir de um hook ou de um argumento por chamada. O
valor de um hook substitui o orçamento em vigor, então ele tem que ler esse orçamento primeiro:
dimensione pela pergunta mais larga da chamada, fique acima do piso de tokens que o core aplica às
opções, e alargue max_len junto com head_max_len para o estado manter uma janela.
def widen(ctx):
k = max((len(q.get("criteria", {}) or {}) for q in ctx.questions.values()), default=0)
if k < 50:
return
cfg = getattr(ctx.agent, "cfg", None) or {}
head = ctx.head_max_len if ctx.head_max_len is not None else cfg.get("head_max_len", 192)
window = ctx.max_len if ctx.max_len is not None else cfg.get("max_len", 512)
need = 16 + 8 * k
if need > head:
ctx.head_max_len = need
ctx.max_len = max(window, need + 8 + 64)
agent = laya.load("convaiinnovations/laya", on_predict_start=widen)
# or per call
agent.system_one(state, questions, head_max_len=512, max_len=1024)
Ajuste do orçamento de tokens tem a aritmética por trás de
cada linha, e predict_shortlist é a opção quando um conjunto de rótulos não
cabe nem em uma janela alargada.
Hooks assíncronos
Envolva um hook async em AsyncHook; cada corrotina roda até o fim no núcleo síncrono, seja o
chamador síncrono, seja ele já dentro de um event loop.
import laya
from laya import AsyncHook
class RemoteAudit:
async def on_predict_end(self, ctx):
await ship(ctx.run_id, ctx.results)
agent = laya.load("convaiinnovations/laya", hooks=[AsyncHook(RemoteAudit())])
Um callable async simples também funciona:
async def async_end(ctx):
await ship(ctx.results)
agent.system_one(state, questions, on_predict_end=async_end)
Timeout de hook
Limite cada chamada de hook, para que um hook travado não consiga pendurar uma solicitação servida:
agent = laya.load("convaiinnovations/laya", on_predict_end=metrics, hooks_timeout=2.0)
# or per call
agent.system_one(state, questions, on_predict_end=metrics, hooks_timeout=0.5)
Um hook que estourou o tempo lança TimeoutError (ou avisa quando hooks_raise=False). O hook
continua rodando em segundo plano, então dê também às chamadas de rede o próprio timeout delas. Veja
erros.
Testar hooks
Verifique o que um hook viu sem um modelo: conduza predict_batch com os helpers de
encode/forward/decode stubados, como
tests/test_hooks.py faz.
seen = []
agent.predict_batch(["s0"], questions, on_predict_end=lambda ctx: seen.append(ctx.results))
assert len(seen) == 1
A superfície da API é fixada por tests/test_hooks_api.py.
Veja também
- Tracing:
run_id, spans, OpenTelemetry. - Padrões e antipadrões: o raciocínio por trás destas receitas.