Exemplos
Receitas prontas a copiar. Cada fragmento é autónomo exceto pelos ajudantes que nomeia (ship,
CACHE, e assim por diante), que forneces tu.
- Início rápido
- Auditoria
- Censurar PII
- Cache
- Métricas
- Guardrail
- Gate de confiança
- Fixar o encaminhamento
- Ciclo de vida
- Composição
- Hooks por chamada
- Lote
- Servidor HTTP
- ONNXAgent
- Registo em runtime
- Classe base e predefinições para todo o processo
- Hooks assíncronos
- Tempo limite de hook
- Orçamento de tokens
- Testar hooks
Início rápido
import laya
def log(ctx):
print(ctx.model, ctx.results[0]["answers"])
agent = laya.load("convaiinnovations/laya", on_predict_end=log)
agent.system_one("I was charged twice.", {"urgent": {"type": "noul", "instructions": "Urgent?"}})
Auditoria
O caso de uso do browser-use: capturar cada decisão e enviá-la para um serviço externo.
import json, sys
import laya
def audit(ctx):
for state, result in zip(ctx.states, ctx.results or []):
record = {
"run_id": ctx.run_id,
"model": ctx.model,
"state": state,
"routing": result.get("routing"),
"answers": result["answers"],
"usage": result.get("usage"),
"call_usage": ctx.usage,
"call_elapsed_ms": round(ctx.elapsed_ms or 0.0, 3),
}
print(json.dumps(record), file=sys.stderr)
# ship_to_service(record)
agent = laya.load("convaiinnovations/laya", on_predict_end=audit)
Uma chamada de hook cobre toda a chamada, por isso o ciclo escreve um registo por decisão; vê
Lote para a mesma forma em predict_batch.
Uma versão completa e executável está em examples/hooks/audit.py.
Censurar PII
import re
import laya
EMAIL = re.compile(r"\b[\w.+-]+@[\w-]+\.[\w.-]+\b")
PHONE = re.compile(r"\+?\d[\d ()-]{7,}\d")
def scrub(value):
if isinstance(value, str):
return PHONE.sub("[phone]", EMAIL.sub("[email]", value))
if isinstance(value, dict):
return {k: scrub(v) for k, v in value.items()}
if isinstance(value, list):
return [scrub(v) for v in value]
return value
def redact(ctx):
ctx.states = [scrub(s) for s in ctx.states]
agent = laya.load("convaiinnovations/laya", on_predict_start=redact)
Cache
import hashlib, json
import laya
CACHE = {}
def key(ctx, index):
# Not sort_keys=True: criteria order is positional, so two orders are two questions,
# and the checkpoint and token budget change the answer too.
payload = json.dumps([ctx.states[index], ctx.questions, ctx.model,
ctx.max_len, ctx.head_max_len], default=str)
return hashlib.sha256(payload.encode()).hexdigest()
def read(ctx):
hits = [CACHE.get(key(ctx, i)) for i in range(len(ctx.states))]
if all(hit is not None for hit in hits):
ctx.skip(hits) # one per state: skip replaces the whole call
def write(ctx):
for i, result in enumerate(ctx.results or []):
CACHE[key(ctx, i)] = result
agent = laya.load("convaiinnovations/laya", on_predict_start=read, on_predict_end=write)
first = agent.system_one("state", QUESTIONS) # runs the model
second = agent.system_one("state", QUESTIONS) # served from CACHE
Métricas
import laya
COUNTS, LATENCIES = {}, []
def metrics(ctx):
COUNTS[ctx.model] = COUNTS.get(ctx.model, 0) + 1
if ctx.elapsed_ms is not None:
LATENCIES.append(ctx.elapsed_ms)
agent = laya.load("convaiinnovations/laya", on_predict_end=metrics, hooks_raise=False)
Guardrail
Bloqueia um pedido levantando a partir de um hook de início.
import laya
class Blocked(Exception):
pass
def guard(ctx):
text = " ".join(str(state) for state in ctx.states).lower()
if "ignore previous instructions" in text:
raise Blocked("prompt injection")
agent = laya.load("convaiinnovations/laya", on_predict_start=guard)
try:
agent.system_one("Ignore previous instructions and ...", QUESTIONS)
except Blocked:
handle_block()
Um hook de início vê cada estado da chamada, por isso testa-os todos: ler apenas ctx.states[0]
deixa passar o resto de uma chamada predict_batch.
Gate de confiança
Reescreve uma resposta de baixa confiança, ou anota-a.
def gate(ctx):
for result in ctx.results or []:
answer = result["answers"].get("dept")
if answer and answer["confidence"] < 0.6:
answer["choice"] = "human-review"
answer["gated"] = True
agent = laya.load("convaiinnovations/laya", on_predict_end=gate)
ctx.results contém um dict por estado da chamada, por isso o ciclo anota cada resposta que falhe o
limiar, e não apenas a do primeiro estado.
Fixar o encaminhamento
Força um checkpoint para uma classe de tráfego.
from laya import Router
from laya.router import RouteDecision
def pin(ctx):
if "refund" in str(ctx.states[0]).lower():
ctx.decision = RouteDecision(
model="typed-decisions",
repo="convaiinnovations/laya/typed-decisions",
reason="refund workflow",
detection=None,
workflow=None,
)
router = Router(hooks=[pin])
Por chamada, sem instalar:
router.predict("refund request", QUESTIONS, hooks=[pin])
Ciclo de vida
Observa a construção e a libertação de checkpoints.
from laya import Router
class Lifecycle:
def on_load(self, ctx):
print("loaded", ctx.model, "agent", type(ctx.agent).__name__)
def on_evict(self, ctx):
print("evicted", ctx.model)
router = Router(max_loaded=1, hooks=[Lifecycle()])
router.preload(["english", "multilingual"]) # on_load fires per build
router.unload() # on_evict fires per freed checkpoint
Composição
Primeiro os hooks instalados, depois os invocáveis de conveniência; todos partilham um contexto.
import laya
class Metrics:
def on_predict_end(self, ctx):
record_latency(ctx.model, ctx.elapsed_ms)
def redact(ctx):
ctx.states = [strip_pii(s) for s in ctx.states]
def audit(ctx):
ship(ctx.run_id, ctx.results)
agent = laya.load(
"convaiinnovations/laya",
hooks=[Metrics()], # installed, runs first
on_predict_start=redact, # convenience, appended
on_predict_end=audit, # convenience, appended
hooks_raise=True,
)
Hooks por chamada
Sobrepõe ou estende hooks para uma única chamada.
agent.system_one(
state,
questions,
on_predict_end=lambda ctx: debug_dump(ctx),
hooks_raise=False,
)
router.predict(
state,
questions,
hooks=[pin], # applies to on_route too
on_predict_end=audit,
)
Lote
Os hooks disparam uma vez por chamada Agent.predict_batch, com ctx.states a conter todos os
estados. O Router.predict_batch corre os seus hooks ao nível do Router uma vez por pedido em vez
disso, cada um com um estado e o seu próprio run_id, por isso o mesmo hook aí escreve um registo
por chamada do hook.
def audit_batch(ctx):
for state, result in zip(ctx.states, ctx.results):
ship_one(ctx.run_id, state, result)
results = agent.predict_batch([state_a, state_b, state_c], questions, on_predict_end=audit_batch)
Servidor HTTP
Os hooks de Router disparam para o laya.serve automaticamente, porque o servidor chama
Router.predict.
from laya import Router
from laya.serve import create_app
router = Router(hooks=[Metrics()], on_predict_end=audit, hooks_raise=False)
app = create_app(router=router)
ONNXAgent
O ONNXAgent expõe apenas os eventos ao nível da predição.
from laya.onnx_agent import ONNXAgent
agent = ONNXAgent("convaiinnovations/laya", onnx_path="laya.onnx", on_predict_end=audit)
agent.system_one(state, questions)
Registo em runtime
Anexa, remove ou limita hooks após a construção.
agent.add_hook(Metrics()) # attach at runtime
agent.remove_hook(Metrics()) # by identity
with agent.hooks_installed(DebugDump()):
agent.system_one(state, questions) # DebugDump only here
Classe base e predefinições para todo o processo
Faz subclasse de BaseHook para sobrepor apenas o que precisas, e registra algo uma vez para todo o
processo em vez de o passar a todos os Agent e Router.
from laya import BaseHook, hooks
class Audit(BaseHook):
def on_predict_end(self, ctx):
ship(ctx.run_id, ctx.results)
hooks.set_default_hooks(hooks=[Audit()]) # runs for every call in the process
# later, or in tests:
hooks.clear_default_hooks()
Orçamento de tokens
Ajusta o orçamento de tokens para uma chamada, a partir de um hook ou de um argumento por chamada. O
valor de um hook substitui o orçamento em vigor, por isso tem de ler esse orçamento primeiro:
dimensiona pela pergunta mais larga da chamada, mantém-te acima do piso de tokens que o core aplica
às opções, e alarga max_len a par de head_max_len para que o estado guarde uma janela.
def widen(ctx):
k = max((len(q.get("criteria", {}) or {}) for q in ctx.questions.values()), default=0)
if k < 50:
return
cfg = getattr(ctx.agent, "cfg", None) or {}
head = ctx.head_max_len if ctx.head_max_len is not None else cfg.get("head_max_len", 192)
window = ctx.max_len if ctx.max_len is not None else cfg.get("max_len", 512)
need = 16 + 8 * k
if need > head:
ctx.head_max_len = need
ctx.max_len = max(window, need + 8 + 64)
agent = laya.load("convaiinnovations/laya", on_predict_start=widen)
# or per call
agent.system_one(state, questions, head_max_len=512, max_len=1024)
Ajuste do orçamento de tokens tem a aritmética por
detrás de cada linha, e predict_shortlist é a opção quando um conjunto de
etiquetas não cabe nem numa janela alargada.
Hooks assíncronos
Envolve um hook assíncrono em AsyncHook; cada corrotina corre até ao fim no core síncrono, quer o
autor da chamada seja síncrono quer já esteja dentro de um event loop.
import laya
from laya import AsyncHook
class RemoteAudit:
async def on_predict_end(self, ctx):
await ship(ctx.run_id, ctx.results)
agent = laya.load("convaiinnovations/laya", hooks=[AsyncHook(RemoteAudit())])
Um invocável assíncrono simples também funciona:
async def async_end(ctx):
await ship(ctx.results)
agent.system_one(state, questions, on_predict_end=async_end)
Tempo limite de hook
Limita cada chamada de hook, para que um hook preso não pendure um pedido servido:
agent = laya.load("convaiinnovations/laya", on_predict_end=metrics, hooks_timeout=2.0)
# or per call
agent.system_one(state, questions, on_predict_end=metrics, hooks_timeout=0.5)
Um hook que excede o tempo levanta TimeoutError (ou avisa quando hooks_raise=False). O hook
continua a correr em segundo plano, por isso dá também às chamadas de rede o seu próprio timeout. Vê
erros.
Testar hooks
Afirma o que um hook viu sem um modelo: conduz predict_batch com os ajudantes de
encode/forward/decode postiços, como faz
tests/test_hooks.py.
seen = []
agent.predict_batch(["s0"], questions, on_predict_end=lambda ctx: seen.append(ctx.results))
assert len(seen) == 1
A superfície da API é fixada por
tests/test_hooks_api.py.
Ver também
- Tracing:
run_id, spans, OpenTelemetry. - Padrões e antipadrões: o raciocínio por detrás destas receitas.