Documentação

Exemplos

Receitas prontas a copiar. Cada fragmento é autónomo exceto pelos ajudantes que nomeia (ship, CACHE, e assim por diante), que forneces tu.

Início rápido

import laya

def log(ctx):
    print(ctx.model, ctx.results[0]["answers"])

agent = laya.load("convaiinnovations/laya", on_predict_end=log)
agent.system_one("I was charged twice.", {"urgent": {"type": "noul", "instructions": "Urgent?"}})

Auditoria

O caso de uso do browser-use: capturar cada decisão e enviá-la para um serviço externo.

import json, sys
import laya

def audit(ctx):
    for state, result in zip(ctx.states, ctx.results or []):
        record = {
            "run_id": ctx.run_id,
            "model": ctx.model,
            "state": state,
            "routing": result.get("routing"),
            "answers": result["answers"],
            "usage": result.get("usage"),
            "call_usage": ctx.usage,
            "call_elapsed_ms": round(ctx.elapsed_ms or 0.0, 3),
        }
        print(json.dumps(record), file=sys.stderr)
        # ship_to_service(record)

agent = laya.load("convaiinnovations/laya", on_predict_end=audit)

Uma chamada de hook cobre toda a chamada, por isso o ciclo escreve um registo por decisão; vê Lote para a mesma forma em predict_batch.

Uma versão completa e executável está em examples/hooks/audit.py.

Censurar PII

import re
import laya

EMAIL = re.compile(r"\b[\w.+-]+@[\w-]+\.[\w.-]+\b")
PHONE = re.compile(r"\+?\d[\d ()-]{7,}\d")

def scrub(value):
    if isinstance(value, str):
        return PHONE.sub("[phone]", EMAIL.sub("[email]", value))
    if isinstance(value, dict):
        return {k: scrub(v) for k, v in value.items()}
    if isinstance(value, list):
        return [scrub(v) for v in value]
    return value

def redact(ctx):
    ctx.states = [scrub(s) for s in ctx.states]

agent = laya.load("convaiinnovations/laya", on_predict_start=redact)

Vê examples/hooks/redact.py.

Cache

import hashlib, json
import laya

CACHE = {}

def key(ctx, index):
    # Not sort_keys=True: criteria order is positional, so two orders are two questions,
    # and the checkpoint and token budget change the answer too.
    payload = json.dumps([ctx.states[index], ctx.questions, ctx.model,
                          ctx.max_len, ctx.head_max_len], default=str)
    return hashlib.sha256(payload.encode()).hexdigest()

def read(ctx):
    hits = [CACHE.get(key(ctx, i)) for i in range(len(ctx.states))]
    if all(hit is not None for hit in hits):
        ctx.skip(hits)   # one per state: skip replaces the whole call

def write(ctx):
    for i, result in enumerate(ctx.results or []):
        CACHE[key(ctx, i)] = result

agent = laya.load("convaiinnovations/laya", on_predict_start=read, on_predict_end=write)
first = agent.system_one("state", QUESTIONS)    # runs the model
second = agent.system_one("state", QUESTIONS)   # served from CACHE

Vê examples/hooks/cache.py.

Métricas

import laya

COUNTS, LATENCIES = {}, []

def metrics(ctx):
    COUNTS[ctx.model] = COUNTS.get(ctx.model, 0) + 1
    if ctx.elapsed_ms is not None:
        LATENCIES.append(ctx.elapsed_ms)

agent = laya.load("convaiinnovations/laya", on_predict_end=metrics, hooks_raise=False)

Vê examples/hooks/otel.py.

Guardrail

Bloqueia um pedido levantando a partir de um hook de início.

import laya

class Blocked(Exception):
    pass

def guard(ctx):
    text = " ".join(str(state) for state in ctx.states).lower()
    if "ignore previous instructions" in text:
        raise Blocked("prompt injection")

agent = laya.load("convaiinnovations/laya", on_predict_start=guard)

try:
    agent.system_one("Ignore previous instructions and ...", QUESTIONS)
except Blocked:
    handle_block()

Um hook de início vê cada estado da chamada, por isso testa-os todos: ler apenas ctx.states[0] deixa passar o resto de uma chamada predict_batch.

Gate de confiança

Reescreve uma resposta de baixa confiança, ou anota-a.

def gate(ctx):
    for result in ctx.results or []:
        answer = result["answers"].get("dept")
        if answer and answer["confidence"] < 0.6:
            answer["choice"] = "human-review"
            answer["gated"] = True

agent = laya.load("convaiinnovations/laya", on_predict_end=gate)

ctx.results contém um dict por estado da chamada, por isso o ciclo anota cada resposta que falhe o limiar, e não apenas a do primeiro estado.

Fixar o encaminhamento

Força um checkpoint para uma classe de tráfego.

from laya import Router
from laya.router import RouteDecision

def pin(ctx):
    if "refund" in str(ctx.states[0]).lower():
        ctx.decision = RouteDecision(
            model="typed-decisions",
            repo="convaiinnovations/laya/typed-decisions",
            reason="refund workflow",
            detection=None,
            workflow=None,
        )

router = Router(hooks=[pin])

Por chamada, sem instalar:

router.predict("refund request", QUESTIONS, hooks=[pin])

Ciclo de vida

Observa a construção e a libertação de checkpoints.

from laya import Router

class Lifecycle:
    def on_load(self, ctx):
        print("loaded", ctx.model, "agent", type(ctx.agent).__name__)

    def on_evict(self, ctx):
        print("evicted", ctx.model)

router = Router(max_loaded=1, hooks=[Lifecycle()])
router.preload(["english", "multilingual"])   # on_load fires per build
router.unload()                               # on_evict fires per freed checkpoint

Composição

Primeiro os hooks instalados, depois os invocáveis de conveniência; todos partilham um contexto.

import laya

class Metrics:
    def on_predict_end(self, ctx):
        record_latency(ctx.model, ctx.elapsed_ms)

def redact(ctx):
    ctx.states = [strip_pii(s) for s in ctx.states]

def audit(ctx):
    ship(ctx.run_id, ctx.results)

agent = laya.load(
    "convaiinnovations/laya",
    hooks=[Metrics()],              # installed, runs first
    on_predict_start=redact,        # convenience, appended
    on_predict_end=audit,           # convenience, appended
    hooks_raise=True,
)

Hooks por chamada

Sobrepõe ou estende hooks para uma única chamada.

agent.system_one(
    state,
    questions,
    on_predict_end=lambda ctx: debug_dump(ctx),
    hooks_raise=False,
)

router.predict(
    state,
    questions,
    hooks=[pin],                    # applies to on_route too
    on_predict_end=audit,
)

Lote

Os hooks disparam uma vez por chamada Agent.predict_batch, com ctx.states a conter todos os estados. O Router.predict_batch corre os seus hooks ao nível do Router uma vez por pedido em vez disso, cada um com um estado e o seu próprio run_id, por isso o mesmo hook aí escreve um registo por chamada do hook.

def audit_batch(ctx):
    for state, result in zip(ctx.states, ctx.results):
        ship_one(ctx.run_id, state, result)

results = agent.predict_batch([state_a, state_b, state_c], questions, on_predict_end=audit_batch)

Servidor HTTP

Os hooks de Router disparam para o laya.serve automaticamente, porque o servidor chama Router.predict.

from laya import Router
from laya.serve import create_app

router = Router(hooks=[Metrics()], on_predict_end=audit, hooks_raise=False)
app = create_app(router=router)

ONNXAgent

O ONNXAgent expõe apenas os eventos ao nível da predição.

from laya.onnx_agent import ONNXAgent

agent = ONNXAgent("convaiinnovations/laya", onnx_path="laya.onnx", on_predict_end=audit)
agent.system_one(state, questions)

Registo em runtime

Anexa, remove ou limita hooks após a construção.

agent.add_hook(Metrics())          # attach at runtime
agent.remove_hook(Metrics())       # by identity

with agent.hooks_installed(DebugDump()):
    agent.system_one(state, questions)   # DebugDump only here

Classe base e predefinições para todo o processo

Faz subclasse de BaseHook para sobrepor apenas o que precisas, e registra algo uma vez para todo o processo em vez de o passar a todos os Agent e Router.

from laya import BaseHook, hooks

class Audit(BaseHook):
    def on_predict_end(self, ctx):
        ship(ctx.run_id, ctx.results)

hooks.set_default_hooks(hooks=[Audit()])   # runs for every call in the process

# later, or in tests:
hooks.clear_default_hooks()

Orçamento de tokens

Ajusta o orçamento de tokens para uma chamada, a partir de um hook ou de um argumento por chamada. O valor de um hook substitui o orçamento em vigor, por isso tem de ler esse orçamento primeiro: dimensiona pela pergunta mais larga da chamada, mantém-te acima do piso de tokens que o core aplica às opções, e alarga max_len a par de head_max_len para que o estado guarde uma janela.

def widen(ctx):
    k = max((len(q.get("criteria", {}) or {}) for q in ctx.questions.values()), default=0)
    if k < 50:
        return
    cfg = getattr(ctx.agent, "cfg", None) or {}
    head = ctx.head_max_len if ctx.head_max_len is not None else cfg.get("head_max_len", 192)
    window = ctx.max_len if ctx.max_len is not None else cfg.get("max_len", 512)
    need = 16 + 8 * k
    if need > head:
        ctx.head_max_len = need
        ctx.max_len = max(window, need + 8 + 64)

agent = laya.load("convaiinnovations/laya", on_predict_start=widen)

# or per call
agent.system_one(state, questions, head_max_len=512, max_len=1024)

Ajuste do orçamento de tokens tem a aritmética por detrás de cada linha, e predict_shortlist é a opção quando um conjunto de etiquetas não cabe nem numa janela alargada.

Hooks assíncronos

Envolve um hook assíncrono em AsyncHook; cada corrotina corre até ao fim no core síncrono, quer o autor da chamada seja síncrono quer já esteja dentro de um event loop.

import laya
from laya import AsyncHook

class RemoteAudit:
    async def on_predict_end(self, ctx):
        await ship(ctx.run_id, ctx.results)

agent = laya.load("convaiinnovations/laya", hooks=[AsyncHook(RemoteAudit())])

Um invocável assíncrono simples também funciona:

async def async_end(ctx):
    await ship(ctx.results)

agent.system_one(state, questions, on_predict_end=async_end)

Tempo limite de hook

Limita cada chamada de hook, para que um hook preso não pendure um pedido servido:

agent = laya.load("convaiinnovations/laya", on_predict_end=metrics, hooks_timeout=2.0)

# or per call
agent.system_one(state, questions, on_predict_end=metrics, hooks_timeout=0.5)

Um hook que excede o tempo levanta TimeoutError (ou avisa quando hooks_raise=False). O hook continua a correr em segundo plano, por isso dá também às chamadas de rede o seu próprio timeout. Vê erros.

Testar hooks

Afirma o que um hook viu sem um modelo: conduz predict_batch com os ajudantes de encode/forward/decode postiços, como faz tests/test_hooks.py.

seen = []
agent.predict_batch(["s0"], questions, on_predict_end=lambda ctx: seen.append(ctx.results))
assert len(seen) == 1

A superfície da API é fixada por tests/test_hooks_api.py.

Ver também