Observerbarhet
AiHummer-observerbarhet har två ytor: portalen fungerar som en Prometheus GET /metrics slutpunkt som du kan hämta grundläggande information från, och det kan valfritt skicka telemetri över OTLP till en OpenTelemetry-slutpunkt du konfigurerar. Skrapa /metrics för baslinjeövervakning; för spår och rika mätvärden, rikta AiHummer mot din OTLP-samlare och visualisera datan med de medföljande Grafana-instrumentpanelerna.
[!NOTE] pprof (
/debug/pprof) är inte exponerad.
Prometheus /metrics ändpunkt
GET /metrics serverar Prometheus text-format metriker utan extra inställning. Endast icke-känsliga mätare exponeras — bygginformation, processens drifttid och runtime, databasanslutningspoolens tillstånd och en beredskapsmätare; inga hyresgästsdata, inga hemligheter, inga etiketter per förfrågan. För spårningar och detaljerade metriker, använd OTLP push.
OTLP push
Ställ in en enskild variabel för att slå på telemetri:
# gateway.env — export telemetry to your OTLP collector
AIHUMMER_OTEL_ENDPOINT=http://otel-collector:4317
Med AIHUMMER_OTEL_ENDPOINT När det har angetts skickar gatewayen telemetri till den samlaren. Därifrån kan du routa det till din backend (Tempo, en mätlagring, loggar) och in i Grafana.
Hantering av panics och fel
Felrapporter skickas aldrig någonstans utanför: gatewayen innehåller ingen extern felspårarklient och ingen extern DSN — data om dina fel lämnar aldrig din perimeter.
Motståndskraften mot panics är ändå fullständig:
- en panic i en HTTP-hanterare blir ett vanligt felsvar (en 500 med ett
AIH-…-kuvert) — processen dör inte och fortsätter att betjäna övriga förfrågningar; - en panic i en bakgrundsgoroutine fångas också upp och fäller inte gatewayen.
Båda fallen hamnar i den strukturerade loggen — läs dem på sidan Loggar (nedan) eller via journalctl.
Direktloggar i administrationsgränssnittet
Admingränssnittets Loggar sidan är en live-svans av gatewayjournalen: nya rader hämtas automatiskt var några sekund, med autoscroll medan du är längst ner. Verktygsfältet har en linjesökning och en nivåfilter (alla / fel / varningar / info / felsökning). Flera andra sidor (Instrumentpanel, Sessioner, Kanaler) uppdateras också automatiskt, och långa listor (granskning, ändringar, meddelanden och så vidare) laddas sida för sida med en “Visa mer”-knapp.
Fullständiga loggar över varje tjänst finns fortfarande kvar i systemd — aihummer logs [unit] eller journalctl -u aihummer-gateway.
Grafana-instrumentpaneler
Färdiga Grafana-instrumentpaneler levereras med versionen. Importera dem till din Grafana-instans för att få de operativa vyerna utan att bygga paneler från början.
Vad man ska titta på
Det här är signalerna som talar om för dig att systemet är friskt och att turerna flyter:
| Signal | Varför det är viktigt |
|---|---|
| Svarsfördröjning | End-to-end-responsivitet för agentvändningar |
| Felprocent | Misslyckande med turer/förfrågningar — det första tecknet på problem |
| Leveransdispositioner | Om svar faktiskt når kanaler |
| Väntande leveranser | Upplupen kö av obeställda svar; fortsatt tillväxt innebär att leveransen har fastnat |
En ihållande ökning av väntande eller upprepade misslyckade leveranser är den tydligaste tidiga varningen på att leveransen börjar backa — håll koll på det under utrullningar och incidenter.
Systemändpunkter
Parallellt med OTLP exponerar gatewayen små HTTP-endpoints som är användbara för sonder, klockor och klientdiagnostik:
| Metod | Slutpunkt | Syfte |
|---|---|---|
GET |
/metrics |
Prometheus-metriker (bygg, körning, DB-pool, beredskap) |
GET |
/healthz |
Liveness + version |
GET |
/readyz |
Klarhet (kontrollerar Postgres; 503 om den är nere) |
GET |
/v1/ping |
Lättviktskontroll av räckvidd |
GET |
/v1/time |
Servertid |
POST |
/v1/client-log |
Ta emot logghändelser på klientsidan |
Hälso- och beredskapskontrollerna behandlas i detalj under systemd och hälsokontroller.
Vart härnäst
- Prober och produktionspre-flight-checklistan: systemd och hälsokontroller.
- Vad man ska titta på under en rullande uppgradering: Uppgraderingspolicy.