Havaittavuus
AiHummerin havaittavuudella on kaksi pintaa: portti toimii Prometheus GET /metrics päätepiste, josta voit kerätä perusteet, ja se voi valinnaisesti työntää telemetriaa OTLP:n yli OpenTelemetry-päätepisteeseen, jonka määrität. Kaavi /metrics perusseuranta; jälkien ja runsaan mittariston osalta osoita AiHummer OTLP-kerääjääsi ja visualisoi tiedot mukana tulevilla Grafana-hallintapaneeleilla.
[!NOTE] pprof (
/debug/pprof) on ei paljastettu.
Prometheus /metrics päätepiste
GET /metrics tarjoaa Prometheus-teksti-muotoisia mittareita ilman ylimääräistä asetusta. Vain ei-salaiset mittarit ovat näkyvissä — build-tiedot, prosessin käyttöaika ja suorituskyky, tietokantayhteyspoolin tila ja valmiusmittari; ei vuokralaisdataa, ei salaisuuksia, ei per-pyyntötarroja. Jälkien ja laajojen mittareiden osalta käytä OTLP pushia.
OTLP-tallennus
Aseta yksittäinen muuttuja laittaaksesi telemetrian päälle:
# gateway.env — export telemetry to your OTLP collector
AIHUMMER_OTEL_ENDPOINT=http://otel-collector:4317
Kanssa AIHUMMER_OTEL_ENDPOINT Aseta, portti työntää telemetrian siihen kerääjään. Sieltä ohjaa se taustajärjestelmääsi (Tempo, mittaritietokanta, lokit) ja Grafanaan.
Paniikkien ja virheiden käsittely
Virheraportteja ei lähetetä koskaan minnekään ulos: portti ei sisällä ulkoisen virheenseurantatyökalun asiakasta eikä ulkoista DSN:ää — tiedot virheistäsi eivät koskaan poistu omalta alueeltasi.
Paniikinsietokyky on siitä huolimatta täydellinen:
- paniikki HTTP-käsittelijässä muuttuu tavalliseksi virhevastaukseksi (500 ja
AIH-…-kuori) — prosessi ei kaadu ja jatkaa muiden pyyntöjen palvelemista; - paniikki taustagoroutinessa napataan myös kiinni eikä se kaada porttia.
Molemmat tapaukset päätyvät jäsenneltyyn lokiin — katso ne sivulla “Lokit” (alla) tai journalctl-komennolla.
Läheiset lokit hallinta-käyttöliittymässä
Hallinnan käyttöliittymät “Lokit” sivu on portaalin lokin reaaliaikainen jono: uusia rivejä tuodaan automaattisesti muutaman sekunnin välein, ja automaattinen vieritys on päällä, kun olet alhaalla. Työkalurivillä on linjahaku ja a tason suodatin (kaikki / virheet / varoitukset / tiedot / debuging). Useat muut sivut (Dashboard, Sessions, Channels) päivittyvät automaattisesti, ja pitkät listat (auditointi, muutokset, ilmoitukset jne.) ladataan sivu sivulta “Näytä lisää” -painikkeella.
Koko lokit kaikista palveluista ovat edelleen elossa systemd:ssä — aihummer logs [unit] tai journalctl -u aihummer-gateway.
Grafana-hallintapaneelit
Valmiit Grafana-hallintapaneelit toimitetaan julkaisun mukana. Tuo ne Grafana-asennukseesi saadaksesi operatiiviset näkymät ilman, että sinun tarvitsee rakentaa paneeleja alusta alkaen.
Mitä katsoa
Nämä ovat signaaleja, jotka kertovat sinulle, että järjestelmä on terve ja vuorot kulkevat:
| Signaali | Miksi se on tärkeää |
|---|---|
| Käännöksen viive | Aktiivin vuorojen päästä päähän reagointikyky |
| Virheprosentti | Epäonnistuvat vuorot / pyynnöt — ensimmäinen merkki ongelmasta |
| Toimitusjärjestelyt | Saapuvatko vastaukset todella kanaville |
| Odotettavat toimitukset | Toimittamattomien vastausten kertymä; jatkuva kasvu tarkoittaa, että toimitus on jumissa |
Jatkuva nousu odottavat tai toistuvasti epäonnistuneet toimitukset on selkein varhainen varoitus siitä, että toimitukset viivästyvät — seuraa sitä käyttöönottojen ja häiriöiden aikana.
Järjestelmän päätelaitteet
OTLP:n lisäksi yhdyskäytävä tarjoaa pieniä HTTP-päätepisteitä, jotka ovat hyödyllisiä tarkistuksiin, kelloihin ja asiakasdiagnostiikkaan:
| Menetelmä | Päätepiste | Tarkoitus |
|---|---|---|
GET |
/metrics |
Prometheus-mittarit (rakenne, ajonaika, DB-allas, valmiustila) |
GET |
/healthz |
Eliévyys + versio |
GET |
/readyz |
Valmiustila (tarkistaa Postgresin; 503 jos alhaalla) |
GET |
/v1/ping |
Kevyt saavutettavuustarkistus |
GET |
/v1/time |
Palvelimen aika |
POST |
/v1/client-log |
Ota vastaan asiakaspuolen lokitapahtumia |
Terveyden ja valmiuden tarkastukset käsitellään yksityiskohtaisesti kohdassa systemd ja terveystarkastukset.
Minne seuraavaksi
- Anturit ja tuotannon lentoonlähtötarkistuslista: systemd ja terveystarkastukset.
- Mitä tarkkailla jatkuvan päivityksen aikana: Päivityskäytäntö.