jenkins
|
a2564f8611
|
monitoring: retain daily availability through retries
|
2026-08-04 21:47:30 -03:00 |
|
jenkins
|
ba4b871a62
|
monitoring: publish availability outside query pool
|
2026-08-04 21:40:24 -03:00 |
|
jenkins
|
af10f7aadc
|
monitoring: add daily availability rollups
|
2026-08-04 21:24:47 -03:00 |
|
jenkins
|
5f692ecd3d
|
monitoring: add compact availability fallback
|
2026-08-04 21:14:06 -03:00 |
|
jenkins
|
83696d46d2
|
monitoring: use request success for availability
|
2026-08-04 21:12:31 -03:00 |
|
jenkins
|
6b1d6388db
|
monitoring: measure gateway availability
|
2026-08-04 21:02:19 -03:00 |
|
jenkins
|
026db898fc
|
monitoring: preserve serving availability history
|
2026-08-04 18:39:36 -03:00 |
|
jenkins
|
8d16b790af
|
monitoring: fall back to live serving state
|
2026-08-04 18:16:13 -03:00 |
|
jenkins
|
5fabd1a84b
|
monitoring: avoid unstable volume hosts
|
2026-08-04 18:06:43 -03:00 |
|
jenkins
|
e9b4404e02
|
monitoring: render test category zero state
|
2026-08-04 12:34:08 -03:00 |
|
jenkins
|
7c6e7f9736
|
monitoring: reload vmalert rules automatically
|
2026-08-04 12:24:38 -03:00 |
|
jenkins
|
e354f3f83a
|
monitoring: prevent query pool starvation
|
2026-08-04 12:22:23 -03:00 |
|
jenkins
|
1c070d96d4
|
monitoring(grafana): use Texas timezone
|
2026-08-03 15:58:16 -03:00 |
|
jenkins
|
8e7327a7ef
|
fix(monitoring): reload provisioned Grafana rules
|
2026-08-03 04:05:33 -03:00 |
|
jenkins
|
a00175b376
|
feat(hermes): add actionable Atlas triage skills
|
2026-08-03 03:58:37 -03:00 |
|
jenkins
|
4dab530baf
|
monitoring(nodes): clamp CPU charts to physical range
|
2026-08-02 19:36:44 -03:00 |
|
jenkins
|
f2328f12e4
|
monitoring(gpu): attribute Jetson activity by allocation
|
2026-08-02 04:26:33 -03:00 |
|
jenkins
|
b1ecfe96e4
|
ai(hermes): add operator guide and current GPU shares
|
2026-08-02 03:59:32 -03:00 |
|
jenkins
|
df953359b9
|
monitoring(gpu): use process-level pod attribution
|
2026-08-02 03:31:02 -03:00 |
|
jenkins
|
3255936aeb
|
monitoring(gpu): report time-weighted namespace usage
|
2026-08-02 03:08:20 -03:00 |
|
jenkins
|
a155847915
|
feat(cassandra): add migration Grafana rollup
|
2026-07-25 00:29:03 -03:00 |
|
jenkins
|
48773efbb1
|
monitoring: filter node dashboards to real nodes
|
2026-07-14 20:24:45 -03:00 |
|
jenkins
|
c8707c002d
|
monitoring: collapse duplicate Typhon climate series
|
2026-07-14 19:01:53 -03:00 |
|
jenkins
|
618fd01cc5
|
monitoring: scope endpoint node relabel to node-exporter
|
2026-07-14 18:57:51 -03:00 |
|
jenkins
|
921edc257c
|
monitoring: relabel pod-network node-exporter names
|
2026-07-14 18:30:43 -03:00 |
|
jenkins
|
e03598caa2
|
monitoring: move node-exporter host port
|
2026-07-14 18:23:52 -03:00 |
|
jenkins
|
4f4a5f99b7
|
monitoring: avoid node-exporter host port collisions
|
2026-07-14 18:18:03 -03:00 |
|
jenkins
|
bea20b9c97
|
monitoring: track titan-23 and pin tiny apps to workers
|
2026-07-14 18:14:38 -03:00 |
|
jenkins
|
6d200d79ae
|
maintenance: expire completed one-off jobs
|
2026-07-14 17:10:18 -03:00 |
|
jenkins
|
8d3402beb7
|
monitoring: give victoria metrics recovery headroom
|
2026-06-18 22:23:48 -03:00 |
|
jenkins
|
e7ec333fb0
|
recovery(ananke): keep flux holds and place metrics on longhorn nodes
|
2026-06-18 22:08:14 -03:00 |
|
jenkins
|
b395fb6abb
|
monitoring: keep nvidia exporter off oceanus
|
2026-06-09 00:55:11 -03:00 |
|
jenkins
|
1d20fb35d2
|
veles: stage atlas infrastructure
|
2026-06-09 00:46:46 -03:00 |
|
jenkins
|
2e854f7b5b
|
monitoring(testing): cap history panel ranges
|
2026-06-05 13:22:29 -03:00 |
|
jenkins
|
0a031b8d13
|
monitoring(testing): cap expensive dashboard queries
|
2026-06-05 13:15:12 -03:00 |
|
jenkins
|
255b05bf44
|
monitoring(testing): restore lesavka suite visibility
|
2026-06-05 01:04:56 -03:00 |
|
jenkins
|
56a29fce03
|
monitoring(testing): clean up dashboard health signals
|
2026-06-04 16:09:08 -03:00 |
|
jenkins
|
04175d33ab
|
monitoring(gpu): show activity share by namespace
|
2026-05-22 04:22:51 -03:00 |
|
jenkins
|
250a850871
|
monitoring(gpu): count monitored GPU pool devices
|
2026-05-22 03:23:36 -03:00 |
|
jenkins
|
69584c8a60
|
monitoring: keep quality probe on worker nodes
|
2026-05-22 03:16:01 -03:00 |
|
jenkins
|
491da8a7f5
|
monitoring(gpu): add pool utilization counters
|
2026-05-22 03:09:10 -03:00 |
|
jenkins
|
8002181f36
|
monitoring(gpu): normalize utilization pie to pool capacity
|
2026-05-22 02:55:24 -03:00 |
|
jenkins
|
ddb49dc62d
|
monitoring(gpu): hide zero-utilization namespaces
|
2026-05-22 02:35:51 -03:00 |
|
jenkins
|
95dc2c5007
|
monitoring(gpu): add process-level utilization attribution
|
2026-05-22 02:28:08 -03:00 |
|
jenkins
|
b3c76d8707
|
monitoring(gpu): remove ambiguous shared wording
|
2026-05-22 01:55:25 -03:00 |
|
jenkins
|
2a1e4b3c49
|
monitoring(gpu): attribute utilization to namespaces
|
2026-05-22 01:46:32 -03:00 |
|
jenkins
|
5ddb428a96
|
monitoring(gpu): show utilization with idle fallback
|
2026-05-21 15:26:02 -03:00 |
|
jenkins
|
1cc2372791
|
monitoring(gpu): clarify reservation accounting
|
2026-05-21 13:04:58 -03:00 |
|
jenkins
|
57e021425e
|
monitoring(grafana): lower recovery scheduling requests
|
2026-05-20 18:16:04 -03:00 |
|
jenkins
|
17094f1cd6
|
monitoring(grafana): keep off control plane spillover
|
2026-05-20 18:07:11 -03:00 |
|