jenkins
|
4991493d3b
|
ai(hermes): add operator guide and current GPU shares
|
2026-08-02 03:59:32 -03:00 |
|
jenkins
|
2fe327c7eb
|
monitoring(gpu): use process-level pod attribution
|
2026-08-02 03:31:02 -03:00 |
|
jenkins
|
e794ccf254
|
monitoring(gpu): report time-weighted namespace usage
|
2026-08-02 03:08:20 -03:00 |
|
jenkins
|
b26a4f8c66
|
feat(cassandra): add migration Grafana rollup
|
2026-07-25 00:29:03 -03:00 |
|
jenkins
|
766c96f54d
|
monitoring: filter node dashboards to real nodes
|
2026-07-14 20:24:45 -03:00 |
|
jenkins
|
dad4448ebb
|
monitoring: collapse duplicate Typhon climate series
|
2026-07-14 19:01:53 -03:00 |
|
jenkins
|
8c0e848e30
|
monitoring: scope endpoint node relabel to node-exporter
|
2026-07-14 18:57:51 -03:00 |
|
jenkins
|
575cae700d
|
monitoring: relabel pod-network node-exporter names
|
2026-07-14 18:30:43 -03:00 |
|
jenkins
|
c02f36e24c
|
monitoring: move node-exporter host port
|
2026-07-14 18:23:52 -03:00 |
|
jenkins
|
d1c1172c1d
|
monitoring: avoid node-exporter host port collisions
|
2026-07-14 18:18:03 -03:00 |
|
jenkins
|
c2a4b42b3d
|
monitoring: track titan-23 and pin tiny apps to workers
|
2026-07-14 18:14:38 -03:00 |
|
jenkins
|
15eb7cdba8
|
maintenance: expire completed one-off jobs
|
2026-07-14 17:10:18 -03:00 |
|
jenkins
|
52920d0f8b
|
monitoring: give victoria metrics recovery headroom
|
2026-06-18 22:23:48 -03:00 |
|
jenkins
|
a9ddc80e36
|
recovery(ananke): keep flux holds and place metrics on longhorn nodes
|
2026-06-18 22:08:14 -03:00 |
|
jenkins
|
28356e89fc
|
monitoring: keep nvidia exporter off oceanus
|
2026-06-09 00:55:11 -03:00 |
|
jenkins
|
654900b8a2
|
veles: stage atlas infrastructure
|
2026-06-09 00:46:46 -03:00 |
|
jenkins
|
4fd8a00d4a
|
monitoring(testing): cap history panel ranges
|
2026-06-05 13:22:29 -03:00 |
|
jenkins
|
75d002dc88
|
monitoring(testing): cap expensive dashboard queries
|
2026-06-05 13:15:12 -03:00 |
|
jenkins
|
a2ecdef536
|
monitoring(testing): restore lesavka suite visibility
|
2026-06-05 01:04:56 -03:00 |
|
jenkins
|
f2ad8cca4c
|
monitoring(testing): clean up dashboard health signals
|
2026-06-04 16:09:08 -03:00 |
|
jenkins
|
5e27384ea2
|
monitoring(gpu): show activity share by namespace
|
2026-05-22 04:22:51 -03:00 |
|
jenkins
|
d21b61f6d9
|
monitoring(gpu): count monitored GPU pool devices
|
2026-05-22 03:23:36 -03:00 |
|
jenkins
|
b367c6dea3
|
monitoring: keep quality probe on worker nodes
|
2026-05-22 03:16:01 -03:00 |
|
jenkins
|
6388ef5c6d
|
monitoring(gpu): add pool utilization counters
|
2026-05-22 03:09:10 -03:00 |
|
jenkins
|
570b1212d7
|
monitoring(gpu): normalize utilization pie to pool capacity
|
2026-05-22 02:55:24 -03:00 |
|
jenkins
|
b5dc723e02
|
monitoring(gpu): hide zero-utilization namespaces
|
2026-05-22 02:35:51 -03:00 |
|
jenkins
|
fd3da0e2ae
|
monitoring(gpu): add process-level utilization attribution
|
2026-05-22 02:28:08 -03:00 |
|
jenkins
|
5513608b1a
|
monitoring(gpu): remove ambiguous shared wording
|
2026-05-22 01:55:25 -03:00 |
|
jenkins
|
72e4dcd84b
|
monitoring(gpu): attribute utilization to namespaces
|
2026-05-22 01:46:32 -03:00 |
|
jenkins
|
4e82df6891
|
monitoring(gpu): show utilization with idle fallback
|
2026-05-21 15:26:02 -03:00 |
|
jenkins
|
d9955af899
|
monitoring(gpu): clarify reservation accounting
|
2026-05-21 13:04:58 -03:00 |
|
jenkins
|
5ec561f620
|
monitoring(grafana): lower recovery scheduling requests
|
2026-05-20 18:16:04 -03:00 |
|
jenkins
|
f010d0547f
|
monitoring(grafana): keep off control plane spillover
|
2026-05-20 18:07:11 -03:00 |
|
jenkins
|
ed81d52dd9
|
monitoring(grafana): avoid fragile placement and init pull
|
2026-05-20 17:25:39 -03:00 |
|
jenkins
|
400077436b
|
monitoring(grafana): harden scheduling and readiness
|
2026-05-20 17:00:33 -03:00 |
|
jenkins
|
f2ae3c1b0c
|
monitoring(testing): make branch filter static
|
2026-05-20 15:10:24 -03:00 |
|
jenkins
|
974955ac83
|
monitoring(testing): backfill category health rollups
|
2026-05-20 14:39:07 -03:00 |
|
jenkins
|
1c6c3992cf
|
monitoring(testing): reduce month-range query cost
|
2026-05-20 13:26:33 -03:00 |
|
jenkins
|
109698a2e3
|
monitoring(testing): attach branch labels to run rollups
|
2026-05-20 12:54:12 -03:00 |
|
jenkins
|
e380b65eb9
|
monitoring(testing): memoize dashboard freshness panels
|
2026-05-20 12:45:50 -03:00 |
|
jenkins
|
3a06d29387
|
monitoring(testing): record check health timelines
|
2026-05-20 12:14:49 -03:00 |
|
jenkins
|
b70afe2f03
|
monitoring(testing): memoize slow dashboard panels
|
2026-05-20 11:52:25 -03:00 |
|
jenkins
|
fe37f12e32
|
monitoring(testing): surface current gate health
|
2026-05-20 11:01:28 -03:00 |
|
jenkins
|
48e434a028
|
ops: harden ci placement and gpu idle reporting
|
2026-05-20 04:27:26 -03:00 |
|
jenkins
|
2c4b1b9cc9
|
monitoring: hide idle gpu share during activity
|
2026-05-19 23:30:22 -03:00 |
|
jenkins
|
ea2071bbc5
|
monitoring(testing): memoize gate check health
|
2026-05-19 22:41:02 -03:00 |
|
jenkins
|
c75e0d1b88
|
monitoring(testing): roll up current test case state
|
2026-05-19 11:09:29 -03:00 |
|
jenkins
|
5a356e8aed
|
monitoring: avoid titan-04 for quality gateway
|
2026-05-19 07:52:18 -03:00 |
|
jenkins
|
e29299a90d
|
monitoring(testing): dedupe run counters by scrape target
|
2026-05-19 07:46:06 -03:00 |
|
jenkins
|
8bf3d63bae
|
monitoring(testing): prefer fresh coverage metrics
|
2026-05-19 06:31:04 -03:00 |
|