From f45a0fad8ac0d9dc2127d57f3e9055f1d69d88cf Mon Sep 17 00:00:00 2001 From: yansun1996 Date: Sat, 25 Jul 2026 08:16:38 +0000 Subject: [PATCH 1/2] docs: bump helm install guide references to v1.5.1 The Kubernetes (Helm) installation guide still referenced v1.5.0 in the helm install --version commands, the chart parameter table image tags, and the DeviceConfig metrics exporter examples, while the chart itself has been released as v1.5.1. Update these to v1.5.1. The 'v1.5.0+' feature-availability note for global image pull secrets is left as-is since it marks when the feature was introduced. --- docs/installation/kubernetes-helm.md | 18 +++++++++--------- 1 file changed, 9 insertions(+), 9 deletions(-) diff --git a/docs/installation/kubernetes-helm.md b/docs/installation/kubernetes-helm.md index 499c3b823..2ec8b6ffd 100644 --- a/docs/installation/kubernetes-helm.md +++ b/docs/installation/kubernetes-helm.md @@ -119,7 +119,7 @@ To install the latest version of the GPU Operator run the following Helm install helm install amd-gpu-operator rocm/gpu-operator-charts \ --namespace kube-amd-gpu \ --create-namespace \ - --version=v1.5.0 + --version=v1.5.1 ``` ```{note} @@ -155,7 +155,7 @@ Installation Options helm install amd-gpu-operator rocm/gpu-operator-charts \ --namespace kube-amd-gpu \ --create-namespace \ - --version=v1.5.0 \ + --version=v1.5.1 \ --set global.imagePullSecrets[0].name=my-registry-secret ``` @@ -171,7 +171,7 @@ Installation with custom options: helm install amd-gpu-operator rocm/gpu-operator-charts \ --namespace kube-amd-gpu \ --create-namespace \ - --version=v1.5.0 \ + --version=v1.5.1 \ -f values.yaml ``` @@ -181,7 +181,7 @@ The following parameters are able to be configued when using the Helm Chart. In |-----|------|---------|-------------| | controllerManager.affinity | object | `{"nodeAffinity":{"preferredDuringSchedulingIgnoredDuringExecution":[{"preference":{"matchExpressions":[{"key":"node-role.kubernetes.io/control-plane","operator":"Exists"}]},"weight":1}]}}` | Deployment affinity configs for controller manager | | controllerManager.manager.image.repository | string | `"docker.io/rocm/gpu-operator"` | AMD GPU operator controller manager image repository | -| controllerManager.manager.image.tag | string | `"v1.5.0"` | AMD GPU operator controller manager image tag | +| controllerManager.manager.image.tag | string | `"v1.5.1"` | AMD GPU operator controller manager image tag | | controllerManager.manager.imagePullPolicy | string | `"Always"` | Image pull policy for AMD GPU operator controller manager pod | | controllerManager.manager.imagePullSecrets | string | `""` | Image pull secret name for pulling AMD GPU operator controller manager image if registry needs credential to pull image | | controllerManager.manager.resources.limits.cpu | string | `"1000m"` | CPU limits for the controller manager. Consider increasing for large clusters | @@ -201,12 +201,12 @@ The following parameters are able to be configued when using the Helm Chart. In | kmm.controller.manager.containerSecurityContext.allowPrivilegeEscalation | bool | `false` | | | kmm.controller.manager.env.relatedImageBuild | string | `"gcr.io/kaniko-project/executor:v1.23.2"` | KMM kaniko builder image for building driver image within cluster | | kmm.controller.manager.env.relatedImageBuildPullSecret | string | `""` | Image pull secret name for pulling KMM kaniko builder image if registry needs credential to pull image | -| kmm.controller.manager.env.relatedImageSign | string | `"docker.io/rocm/kernel-module-management-signimage:v1.5.0"` | KMM signer image for signing driver image's kernel module with given key pairs within cluster | +| kmm.controller.manager.env.relatedImageSign | string | `"docker.io/rocm/kernel-module-management-signimage:v1.5.1"` | KMM signer image for signing driver image's kernel module with given key pairs within cluster | | kmm.controller.manager.env.relatedImageSignPullSecret | string | `""` | Image pull secret name for pulling KMM signer image if registry needs credential to pull image | -| kmm.controller.manager.env.relatedImageWorker | string | `"docker.io/rocm/kernel-module-management-worker:v1.5.0"` | KMM worker image for loading / unloading driver kernel module on worker nodes | +| kmm.controller.manager.env.relatedImageWorker | string | `"docker.io/rocm/kernel-module-management-worker:v1.5.1"` | KMM worker image for loading / unloading driver kernel module on worker nodes | | kmm.controller.manager.env.relatedImageWorkerPullSecret | string | `""` | Image pull secret name for pulling KMM worker image if registry needs credential to pull image | | kmm.controller.manager.image.repository | string | `"docker.io/rocm/kernel-module-management-operator"` | KMM controller manager image repository | -| kmm.controller.manager.image.tag | string | `"v1.5.0"` | KMM controller manager image tag | +| kmm.controller.manager.image.tag | string | `"v1.5.1"` | KMM controller manager image tag | | kmm.controller.manager.imagePullPolicy | string | `"Always"` | Image pull policy for KMM controller manager pod | | kmm.controller.manager.imagePullSecrets | string | `""` | Image pull secret name for pulling KMM controller manager image if registry needs credential to pull image | | kmm.controller.manager.resources.limits.cpu | string | `"500m"` | | @@ -360,7 +360,7 @@ spec: serviceType: "NodePort" # Node port for metrics exporter service, metrics endpoint $node-ip:$nodePort nodePort: 32500 - image: docker.io/rocm/device-metrics-exporter:v1.5.0 + image: docker.io/rocm/device-metrics-exporter:v1.5.1 # Specifythe node to be managed by this DeviceConfig Custom Resource selector: @@ -412,7 +412,7 @@ spec: serviceType: "NodePort" # Node port for metrics exporter service, metrics endpoint $node-ip:$nodePort nodePort: 32500 - image: docker.io/rocm/device-metrics-exporter:v1.5.0 + image: docker.io/rocm/device-metrics-exporter:v1.5.1 # Specifythe node to be managed by this DeviceConfig Custom Resource selector: From 04ab1dadf2630c7629983c5c543c2f5899f800a8 Mon Sep 17 00:00:00 2001 From: yansun1996 Date: Sat, 25 Jul 2026 08:23:56 +0000 Subject: [PATCH 2/2] docs: bump remaining v1.5.0 references to v1.5.1 Update release-pinned version references across the docs that were still on v1.5.0 while the release branch ships v1.5.1: - image tags: device-metrics-exporter, device-config-manager, test-runner (drivers, metrics, dcm, test, and upgrades guides) - upgrade guide helm upgrade --version and --set image.tag examples - developer guide e2e operatortag / OPERATOR_TAG build args Release notes (which describe the v1.5.0 release specifically) and the airgapped-install example comment are intentionally left unchanged. --- docs/contributing/developer-guide.md | 4 ++-- docs/dcm/applying-partition-profiles.rst | 2 +- docs/dcm/device-config-manager.md | 2 +- docs/drivers/installation.md | 4 ++-- docs/metrics/exporter.md | 2 +- docs/test/auto-unhealthy-device-test.md | 4 ++-- docs/test/logs-export.md | 2 +- docs/test/manual-test.md | 10 +++++----- docs/test/pre-start-job-test.md | 2 +- docs/upgrades/componentupgrades.md | 2 +- docs/upgrades/upgrade.md | 8 ++++---- 11 files changed, 21 insertions(+), 21 deletions(-) diff --git a/docs/contributing/developer-guide.md b/docs/contributing/developer-guide.md index d04f0ba0e..cb51e709f 100644 --- a/docs/contributing/developer-guide.md +++ b/docs/contributing/developer-guide.md @@ -128,7 +128,7 @@ docker run --rm \ gpu-op-k8s-e2e:latest \ -kubeconfig /kubeconfig \ -operatorchart /helm-charts \ - -operatortag v1.5.0 \ + -operatortag v1.5.1 \ -test.timeout 60m ``` @@ -146,7 +146,7 @@ docker run --rm -v /path/to/kubeconfig:/kubeconfig:ro \ ```bash # Full install+verify+teardown -make -C tests/k8s-e2e all KUBECONFIG=/path/to/kubeconfig OPERATOR_TAG=v1.5.0 +make -C tests/k8s-e2e all KUBECONFIG=/path/to/kubeconfig OPERATOR_TAG=v1.5.1 # Verify only (pre-deployed) make -C tests/k8s-e2e verify KUBECONFIG=/path/to/kubeconfig diff --git a/docs/dcm/applying-partition-profiles.rst b/docs/dcm/applying-partition-profiles.rst index 62bbfb6c5..2bd056011 100644 --- a/docs/dcm/applying-partition-profiles.rst +++ b/docs/dcm/applying-partition-profiles.rst @@ -176,7 +176,7 @@ After creating the ConfigMap, you need to associate it with the Device Config Ma enable: True # image for the device-config-manager container - image: "rocm/device-config-manager:v1.5.0" + image: "rocm/device-config-manager:v1.5.1" # image pull policy for config manager. Accepted values are Always, IfNotPresent, Never imagePullPolicy: IfNotPresent diff --git a/docs/dcm/device-config-manager.md b/docs/dcm/device-config-manager.md index 85d68033e..dc5c87254 100644 --- a/docs/dcm/device-config-manager.md +++ b/docs/dcm/device-config-manager.md @@ -26,7 +26,7 @@ The Device Config Manager can be enabled by setting the `spec/configManager/enab enable: True # image for the device-config-manager container - image: "rocm/device-config-manager:v1.5.0" + image: "rocm/device-config-manager:v1.5.1" # image pull policy for config manager. Accepted values are Always, IfNotPresent, Never imagePullPolicy: IfNotPresent diff --git a/docs/drivers/installation.md b/docs/drivers/installation.md index f2ea2a176..e54ced07b 100644 --- a/docs/drivers/installation.md +++ b/docs/drivers/installation.md @@ -80,7 +80,7 @@ spec: serviceType: "NodePort" # Node port for metrics exporter service, metrics endpoint $node-ip:$nodePort nodePort: 32500 - image: docker.io/rocm/device-metrics-exporter:v1.5.0 + image: docker.io/rocm/device-metrics-exporter:v1.5.1 # Specifythe node to be managed by this DeviceConfig Custom Resource selector: @@ -159,7 +159,7 @@ spec: serviceType: "NodePort" # Node port for metrics exporter service, metrics endpoint $node-ip:$nodePort nodePort: 32500 - image: docker.io/rocm/device-metrics-exporter:v1.5.0 + image: docker.io/rocm/device-metrics-exporter:v1.5.1 # Specifythe node to be managed by this DeviceConfig Custom Resource selector: diff --git a/docs/metrics/exporter.md b/docs/metrics/exporter.md index 34b065156..6dfc40051 100644 --- a/docs/metrics/exporter.md +++ b/docs/metrics/exporter.md @@ -44,7 +44,7 @@ metricsExporter: nodePort: 32500 # image for the metrics-exporter container - image: "rocm/device-metrics-exporter:v1.5.0" + image: "rocm/device-metrics-exporter:v1.5.1" ``` diff --git a/docs/test/auto-unhealthy-device-test.md b/docs/test/auto-unhealthy-device-test.md index 3c3ba736c..820866c29 100644 --- a/docs/test/auto-unhealthy-device-test.md +++ b/docs/test/auto-unhealthy-device-test.md @@ -25,7 +25,7 @@ metricsExporter: nodePort: 32500 # image for the metrics-exporter container - image: "rocm/device-metrics-exporter:v1.5.0" + image: "rocm/device-metrics-exporter:v1.5.1" # Specify the test runner config testRunner: @@ -33,7 +33,7 @@ testRunner: enable: true # image for the test runner container - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 # specify the mount for test logs logsLocation: diff --git a/docs/test/logs-export.md b/docs/test/logs-export.md index 180bc0fc2..d13e3070b 100644 --- a/docs/test/logs-export.md +++ b/docs/test/logs-export.md @@ -166,7 +166,7 @@ Example: enable: True # testrunner image - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 # image pull policy for the testrunner # default value is IfNotPresent for valid tags, Always for no tag or "latest" tag diff --git a/docs/test/manual-test.md b/docs/test/manual-test.md index 7f244b62f..45fb7c5cd 100644 --- a/docs/test/manual-test.md +++ b/docs/test/manual-test.md @@ -124,7 +124,7 @@ spec: name: test-runner-volume containers: - name: amd-test-runner - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 imagePullPolicy: IfNotPresent securityContext: # setup security context for container to get access to device related interfaces privileged: true @@ -274,7 +274,7 @@ spec: requests: amd.com/gpu: 8 # requesting all GPUs on the node name: amd-test-runner - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 imagePullPolicy: IfNotPresent securityContext: # setup security context for container to get access to device related interfaces privileged: true @@ -450,7 +450,7 @@ spec: name: test-runner-volume containers: - name: init-test-runner - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 imagePullPolicy: IfNotPresent securityContext: # setup security context for container to get access to device related interfaces privileged: true @@ -660,7 +660,7 @@ spec: name: test-runner-volume containers: - name: amd-test-runner - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 imagePullPolicy: IfNotPresent securityContext: # setup security context for container to get access to device related interfaces privileged: true @@ -832,7 +832,7 @@ spec: name: test-runner-volume containers: - name: amd-test-runner - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 imagePullPolicy: IfNotPresent securityContext: # setup security context for container to get access to device related interfaces privileged: true diff --git a/docs/test/pre-start-job-test.md b/docs/test/pre-start-job-test.md index e2ca8e00a..86484ff9a 100644 --- a/docs/test/pre-start-job-test.md +++ b/docs/test/pre-start-job-test.md @@ -120,7 +120,7 @@ spec: name: test-runner-volume initContainers: - name: init-test-runner - image: docker.io/rocm/test-runner:v1.5.0 + image: docker.io/rocm/test-runner:v1.5.1 imagePullPolicy: IfNotPresent resources: requests: diff --git a/docs/upgrades/componentupgrades.md b/docs/upgrades/componentupgrades.md index b1d2c465b..941ab4bc1 100644 --- a/docs/upgrades/componentupgrades.md +++ b/docs/upgrades/componentupgrades.md @@ -121,7 +121,7 @@ Updated CR: enable: True serviceType: "ClusterIP" port: 5000 - image: rocm/device-metrics-exporter:v1.5.0 + image: rocm/device-metrics-exporter:v1.5.1 upgradePolicy: upgradeStrategy: OnDelete ``` diff --git a/docs/upgrades/upgrade.md b/docs/upgrades/upgrade.md index db6b972ce..2ff83bb9b 100644 --- a/docs/upgrades/upgrade.md +++ b/docs/upgrades/upgrade.md @@ -68,12 +68,12 @@ helm repo update # Perform helm upgrade helm upgrade amd-gpu-operator rocm/gpu-operator-charts \ -n kube-amd-gpu \ - --version=v1.5.0 \ + --version=v1.5.1 \ --debug ``` * When upgrading a Helm chart, customized operator controller image URLs set in the older version's values.yaml (via `--set` or `-f values.yaml`) will persist due to default Helm behavior. -* To ensure a successful upgrade, you must use the target version's operator image in the helm upgrade command. This is because upgrade hooks rely on the target version's images for CRD updates. For example, to upgrade to v1.5.0 when you already customized operator image URL in old version helm chart, use `--set` to ask helm for using correct version image for executing helm upgrade hooks: +* To ensure a successful upgrade, you must use the target version's operator image in the helm upgrade command. This is because upgrade hooks rely on the target version's images for CRD updates. For example, to upgrade to v1.5.1 when you already customized operator image URL in old version helm chart, use `--set` to ask helm for using correct version image for executing helm upgrade hooks: ```bash # Fetch latest info from helm repo @@ -81,10 +81,10 @@ helm repo update # Perform helm upgrade helm upgrade amd-gpu-operator rocm/gpu-operator-charts \ -n kube-amd-gpu \ - --version=v1.5.0 \ + --version=v1.5.1 \ --debug \ --set controllerManager.manager.image.repository=docker.io/rocm/gpu-operator \ - --set controllerManager.manager.image.tag=v1.5.0 + --set controllerManager.manager.image.tag=v1.5.1 ``` ```{note}