Merge pull request #10262 from velero-io/copilot/backport-10250-again
Run the E2E test on kind / build (push) Failing after 3m36s
Run the E2E test on kind / setup-test-matrix (push) Successful in 3s
Run the E2E test on kind / run-e2e-test (push) Skipped
Main CI / Build (push) Failing after 53s

[release-1.17] Backport #10250: Fix pod volume restore deadlock
This commit is contained in:
lyndon-li
2026-08-14 15:45:44 +08:00
committed by GitHub
2 changed files with 4 additions and 3 deletions
+1
View File
@@ -0,0 +1 @@
Fix a potential deadlock when resultsLock is held by the informer but blocked on resChan because the early quit of RestorePodVolumes
+3 -3
View File
@@ -106,9 +106,9 @@ func newRestorer(
if pvr.Status.Phase == velerov1api.PodVolumeRestorePhaseCompleted || pvr.Status.Phase == velerov1api.PodVolumeRestorePhaseFailed || pvr.Status.Phase == velerov1api.PodVolumeRestorePhaseCanceled {
r.resultsLock.Lock()
defer r.resultsLock.Unlock()
resChan, ok := r.results[resultsKey(pvr.Spec.Pod.Namespace, pvr.Spec.Pod.Name)]
r.resultsLock.Unlock()
if !ok {
log.Errorf("No results channel found for pod %s/%s to send pod volume restore %s/%s on", pvr.Spec.Pod.Namespace, pvr.Spec.Pod.Name, pvr.Namespace, pvr.Name)
return
@@ -147,7 +147,7 @@ func (r *restorer) RestorePodVolumes(data RestoreData, tracker *volume.RestoreVo
r.repoLocker.Lock(repo.Name)
defer r.repoLocker.Unlock(repo.Name)
resultsChan := make(chan *velerov1api.PodVolumeRestore)
resultsChan := make(chan *velerov1api.PodVolumeRestore, len(volumesToRestore))
r.resultsLock.Lock()
r.results[resultsKey(data.Pod.Namespace, data.Pod.Name)] = resultsChan