В ядре Linux устранена следующая уязвимость:
mm/migrate: сообщает о состояниях покоя задач RCU вmigrate_pages_batch()
Migrate_pages_batch() отменяет сопоставление каждого фолио перед его перемещением, и каждый
unmap запускает обратные вызовы mmu_notifier, которые делают недействительными. На хостах KVM
try_to_migrate() заканчивается в kvm_mmu_notifier_invalidate_range_start() ->
tdp_mmu_zap_leafs(), который требует больших затрат, поэтому при отмене сопоставления большого пакета сохраняется
процессор занят в течение длительного времени. Цикл уже вызывает cond_resched(), но в ядрах PREEMPTION это
бездействие и принудительное прерывание не являются состоянием покоя Tasks-RCU.
Поэтому длинная партия никогда не сообщает о состоянии покоя, и
задача миграции (например, kcompactd) становится блокировкой Tasks-RCU, останавливая выполнение
Льготный период Tasks-RCU в минутах, который распространен в Метапарке:
ИНФОРМАЦИЯ: rcu_tasks обнаружил зависания в задачах:
0000000055349ecc: .. nvcsw: 1157401/1157401 удержание: 1 Idle_cpu: -1/56 задача: состояние kcompactd0: запущенная задача R
Отслеживание вызова:
tdp_mmu_zap_leafs
tdp_mmu_next_root
gfn_to_pfn_cache_invalidate_start
kvm_mmu_notifier_invalidate_range_start
__mmu_notifier_invalidate_range_start
try_to_migrate_one
try_to_migrate
Migrate_pages_batch
мигрировать_страницы
компактная_зона
компактный_узел
kcompactd
kthread
Используйте cond_resched_tasks_rcu_qs(), чтобы о состоянии покоя сообщалось даже
когда cond_resched() ничего не делает. Это также обсуждалось в [1]
Показать оригинальное описание (EN)
In the Linux kernel, the following vulnerability has been resolved: mm/migrate: report RCU-tasks quiescent states in migrate_pages_batch() migrate_pages_batch() unmaps each folio before moving it, and every unmap runs the mmu_notifier invalidate callbacks. On KVM hosts try_to_migrate() ends up in kvm_mmu_notifier_invalidate_range_start() -> tdp_mmu_zap_leafs(), which is expensive, so unmapping a large batch keeps the CPU busy for a long time. The loop already calls cond_resched(), but on PREEMPTION kernels that is a no-op, and involuntary preemption is not a Tasks-RCU quiescent state. A long batch therefore never reports a quiescent state, and the migrating task (e.g. kcompactd) becomes a Tasks-RCU holdout, stalling the Tasks-RCU grace period for minutes, which is common at Meta fleet: INFO: rcu_tasks detected stalls on tasks: 0000000055349ecc: .. nvcsw: 1157401/1157401 holdout: 1 idle_cpu: -1/56 task:kcompactd0 state:R running task Call Trace: tdp_mmu_zap_leafs tdp_mmu_next_root gfn_to_pfn_cache_invalidate_start kvm_mmu_notifier_invalidate_range_start __mmu_notifier_invalidate_range_start try_to_migrate_one try_to_migrate migrate_pages_batch migrate_pages compact_zone compact_node kcompactd kthread Use cond_resched_tasks_rcu_qs() so a quiescent state is reported even when cond_resched() does nothing. This has also been discussed at [1]