folly::RWSpinLock 분석
#한 줄 요약
folly::RWSpinLock은 4-byte 상태에 spin만 하는 reader-writer lock. critical section이 수십 cycle 이내면 SharedMutex의 spin-then-futex보다 빠르다. wait가 길어지면 CPU 낭비.
#동기
SharedMutex도 짧은 wait는 spin한다. 그런데 spin 후에도 lock 못 잡으면 futex로 sleep — 이때 syscall 비용이 발생. critical section이 항상 5-50 cycle 정도라면 spin만 하는 게 syscall 한 번보다 싸다.
critical section length ←→ best primitive < 50 cycle : atomic / no lock 50 - 500 cycle : RWSpinLock / SpinLock 500 cycle - 100 μs : SharedMutex / Mutex (spin then sleep) > 100 μs : Mutex + sleep, condition variableRWSpinLock은 두 번째 구간. fbcode에서 hot path의 작은 metric 갱신, 작은 counter 보호에 사용.
folly::RWSpinLock lock;{ folly::RWSpinLock::WriteHolder g(&lock); counter += delta; // 1-2 instruction}#API & 사용법
#include <folly/synchronization/RWSpinLock.h>
folly::RWSpinLock lock;
// 1. Write{ folly::RWSpinLock::WriteHolder g(&lock); // exclusive}
// 2. Read{ folly::RWSpinLock::ReadHolder g(&lock); // shared}
// 3. Upgrade{ folly::RWSpinLock::UpgradedHolder ug(&lock); // read-like, but can promote to write folly::RWSpinLock::WriteHolder wg(std::move(ug));}
// 4. tryif (lock.try_lock()) { /* write */ }if (lock.try_lock_shared()) { /* read */ }표준 unique_lock/shared_lock과 호환되지 않음 — 자체 Holder type만. Holder가 RAII unlock.
#내부 구현
// 약식 — folly/synchronization/RWSpinLock.hclass RWSpinLock { // state bit layout (32-bit): // bit 0 : writer (1 bit) // bit 1 : upgrade pending // bit 2-31 : reader count std::atomic<int32_t> state_;};4-byte. SharedMutex와 동일 size. 차이는 contended path.
#lock (write)
// 약식void lock() { while (true) { int32_t expected = 0; if (state_.compare_exchange_weak(expected, kWriterBit, std::memory_order_acquire)) { return; } do { cpu_pause(); // PAUSE instruction } while (state_.load(std::memory_order_relaxed) != 0); }}CAS spin + load spin. PAUSE instruction이 spin loop의 cache traffic을 줄임 (Intel pipeline hint).
futex 호출 없음. 영원히 spin.
#lock_shared
// 약식void lock_shared() { while (true) { int32_t old = state_.load(std::memory_order_relaxed); if (!(old & kWriterBit) && !(old & kUpgradeBit)) { if (state_.compare_exchange_weak(old, old + kReaderIncrement, std::memory_order_acquire)) { return; } } else { cpu_pause(); } }}writer가 있거나 upgrade가 pending이면 reader도 양보 (writer-priority 비슷).
#Unlock
void unlock() { state_.fetch_and(~kWriterBit, std::memory_order_release); }void unlock_shared() { state_.fetch_sub(kReaderIncrement, std::memory_order_release); }waker 없음. 다른 thread는 spin 중이므로 알아서 본다.
#std/abseil 비교
// std — spin lock 없음// 직접 구현: std::atomic_flag, std::atomic<int> + CAS spin
// abseilabsl::base_internal::SpinLock spin_mu; // internal use// public API는 추천 안 함
// follyfolly::SpinLock sl; // 단순 mutexfolly::RWSpinLock rw; // reader-writerfolly::PicoSpinLock<T> psl; // 다음 글 — 1-byte| 항목 | std (직접) | absl::SpinLock | folly::RWSpinLock |
|---|---|---|---|
| Reader/Writer | 직접 구현 | exclusive only | O |
| Public API | 없음 | internal | O |
| Park 폴백 | 없음 | 길어지면 yield | 없음 |
| sizeof | 4 byte (CAS) | 16 byte | 4 byte |
abseil은 spin lock을 내부 전용으로 두고 외부에는 absl::Mutex만 권장. folly는 RWSpinLock을 공개 API로 제공.
#성능
benchmark: 8 threads, critical section = increment counter (5 cycle) throughput / total folly::RWSpinLock 400 M ops/s folly::SpinLock 420 M folly::SharedMutex 180 M std::shared_mutex 45 M std::atomic<int> fetch_add 600 M (no lock)spin lock이 SharedMutex 대비 2배. atomic이 더 빠르나 lock 의미가 필요한 경우는 spin lock.
critical section이 길어지면:
critical section = 10 μs folly::RWSpinLock 50 M (CPU 100% spin) folly::SharedMutex 48 M (sleep, CPU 70%)비슷한 throughput에 CPU 사용 차이. RWSpinLock은 power 낭비.
#코드 리뷰 포인트
// Good — 매우 짧은 critical sectionfolly::RWSpinLock m;{ folly::RWSpinLock::WriteHolder g(&m); ++counter;}
// Bad — I/O를 critical section 안에folly::RWSpinLock m;{ folly::RWSpinLock::WriteHolder g(&m); database.Query(...); // ms scale!}// 다른 thread CPU 100% 낭비I/O, file write, 큰 lookup 같은 밀리초 scale 작업은 SharedMutex로.
// 주의 — multiple cores spinning이 cache line bouncingfolly::RWSpinLock m;// thread 8개가 동시에 spinning → cache line이 cores 사이 ping-pongcontention 심하면 spin이 BUS traffic 폭발. cores 수에 비해 lock 수가 부족하면 SharedMutex로.
// Good — Holder를 항상 wrap{ folly::RWSpinLock::WriteHolder g(&lock); // ...}// 또는 직접// lock.lock(); ... lock.unlock(); ← 절대 금지raw lock/unlock은 exception escape 시 leak. Holder RAII만.
#안티패턴
- long critical section: spinning thread가 CPU/배터리 낭비. critical section이 1 μs 넘으면 SharedMutex.
- spin lock을 multi-core 100% scale에서: cache line bounce가 throughput을 죽인다. shard 또는 fine-grained lock.
- lock 안에서 다른 lock 잡기: spin lock 안에서 두 번째 lock이 long wait면 첫 spin이 영원. 가능하면 lock 하나만.
#정리
RWSpinLock은 spin-only RW lock, 4-byte.- 매우 짧은 critical section (< 1 μs)에 SharedMutex보다 빠름.
- futex/syscall 없음 — spin만.
- 길어지면 CPU 낭비, 일반 use case는 SharedMutex.
- Holder RAII로 사용, raw lock/unlock 금지.
#다음 편
PicoSpinLock은 1-byte spinlock. 더 작은 메모리, 더 제한적 use case.
#관련 항목
- Part 9-02: SharedMutex — 더 일반적인 RW lock
- Part 9-05: PicoSpinLock — 1-byte variant
- Part 8-04: ConcurrentHashMap — fine-grained lock 응용
- 원문 — folly/synchronization/RWSpinLock.h
Folly Code Review · 44 of 89
- 1 Folly Code Review — Meta의 production-grade C++ 라이브러리 코드 분석
- 2 Folly 개요 — Meta가 production에서 검증한 utility 모음 분석
- 3 Folly vs Abseil 철학 비교 — performance-first vs std-compatible
- 4 Folly 빌드와 fbcode 환경 — monorepo의 그림자
- 5 Folly API stability 정책 — 어떤 보장도 없다는 솔직함
- 6 Folly production validation 문화 — peta-scale에서 단련된 코드
- 7 folly::Future 분석 — std::future의 한계를 넘는 composable async
- 8 folly::Promise·makeFuture — Future를 만드는 두 길
- 9 folly::SemiFuture vs Future — executor binding의 명시화
- 10 folly::Future thenValue·thenError·thenTry — continuation 체인 분석
- 11 folly::collect·collectAll·collectAny — fan-in 패턴 분석
- 12 folly::Future retry·window·via — 제어 흐름 조합자
- 13 folly::fibers 분석 — M:N stackful coroutine
- 14 folly::InlineExecutor — 호출자 thread에서 즉시 실행
- 15 folly::CPUThreadPoolExecutor — CPU-bound 작업의 표준 thread pool
- 16 folly::IOThreadPoolExecutor — libevent 기반 I/O pool
- 17 folly::ManualExecutor — 결정적 테스트를 위한 수동 진행
- 18 folly::EventBase 분석 — libevent 이벤트 루프의 핵심
- 19 folly::IOBuf 분석 — zero-copy buffer chain의 기본 단위
- 20 folly::IOBufQueue — chain의 push/pull 추상화
- 21 folly::io::Cursor·RWCursor — chain 위의 stream
- 22 folly Zero-copy 패턴 — IOBuf로 ScatterGather I/O 표현
- 23 folly::IOBuf shared semantics — clone·unshare·takeOwnership
- 24 folly::FBString 분석 — SSO + COW 구현
- 25 folly의 fmt::format 통합 — 모던 포맷팅 채택
- 26 folly::StringPiece — string_view 호환 분석
- 27 folly Join·Split utilities — 문자열 분해와 결합
- 28 folly::to·tryTo — text↔num 변환 분석
- 29 folly Conv Customization — 사용자 타입 지원
- 30 folly Conv 성능 비교 — sprintf·stringstream 대비
- 31 folly::F14ValueMap vs std::unordered_map
- 32 folly::F14NodeMap — stable pointer가 필요할 때
- 33 folly::F14VectorMap — cache-friendly iteration
- 34 folly::F14FastMap — auto-select 동작
- 35 folly F14 internals — SIMD probing 메커니즘
- 36 folly::small_vector — inline storage 분석
- 37 folly::FixedString — compile-time string
- 38 folly::AtomicHashMap — lock-free read 분석
- 39 folly::ConcurrentHashMap — sharded 동시 해시 맵
- 40 folly::EvictingCacheMap — LRU 구현 분석
- 41 folly::Synchronized — lock wrapper 패턴
- 42 folly::SharedMutex 분석
- 43 folly::Baton — one-shot wait 동기화
- 44 folly::RWSpinLock 분석
- 45 folly::PicoSpinLock — 1-byte spinlock
- 46 folly::ProducerConsumerQueue — SPSC 큐 분석
- 47 folly::MPMCQueue — multi-producer multi-consumer
- 48 folly::UnboundedQueue — 동적 크기 lock-free
- 49 folly::fibers::Channel — Go-like channel
- 50 folly::dynamic — JSON-like dynamic type 분석
- 51 folly JSON conversion — toJson·parseJson
- 52 folly dynamic ↔ struct — manual marshaling
- 53 folly dynamic Visitor pattern — type별 분기
- 54 folly::Singleton vs Meyers/static — 왜 Folly의 Singleton인가
- 55 folly::SingletonVault 분석 — 등록·소멸·의존성
- 56 folly::Singleton try_get·try_get_fast — TLS-cached 접근
- 57 folly::ExceptionWrapper — type-erased exception holder
- 58 folly::ScopeGuard·SCOPE_EXIT — RAII cleanup
- 59 folly::Optional vs std::optional
- 60 folly::Function vs std::function
- 61 folly::Lazy — 지연 초기화 wrapper
- 62 folly Meta 스타일 code review 패턴
- 63 folly anti-patterns — 잘못 쓰면 std보다 느림
- 64 folly vs std 선택 기준 분석
- 65 folly::coro 개요 — production C++20 코루틴 어댑터
- 66 folly::coro::Task — lazy single-shot 코루틴
- 67 folly::coro::AsyncGenerator — 비동기 스트림
- 68 folly coro blockingWait·collectAll — 동기 경계와 fan-in
- 69 folly::coro::Baton·Mutex — 코루틴-aware 동기화
- 70 folly::Expected — 결과 또는 오류
- 71 folly::Try — Future 결과 wrapper
- 72 folly::Try vs Expected 선택 기준
- 73 folly::Range — 일반 iterator pair
- 74 folly::Uri — URL 파서
- 75 folly Fingerprint64·128 — 분산 hash
- 76 folly SpookyHashV2 — fast non-crypto hash
- 77 folly::Init — main() 부트스트랩
- 78 folly::Indestructible — global lifetime 패턴
- 79 folly::MicroLock — 1-byte 락
- 80 folly::MicroSpinLock — 가장 좁은 spin lock
- 81 folly::format — legacy formatter 분석
- 82 folly::demangle — typeid 디망글링
- 83 folly::DynamicConverter — dynamic ↔ struct
- 84 folly::RecordIO — append-only 로그 파일 포맷
- 85 folly::io::Compression — zstd·lz4·snappy wrapper
- 86 folly::AsyncIO — io_uring·Linux AIO
- 87 folly::CancellationToken — 코루틴·Future 취소 전파
- 88 folly::observer — hot config의 atomic refresh
- 89 fbcode 패턴 모음 — folly 사용의 실전
관련 글
folly::PicoSpinLock — 1-byte spinlock
PicoSpinLock — integer type의 한 bit을 lock으로 사용. 객체 안에 lock을 끼워 넣어 메모리 절약.
같은 시리즈에서 이어 읽기
folly::SharedMutex 분석
folly::SharedMutex — std::shared_mutex보다 작고 빠른 reader-writer lock, fairness 정책 선택.
같은 시리즈에서 이어 읽기
folly::MicroSpinLock — 가장 좁은 spin lock
MicroSpinLock의 1-byte 표현, sleep 없는 순수 spin — 짧은 critical section 전용.
같은 시리즈에서 이어 읽기