본문으로 건너뛰기
Folly Code Review · 78/89

folly::MicroLock — 1-byte 락

· Hawk · 4분 읽기

한 줄 요약: MicroLock은 1-byte 안에 lock 상태와 wait queue head를 표현한다. std::mutex가 40+ byte를 쓰는 자리에서 수억 개 객체에 각각 lock을 박을 수 있게 한다.

#동기

std::mutex는 plat마다 다르지만 보통 40 byte 정도다.

glibc pthread_mutex_t : 40 bytes
libc++ std::mutex : 40 bytes
MSVC std::mutex : 80 bytes

대부분 wait queue, owner thread, robust mutex 메타데이터 등을 포함. 수억 개 객체에 lock을 박으려면 너무 비싸다.

// 1억 개 작은 객체에 각자 mutex
struct Slot {
std::mutex mu; // 40 byte
uint32_t value; // 4 byte
}; // sizeof = 48 byte. mu가 90%

MicroLock은 1 byte. 같은 자리에서 sizeof(Slot)이 8 byte로 줄어든다.

#include <folly/MicroLock.h>
struct Slot {
folly::MicroLock lock; // 1 byte
uint32_t value; // 4 byte (padding 포함 8 byte)
};

#API

#include <folly/MicroLock.h>
folly::MicroLock m;
m.lock();
// critical section
m.unlock();
// RAII
{
std::lock_guard lk(m); // 표준 lock_guard 사용 가능
// ...
}
// try_lock
if (m.try_lock()) {
// ...
m.unlock();
}

표준 std::mutex와 인터페이스가 호환. std::lock_guard, std::unique_lock 모두 사용 가능.

#init

struct Slot {
folly::MicroLock lock;
uint32_t value;
};
Slot s{}; // lock은 zero-init 상태 — 자동으로 unlocked
// 또는
s.lock.init(); // 명시적 init

MicroLock은 zero-init이 unlock 상태. global static, calloc된 영역에서 즉시 사용 가능. std::mutex는 일반적으로 명시적 생성자 호출 필요.

#내부 구현

MicroLock 1-byte vs std::mutex 40-byte

// folly/MicroLock.h 약식
class MicroLock {
public:
void lock() noexcept {
if (LIKELY(tryLock())) return;
lockSlow();
}
bool try_lock() noexcept {
uint8_t expected = 0;
return lock_.compare_exchange_strong(
expected, kLockedBit, std::memory_order_acquire);
}
void unlock() noexcept {
uint8_t prev = lock_.fetch_and(~kLockedBit, std::memory_order_release);
if (prev & kWaitersBit) {
futexWake(reinterpret_cast<uint32_t*>(&lock_), 1);
}
}
private:
static constexpr uint8_t kLockedBit = 0x01;
static constexpr uint8_t kWaitersBit = 0x02;
// 나머지 6-bit: user data 또는 wait queue 메타
std::atomic<uint8_t> lock_;
void lockSlow() noexcept {
for (;;) {
uint8_t cur = lock_.load(std::memory_order_relaxed);
if (!(cur & kLockedBit)) {
if (lock_.compare_exchange_weak(
cur, cur | kLockedBit, std::memory_order_acquire)) {
return;
}
continue;
}
// mark as having waiters
if (!(cur & kWaitersBit)) {
lock_.fetch_or(kWaitersBit, std::memory_order_relaxed);
}
// futex wait
futexWait(reinterpret_cast<uint32_t*>(&lock_),
static_cast<uint32_t>(cur | kWaitersBit));
}
}
};

핵심 비트 두 개.

  • bit 0kLockedBit: 1이면 locked.
  • bit 1kWaitersBit: 1이면 대기자 있음.

나머지 6-bit은 사용자가 활용 가능 (next 절 참고).

#Futex 활용

Linux futex는 4-byte aligned uint32_t를 대상으로 한다. MicroLock은 1 byte라 fragment지만 8-byte aligned 구조체 안에 들어가면 wait/wake가 byte 일부를 보고 동작 가능 — 첫 byte의 변화로 trigger.

// futex 호출이 lock 변수의 정수 비교로 trigger됨
// fast path는 user-space에서 1 instruction CAS
// slow path만 kernel

uncontended fast path가 CAS 1회 — std::mutex의 user-space fast path와 동등. contention 시 futex로 sleep.

#사용자 데이터 6-bit

folly::MicroLock m;
m.lock();
uint8_t userBits = m.load() & 0xFC; // 상위 6-bit
m.unlock();
// lock과 동시에 user data 갱신
{
std::lock_guard lk(m);
setUserData(m, newBits); // critical section 안에서 6-bit 사용
}

이 6-bit이 활용되는 자리는 각 lock에 작은 state가 필요한 곳. 예: cache slot의 LRU flag, generation counter 일부.

#실전 — hash map의 chunk lock

struct Chunk {
folly::MicroLock lock; // 1 byte
uint8_t countAndFlags;
uint16_t epoch;
// 4 byte 안에 동기화 + 메타 다 들어감
uint8_t data[60];
};

64-byte cache line 안에 lock + 메타데이터 + payload가 모두. std::mutex였다면 한 chunk가 100+ byte로 cache line을 넘긴다.

LMAX, robin-hood hash, F14 같은 데이터 구조가 비슷한 trade-off.

#std::mutex와의 비교

항목std::mutexMicroLockMicroSpinLock
sizeof40 byte1 byte1 byte
zero-init안 됨 (생성자 필요)됨 (0 = unlocked)
uncontended fast pathCAS 1회CAS 1회CAS 1회
contention 대응futex / queuefutexspin (no sleep)
사용자 비트없음6 bit7 bit
RAIIstd::lock_guardstd::lock_guardstd::lock_guard
recursivenon-recursivenon-recursivenon-recursive

MicroLock은 sleep-capable, MicroSpinLock은 spin-only(다음 절).

#false sharing — 왜 같은 line 안에 두는가

per-object lock의 핵심은 lock과 보호되는 데이터를 한 cache line에 묶는 것이다. 그 이유는 false sharing의 역방향이다.

False sharing on cache line

서로 다른 변수가 같은 line에 있으면 한 코어의 쓰기가 다른 코어의 line을 invalidate한다. MicroLock은 보호 대상 데이터의 메타 byte로 자기 자신을 박아 항상 함께 invalidate되도록 한다 — 어차피 lock을 잡으면 데이터를 읽을 테니 같이 fetch되는 게 이득이다.

#코드 리뷰 포인트

  • 수만/수억 개 객체에 mutex 박는 자리 → MicroLock로 메모리 절감.
  • per-object lock이 한 cache line에 다른 fields와 함께 들어가야 false sharing 줄어듦.
  • 사용자 6-bit을 lock 보호 밖에서 읽으면 race. lock 안에서 일관되게 다뤄야.
  • contention이 매우 큼 → MicroLock의 futex가 std::mutex와 비슷한 성능. 메모리만 절약.
  • spin이 더 빠르면(짧은 critical section) MicroSpinLock 고려.

#자주 보는 안티패턴

// 1. MicroLock을 condition_variable과 함께
folly::MicroLock m;
std::condition_variable cv; // 호환 안 됨 — std::mutex가 필요
// 2. recursive 사용
folly::MicroLock m;
{
std::lock_guard lk(m);
{
std::lock_guard lk2(m); // deadlock — non-recursive
}
}
// 3. 6-bit user data 변경을 race
m.unlock();
m.setUserBits(newVal); // 다른 thread가 lock 시도 중일 수 있음
// → lock 안에서 변경
// 4. heap에 1-byte alloc
auto* m = new folly::MicroLock; // sizeof는 1이지만 alignment + malloc header로 32+ byte
delete m;
// → 1-byte 객체 따로 alloc은 의미 없음. 다른 데이터와 함께 묶어야.

#정리

  • MicroLock은 1 byte futex-backed lock.
  • zero-init이 unlocked — calloc/static 영역에서 바로 사용.
  • uncontended fast path는 std::mutex와 동등 (CAS 1회).
  • 6-bit user data를 같은 byte에 보유 가능.
  • 수억 개 객체에 lock 박을 자리에서 메모리 비용을 결정적으로 줄임.

#다음 편

Part 18-04: MicroSpinLock에서 spin-only variant를 본다.

#관련 항목

Folly Code Review · 79 of 89

  1. 1 Folly Code Review — Meta의 production-grade C++ 라이브러리 코드 분석
  2. 2 Folly 개요 — Meta가 production에서 검증한 utility 모음 분석
  3. 3 Folly vs Abseil 철학 비교 — performance-first vs std-compatible
  4. 4 Folly 빌드와 fbcode 환경 — monorepo의 그림자
  5. 5 Folly API stability 정책 — 어떤 보장도 없다는 솔직함
  6. 6 Folly production validation 문화 — peta-scale에서 단련된 코드
  7. 7 folly::Future 분석 — std::future의 한계를 넘는 composable async
  8. 8 folly::Promise·makeFuture — Future를 만드는 두 길
  9. 9 folly::SemiFuture vs Future — executor binding의 명시화
  10. 10 folly::Future thenValue·thenError·thenTry — continuation 체인 분석
  11. 11 folly::collect·collectAll·collectAny — fan-in 패턴 분석
  12. 12 folly::Future retry·window·via — 제어 흐름 조합자
  13. 13 folly::fibers 분석 — M:N stackful coroutine
  14. 14 folly::InlineExecutor — 호출자 thread에서 즉시 실행
  15. 15 folly::CPUThreadPoolExecutor — CPU-bound 작업의 표준 thread pool
  16. 16 folly::IOThreadPoolExecutor — libevent 기반 I/O pool
  17. 17 folly::ManualExecutor — 결정적 테스트를 위한 수동 진행
  18. 18 folly::EventBase 분석 — libevent 이벤트 루프의 핵심
  19. 19 folly::IOBuf 분석 — zero-copy buffer chain의 기본 단위
  20. 20 folly::IOBufQueue — chain의 push/pull 추상화
  21. 21 folly::io::Cursor·RWCursor — chain 위의 stream
  22. 22 folly Zero-copy 패턴 — IOBuf로 ScatterGather I/O 표현
  23. 23 folly::IOBuf shared semantics — clone·unshare·takeOwnership
  24. 24 folly::FBString 분석 — SSO + COW 구현
  25. 25 folly의 fmt::format 통합 — 모던 포맷팅 채택
  26. 26 folly::StringPiece — string_view 호환 분석
  27. 27 folly Join·Split utilities — 문자열 분해와 결합
  28. 28 folly::to·tryTo — text↔num 변환 분석
  29. 29 folly Conv Customization — 사용자 타입 지원
  30. 30 folly Conv 성능 비교 — sprintf·stringstream 대비
  31. 31 folly::F14ValueMap vs std::unordered_map
  32. 32 folly::F14NodeMap — stable pointer가 필요할 때
  33. 33 folly::F14VectorMap — cache-friendly iteration
  34. 34 folly::F14FastMap — auto-select 동작
  35. 35 folly F14 internals — SIMD probing 메커니즘
  36. 36 folly::small_vector — inline storage 분석
  37. 37 folly::FixedString — compile-time string
  38. 38 folly::AtomicHashMap — lock-free read 분석
  39. 39 folly::ConcurrentHashMap — sharded 동시 해시 맵
  40. 40 folly::EvictingCacheMap — LRU 구현 분석
  41. 41 folly::Synchronized — lock wrapper 패턴
  42. 42 folly::SharedMutex 분석
  43. 43 folly::Baton — one-shot wait 동기화
  44. 44 folly::RWSpinLock 분석
  45. 45 folly::PicoSpinLock — 1-byte spinlock
  46. 46 folly::ProducerConsumerQueue — SPSC 큐 분석
  47. 47 folly::MPMCQueue — multi-producer multi-consumer
  48. 48 folly::UnboundedQueue — 동적 크기 lock-free
  49. 49 folly::fibers::Channel — Go-like channel
  50. 50 folly::dynamic — JSON-like dynamic type 분석
  51. 51 folly JSON conversion — toJson·parseJson
  52. 52 folly dynamic ↔ struct — manual marshaling
  53. 53 folly dynamic Visitor pattern — type별 분기
  54. 54 folly::Singleton vs Meyers/static — 왜 Folly의 Singleton인가
  55. 55 folly::SingletonVault 분석 — 등록·소멸·의존성
  56. 56 folly::Singleton try_get·try_get_fast — TLS-cached 접근
  57. 57 folly::ExceptionWrapper — type-erased exception holder
  58. 58 folly::ScopeGuard·SCOPE_EXIT — RAII cleanup
  59. 59 folly::Optional vs std::optional
  60. 60 folly::Function vs std::function
  61. 61 folly::Lazy — 지연 초기화 wrapper
  62. 62 folly Meta 스타일 code review 패턴
  63. 63 folly anti-patterns — 잘못 쓰면 std보다 느림
  64. 64 folly vs std 선택 기준 분석
  65. 65 folly::coro 개요 — production C++20 코루틴 어댑터
  66. 66 folly::coro::Task — lazy single-shot 코루틴
  67. 67 folly::coro::AsyncGenerator — 비동기 스트림
  68. 68 folly coro blockingWait·collectAll — 동기 경계와 fan-in
  69. 69 folly::coro::Baton·Mutex — 코루틴-aware 동기화
  70. 70 folly::Expected — 결과 또는 오류
  71. 71 folly::Try — Future 결과 wrapper
  72. 72 folly::Try vs Expected 선택 기준
  73. 73 folly::Range — 일반 iterator pair
  74. 74 folly::Uri — URL 파서
  75. 75 folly Fingerprint64·128 — 분산 hash
  76. 76 folly SpookyHashV2 — fast non-crypto hash
  77. 77 folly::Init — main() 부트스트랩
  78. 78 folly::Indestructible — global lifetime 패턴
  79. 79 folly::MicroLock — 1-byte 락
  80. 80 folly::MicroSpinLock — 가장 좁은 spin lock
  81. 81 folly::format — legacy formatter 분석
  82. 82 folly::demangle — typeid 디망글링
  83. 83 folly::DynamicConverter — dynamic ↔ struct
  84. 84 folly::RecordIO — append-only 로그 파일 포맷
  85. 85 folly::io::Compression — zstd·lz4·snappy wrapper
  86. 86 folly::AsyncIO — io_uring·Linux AIO
  87. 87 folly::CancellationToken — 코루틴·Future 취소 전파
  88. 88 folly::observer — hot config의 atomic refresh
  89. 89 fbcode 패턴 모음 — folly 사용의 실전