folly F14 internals — SIMD probing 메커니즘
#한 줄 요약
F14의 핵심은 hash를 H1(chunk index)과 H2(7-bit fragment)로 쪼개 SIMD 명령 한 번으로 14 slot의 H2를 동시에 비교하는 것이다. 평균 lookup은 1.0-1.5 chunk probe로 끝난다.
#동기
Open addressing hash map의 핵심 비용은 probe 횟수다. 일반 linear probing은 슬롯을 하나씩 본다. quadratic은 좀 낫지만 cache 비효율. SIMD가 있다면 16 byte를 한 instruction으로 비교할 수 있는데, hash slot 메타 정보를 16 byte 안에 담는 데 모든 노력이 들어간다.
naive linear probing — N slot 보기 cache miss N/8 회 비교 N 회
SIMD chunk probing — 14 slot 한 번에 cache miss 1 회 (chunk가 cache line) SIMD compare 1 회 → bitmask 실제 key compare는 hit 후보(평균 < 1) 만이게 absl::flat_hash_map / folly::F14 의 왜 빠른가에 대한 한 줄 답.
#Chunk 구조
controls가 16 byte인 이유: SSE2 register가 정확히 16 byte. ARM NEON도 128-bit register. 한 번에 load + compare 가능.
slots는 14개. 16 - 2(overflow counter + sentinel) = 14. 이 숫자가 클래스 이름의 14다.
#Control byte의 의미
each control byte (8 bit) bit 7 = empty? (1 = empty) bit 6 = full? (1 = occupied) bit 5-0 = H2 fragment (6-bit, 정확히는 약간 다름)
특수 값: 0x80 = Empty 0xFE = Tombstone (deleted, probe 계속)(folly version에 따라 bit packing이 약간 다르다. SSE2 movemask가 sign bit을 보는 점은 같다.)
#Hash split — H1 / H2
// 약식uint64_t h = hasher(key);size_t chunk_idx = (h >> 7) & chunk_mask_; // H1uint8_t fragment = h & 0x7F; // H2 (7-bit)- H1: chunk 선택 (어느 chunk를 본다).
- H2: 같은 chunk 안 slot 식별 (control byte와 비교).
H2가 일치하면 key 비교 후보가 된다. 다르면 100% miss.
#SIMD probing — SSE2
#왜 SIMD가 본질적인가
scalar vs SIMD 차이를 일반화해 보면:
F14의 chunk size = 14 (SSE2 16 중 14 slot + 1 control header + 1 overflow counter)도 같은 논리에서 나온다. SIMD register 폭에 chunk를 맞춰야 비교가 1 instruction으로 끝난다.
// folly/container/detail/F14Mask.h 약식struct DenseMaskIter { uint32_t mask; bool more() const { return mask != 0; } unsigned next() { unsigned i = __builtin_ctz(mask); // 첫 1 비트 mask &= mask - 1; // 그 비트 끄기 return i; }};
DenseMaskIter matchesSSE(const __m128i& controls, uint8_t fragment) { __m128i target = _mm_set1_epi8(fragment); __m128i cmp = _mm_cmpeq_epi8(controls, target); uint32_t mask = _mm_movemask_epi8(cmp); return DenseMaskIter{mask};}3 instruction:
set1_epi8: 16-byte register를 fragment로 채움.cmpeq_epi8: control[i] == fragment ? 0xFF : 0x00.movemask_epi8: 각 byte의 MSB를 모아 16-bit mask.
mask의 각 bit가 그 slot이 match 후보. __builtin_ctz로 lowest set bit을 찾아 한 번에 한 후보씩 처리.
#SIMD probing — NEON
// 약식 — ARM NEONDenseMaskIter matchesNEON(uint8x16_t controls, uint8_t fragment) { uint8x16_t target = vdupq_n_u8(fragment); uint8x16_t cmp = vceqq_u8(controls, target); // 16 byte → 16-bit mask 만들기는 SSE보다 번거롭다 uint8x8_t narrow = vshrn_n_u16(vreinterpretq_u16_u8(cmp), 4); uint64_t m; vst1_u64(&m, vreinterpret_u64_u8(narrow)); // m의 every-nibble 패턴 → 16-bit mask return DenseMaskIter{packNibbles(m)};}NEON은 movemask equivalent가 없어 한 단계 더 거친다. 그래도 byte-by-byte 비교보다 압도적으로 빠르다.
#SWAR fallback
SIMD 없는 platform(작은 임베디드 등)을 위한 폴백.
// 8-byte SWAR로 8개 byte를 한 word에 비교uint64_t cmp_swar(uint64_t controls8, uint8_t fragment) { uint64_t target = 0x0101010101010101 * fragment; uint64_t x = controls8 ^ target; // match면 0 // zero byte detection return ((x - 0x0101010101010101) & ~x & 0x8080808080808080);}(x - 1) & ~x & 0x80 트릭으로 byte zero를 찾는다. 16 byte를 두 word로 나눠 처리.
#Probe sequence
// 약식 — full lookupIterator find(const Key& k) { uint64_t h = hash(k); size_t chunk_idx = (h >> 7) & mask_; uint8_t frag = (h & 0x7F);
for (size_t probe = 0; ; ++probe) { Chunk& c = chunks_[chunk_idx]; auto matches = matchesSSE(c.controls(), frag); while (matches.more()) { size_t slot = matches.next(); if (KeyEqual{}(slotKey(c, slot), k)) return makeIter(c, slot); } if (!c.hostedOverflow()) return end(); // linear probe to next chunk chunk_idx = (chunk_idx + 1) & mask_; }}성공 lookup:
- 평균 1.0 chunk probe (대부분 첫 chunk).
- SIMD compare 1회.
- Key compare 1회 (H2가 7-bit이므로 false positive 1/128).
실패 lookup:
- 평균 1.05 chunk probe.
- 빈 slot 존재 → 즉시 end.
#왜 14 slot인가
16 byte register - 2 byte overhead = 14 slot. overhead는:
- overflow counter (1 byte): 이 chunk가 다른 chunk로 넘쳐 흘러간 entry 수. erase 시 tombstone 결정에 사용.
- sentinel/padding (1 byte): SIMD compare에서 마지막 byte를 항상 unmatched로 만들어 false hit 방지.
14는 magical number가 아니라 register size - bookkeeping의 결과.
absl::flat_hash_map은 16 slot group + 별도 metadata로 다른 packing 선택. trade-off가 있다. folly는 cache locality를 약간 더 중시.
#Tombstone vs Empty
// erase 후 control byteif (chunk_has_overflow) { control[slot] = TOMBSTONE; // probe 계속해야 함} else { control[slot] = EMPTY; // probe 멈춤 OK}tombstone이 많아지면 lookup이 길어진다. F14는 erase 시 overflow 체크해 tombstone 회피 가능하면 EMPTY로 표시. rehash가 자연스럽게 tombstone을 청소.
#std/abseil 비교
| 항목 | std::unordered_map | absl::flat_hash_map | folly::F14 |
|---|---|---|---|
| 구조 | separate chaining | open addressing | open addressing |
| group | N/A | 16 slot | 14 slot |
| SIMD | X | SSE2 + ARM | SSE2 + AVX + NEON + SWAR |
| probe | linked list | quadratic | linear chunk |
| max load | 1.0+ | 0.875 | 0.875 |
| pointer 안정 | yes | flat=no, node=yes | Value=no, Node=yes |
성능은 absl과 folly가 거의 동등. 차이는 platform support 폭(folly가 더 넓음)과 variant 종류(folly가 Vector/Fast 추가).
#코드 리뷰 포인트
// Good — hash quality 확인struct MyKey { uint64_t a, b; };namespace folly {template <> struct hasher<MyKey> { size_t operator()(const MyKey& k) const { return hash::SpookyHashV2::Hash64(&k, sizeof(k), 0); }};}H2(7-bit)가 잘 분포해야 false positive가 적다. MurmurHash, SpookyHash, xxhash, WyHash 등 quality hash를 쓴다.
// Bad — 사용자 hash가 lower 7-bit이 일정struct BadHasher { size_t operator()(int k) const { return k * 4; } // bit 0-1 always 0};// H2가 8개 값으로 제한 → SIMD 가속 효과 1/16H2 distribution이 깨지면 SIMD 가속이 사라진다. multiplicative hash나 더 좋은 hash로.
#안티패턴
- load factor를 0.95+로 강제: SIMD 가속 효과가 사라지고 tombstone 누적. default(0.875) 유지.
- 빈번한 erase + reserve 미호출: tombstone이 쌓이면 lookup이 점점 느려진다. 주기적 rehash(
m.reserve(m.size()))로 청소. - hash function이 trivial(identity): H1/H2 분리가 망가져 collision 폭발.
#정리
- chunk 16-byte control + 14 slot 구조로 SIMD compare 한 번에 14개 비교.
- H1(chunk index), H2(7-bit fragment) hash split.
- SSE2/AVX/NEON 모두 지원, SWAR 폴백.
- 평균 1.0-1.5 chunk probe로 lookup 완료.
- hash quality가 SIMD 가속의 전제.
#다음 편
Part 8로 넘어가 Folly의 컨테이너 라이브러리(SmallVector, FixedString, AtomicHashMap, ConcurrentHashMap, EvictingCacheMap)를 본다.
#관련 항목
Folly Code Review · 35 of 89
- 1 Folly Code Review — Meta의 production-grade C++ 라이브러리 코드 분석
- 2 Folly 개요 — Meta가 production에서 검증한 utility 모음 분석
- 3 Folly vs Abseil 철학 비교 — performance-first vs std-compatible
- 4 Folly 빌드와 fbcode 환경 — monorepo의 그림자
- 5 Folly API stability 정책 — 어떤 보장도 없다는 솔직함
- 6 Folly production validation 문화 — peta-scale에서 단련된 코드
- 7 folly::Future 분석 — std::future의 한계를 넘는 composable async
- 8 folly::Promise·makeFuture — Future를 만드는 두 길
- 9 folly::SemiFuture vs Future — executor binding의 명시화
- 10 folly::Future thenValue·thenError·thenTry — continuation 체인 분석
- 11 folly::collect·collectAll·collectAny — fan-in 패턴 분석
- 12 folly::Future retry·window·via — 제어 흐름 조합자
- 13 folly::fibers 분석 — M:N stackful coroutine
- 14 folly::InlineExecutor — 호출자 thread에서 즉시 실행
- 15 folly::CPUThreadPoolExecutor — CPU-bound 작업의 표준 thread pool
- 16 folly::IOThreadPoolExecutor — libevent 기반 I/O pool
- 17 folly::ManualExecutor — 결정적 테스트를 위한 수동 진행
- 18 folly::EventBase 분석 — libevent 이벤트 루프의 핵심
- 19 folly::IOBuf 분석 — zero-copy buffer chain의 기본 단위
- 20 folly::IOBufQueue — chain의 push/pull 추상화
- 21 folly::io::Cursor·RWCursor — chain 위의 stream
- 22 folly Zero-copy 패턴 — IOBuf로 ScatterGather I/O 표현
- 23 folly::IOBuf shared semantics — clone·unshare·takeOwnership
- 24 folly::FBString 분석 — SSO + COW 구현
- 25 folly의 fmt::format 통합 — 모던 포맷팅 채택
- 26 folly::StringPiece — string_view 호환 분석
- 27 folly Join·Split utilities — 문자열 분해와 결합
- 28 folly::to·tryTo — text↔num 변환 분석
- 29 folly Conv Customization — 사용자 타입 지원
- 30 folly Conv 성능 비교 — sprintf·stringstream 대비
- 31 folly::F14ValueMap vs std::unordered_map
- 32 folly::F14NodeMap — stable pointer가 필요할 때
- 33 folly::F14VectorMap — cache-friendly iteration
- 34 folly::F14FastMap — auto-select 동작
- 35 folly F14 internals — SIMD probing 메커니즘
- 36 folly::small_vector — inline storage 분석
- 37 folly::FixedString — compile-time string
- 38 folly::AtomicHashMap — lock-free read 분석
- 39 folly::ConcurrentHashMap — sharded 동시 해시 맵
- 40 folly::EvictingCacheMap — LRU 구현 분석
- 41 folly::Synchronized — lock wrapper 패턴
- 42 folly::SharedMutex 분석
- 43 folly::Baton — one-shot wait 동기화
- 44 folly::RWSpinLock 분석
- 45 folly::PicoSpinLock — 1-byte spinlock
- 46 folly::ProducerConsumerQueue — SPSC 큐 분석
- 47 folly::MPMCQueue — multi-producer multi-consumer
- 48 folly::UnboundedQueue — 동적 크기 lock-free
- 49 folly::fibers::Channel — Go-like channel
- 50 folly::dynamic — JSON-like dynamic type 분석
- 51 folly JSON conversion — toJson·parseJson
- 52 folly dynamic ↔ struct — manual marshaling
- 53 folly dynamic Visitor pattern — type별 분기
- 54 folly::Singleton vs Meyers/static — 왜 Folly의 Singleton인가
- 55 folly::SingletonVault 분석 — 등록·소멸·의존성
- 56 folly::Singleton try_get·try_get_fast — TLS-cached 접근
- 57 folly::ExceptionWrapper — type-erased exception holder
- 58 folly::ScopeGuard·SCOPE_EXIT — RAII cleanup
- 59 folly::Optional vs std::optional
- 60 folly::Function vs std::function
- 61 folly::Lazy — 지연 초기화 wrapper
- 62 folly Meta 스타일 code review 패턴
- 63 folly anti-patterns — 잘못 쓰면 std보다 느림
- 64 folly vs std 선택 기준 분석
- 65 folly::coro 개요 — production C++20 코루틴 어댑터
- 66 folly::coro::Task — lazy single-shot 코루틴
- 67 folly::coro::AsyncGenerator — 비동기 스트림
- 68 folly coro blockingWait·collectAll — 동기 경계와 fan-in
- 69 folly::coro::Baton·Mutex — 코루틴-aware 동기화
- 70 folly::Expected — 결과 또는 오류
- 71 folly::Try — Future 결과 wrapper
- 72 folly::Try vs Expected 선택 기준
- 73 folly::Range — 일반 iterator pair
- 74 folly::Uri — URL 파서
- 75 folly Fingerprint64·128 — 분산 hash
- 76 folly SpookyHashV2 — fast non-crypto hash
- 77 folly::Init — main() 부트스트랩
- 78 folly::Indestructible — global lifetime 패턴
- 79 folly::MicroLock — 1-byte 락
- 80 folly::MicroSpinLock — 가장 좁은 spin lock
- 81 folly::format — legacy formatter 분석
- 82 folly::demangle — typeid 디망글링
- 83 folly::DynamicConverter — dynamic ↔ struct
- 84 folly::RecordIO — append-only 로그 파일 포맷
- 85 folly::io::Compression — zstd·lz4·snappy wrapper
- 86 folly::AsyncIO — io_uring·Linux AIO
- 87 folly::CancellationToken — 코루틴·Future 취소 전파
- 88 folly::observer — hot config의 atomic refresh
- 89 fbcode 패턴 모음 — folly 사용의 실전
관련 글
folly::F14ValueMap vs std::unordered_map
F14ValueMap의 in-place value 저장과 std::unordered_map node-based의 차이, 성능과 reference 안정성.
같은 시리즈에서 이어 읽기
folly::F14FastMap — auto-select 동작
F14FastMap — key/value 크기로 ValueMap과 VectorMap 중 자동 선택, 사용자 trade-off 제거.
같은 시리즈에서 이어 읽기
folly::F14VectorMap — cache-friendly iteration
F14VectorMap — value를 contiguous vector에 두고 chunk에는 index만, 순회 cache-friendly.
같은 시리즈에서 이어 읽기
이 글을 참조하는 글 (5)
- Abseil Swiss Table internals — control byte·SIMD probing — Abseil Code Review
- folly SpookyHashV2 — fast non-crypto hash — Folly Code Review
- folly Fingerprint64·128 — 분산 hash — Folly Code Review
- folly::F14FastMap — auto-select 동작 — Folly Code Review
- folly::F14ValueMap vs std::unordered_map — Folly Code Review