folly::F14ValueMap vs std::unordered_map
#한 줄 요약
F14ValueMap은 value를 chunk slot에 in-place 저장하는 Swiss-table 계열 hash map이다. std::unordered_map(node-based)보다 lookup 2-3배, insert 1.5-2배 빠르고 메모리도 작다. 대신 rehash 시 reference/iterator가 무효화된다.
#동기
std::unordered_map은 separate chaining 기반이다. 각 bucket이 linked list, 각 노드는 별도 할당. cache miss가 매 lookup마다 1-2회 발생.
std::unordered_map<int, int>의 lookup 비용 1. bucket 인덱스 계산 (hash & mask) 2. bucket 배열 접근 (cache miss 1회) 3. linked list 순회 (cache miss N회, N=avg chain length) 4. key 비교Swiss-table(Google의 absl::flat_hash_map)이 이 문제에 답을 냈다. F14는 그 idea를 가져와 chunk 단위 SIMD probing, 5-bit hash fragment, 14-slot per chunk로 다듬은 변형이다.
folly::F14ValueMap<std::string, int> m;m["a"] = 1;m["b"] = 2;// internally: chunks of 14 slots, SIMD가 14개 동시 검사#API & 사용법
F14ValueMap은 std::unordered_map의 거의 모든 멤버를 제공한다.
#include <folly/container/F14Map.h>
folly::F14ValueMap<std::string, int> m;
// 표준 인터페이스m.emplace("hello", 1);m["world"] = 2;m.find("hello");m.contains("world"); // C++20 식 (folly는 더 일찍 제공)m.erase("hello");
// F14 전용m.reserve(1000); // chunk 할당 미리m.bucket_count(); // chunk 수 × 14m.computeStats(); // chunk fullness, collision 등큰 차이는 rehash 동작이다. std::unordered_map은 rehash 후에도 node pointer는 유지된다. F14ValueMap은 값을 옮기므로 pointer가 invalid.
folly::F14ValueMap<int, std::string> m;auto& ref = m[1]; // 1을 추가ref = "hello";for (int i = 0; i < 100; ++i) m[i] = "x"; // rehash 가능// ref는 이제 invalid — UB이게 NodeMap이 따로 있는 이유.
#내부 구현
#Open addressing 기반 위에 chunk
F14는 open addressing 위에 SIMD-friendly chunk를 얹은 구조다. 먼저 일반 open addressing의 기본 동작이 어떻게 흐르는지부터.
hash로 첫 위치를 잡고, 충돌이면 probe하며 이어진다. 일반 구현은 한 slot씩 비교하지만, F14는 14-slot chunk를 한 단위로 묶어 SIMD로 한 번에 비교한다 — probe count가 평균 1~2 chunk로 떨어진다.
#Chunk 구조
[ control bytes (16B) | slot[0] | slot[1] | ... | slot[13] | overflow counter (1B) ]한 chunk는 14개 slot. control bytes는 각 slot의 상태와 hash fragment(7-bit).
control byte: bit 7 : empty/full bit 6 : tombstone/live bit 5-1 : 5-bit hash fragment (H2) bit 0 : reserved(folly는 시기에 따라 정확히 7-bit fragment를 다르게 packing 한다. core idea는 같다.)
#Lookup 흐름
// 약식Iterator find(const Key& k) { size_t h = hash(k); size_t chunk_idx = (h >> 7) & mask_; // H1 uint8_t fragment = h & 0x7F; // H2
while (true) { Chunk& c = chunks_[chunk_idx]; // SIMD 비교: 14 control bytes vs fragment uint32_t hits = SimdMatch(c.controls, fragment); while (hits) { int slot = __builtin_ctz(hits); if (c.slots[slot].key == k) return Iterator{...}; hits &= hits - 1; // 다음 hit } if (!c.hasOverflow()) return end(); // 빈 slot 있음 chunk_idx = (chunk_idx + 1) & mask_; }}핵심:
- hash를 H1(chunk 선택)과 H2(slot 식별) 두 part로 분리.
- SIMD 명령어 1번으로 14개 control byte를 fragment와 비교.
- hit이면 key 전체 비교, miss면 다음 chunk.
SimdMatch는 platform별로 다르다.
- x86 SSE2:
_mm_cmpeq_epi8+_mm_movemask_epi8. - x86 AVX2: 32-byte 처리 가능 (folly는 16B chunk라 SSE2 충분).
- ARM NEON:
vceqq_u8+vshrn_n_u16. - 폴백: 8 byte씩 SWAR(
(c ^ fragment) - 0x01... & ~ ...).
#Memory layout 효과
std::unordered_map<int, int> 64개 항목 메모리: bucket[] : 128 * 8 = 1024 B node[] : 64 * (sizeof(int)*2 + next ptr) = 1024 B (다른 영역) 총 : ~2 KB, 두 영역 cache miss per entry : ~32 B
folly::F14ValueMap<int, int> 64개 항목: chunks[5] : 5 * (16 + 14*8 + 1) = ~640 B (한 영역) per entry : ~10 B3분의 1 메모리, 한 cache line에 여러 entry. dense 검색에서 absolute 차이가 크다.
#std/abseil 비교
// stdstd::unordered_map<K, V> std_map;
// abseilabsl::flat_hash_map<K, V> abs_map; // open addressing, value in slotabsl::node_hash_map<K, V> abs_node; // 별도 node, pointer 안정
// follyfolly::F14ValueMap<K, V> f14v; // value in chunk slotfolly::F14NodeMap<K, V> f14n; // 별도 node, pointer 안정folly::F14VectorMap<K, V> f14vec; // value in vectorfolly::F14FastMap<K, V> f14fast; // 크기에 따라 자동 선택F14ValueMap은 absl::flat_hash_map과 사상이 같다. 차이:
| 항목 | absl::flat_hash_map | folly::F14ValueMap |
|---|---|---|
| Group size | 16 slot | 14 slot |
| Control byte | 7-bit + sentinel | 비슷한 packing |
| Probe | quadratic | linear (chunk 단위) |
| max load factor | 0.875 | 0.875 |
| Allocator hook | 표준 | 표준 + Meta 확장 |
| 이름 규칙 | flat = value, node = pointer | Value/Node/Vector/Fast |
성능은 거의 동등. workload에 따라 5-10% 차이.
#코드 리뷰 포인트
// Bad — pointer를 long-lived 저장folly::F14ValueMap<int, std::string> m;const std::string* p = &m[1];m.emplace(...); // rehash 가능LOG(INFO) << *p; // UB
// Good — Node map 또는 key로 보관folly::F14NodeMap<int, std::string> mn;const std::string* p = &mn[1]; // stable
// 또는int key = 1;LOG(INFO) << m[key]; // 매번 lookup, stableValueMap에서 reference를 외부로 노출하지 않는다. 필요하면 NodeMap 또는 key를 저장.
// Bad — reserve 없이 큰 insertfolly::F14ValueMap<int, int> m;for (int i = 0; i < 1'000'000; ++i) m.emplace(i, i);// rehash 여러 번
// Goodfolly::F14ValueMap<int, int> m;m.reserve(1'000'000);for (int i = 0; i < 1'000'000; ++i) m.emplace(i, i);reserve는 final size에 맞춰 chunk를 미리 할당한다. rehash 비용이 0.
#안티패턴
operator[]로 의도 모호한 access:operator[]는 없으면 기본값 생성 + insert. read-only면find/at또는 C++17contains.- iterator 보관 후 insert: 어떤 hash map이든 위험. F14는 더 strict — 모든 insert가 잠재적 rehash. iterator는 즉시 사용.
- shadow hash function 작성:
folly::F14*Map은folly::hasher<K>또는std::hash<K>default. 사용자 hash가 충돌이 잦으면 SIMD 가속 무의미. quality 좋은 hash 사용 (folly의Hash.h).
#정리
F14ValueMap은 chunk 14-slot + SIMD probing의 flat hash map.std::unordered_map대비 lookup 2-3배, 메모리 1/3.- value in-place 저장 → rehash 시 reference/iterator 무효화.
- pointer 안정성이 필요하면
F14NodeMap(다음 글). reserve로 rehash 피하기.
#다음 편
F14NodeMap은 value를 별도 node에 두어 pointer 안정성을 제공한다. 어떻게 동작하고 어떤 경우에 쓰는지.
#관련 항목
- Part 7-02: F14NodeMap — pointer 안정 변형
- Part 7-04: F14FastMap — 자동 선택
- Part 7-05: F14 internals — SIMD probing 상세
- 원문 — folly/container/F14Map.h
- Meta engineering blog — F14
Folly Code Review · 31 of 89
- 1 Folly Code Review — Meta의 production-grade C++ 라이브러리 코드 분석
- 2 Folly 개요 — Meta가 production에서 검증한 utility 모음 분석
- 3 Folly vs Abseil 철학 비교 — performance-first vs std-compatible
- 4 Folly 빌드와 fbcode 환경 — monorepo의 그림자
- 5 Folly API stability 정책 — 어떤 보장도 없다는 솔직함
- 6 Folly production validation 문화 — peta-scale에서 단련된 코드
- 7 folly::Future 분석 — std::future의 한계를 넘는 composable async
- 8 folly::Promise·makeFuture — Future를 만드는 두 길
- 9 folly::SemiFuture vs Future — executor binding의 명시화
- 10 folly::Future thenValue·thenError·thenTry — continuation 체인 분석
- 11 folly::collect·collectAll·collectAny — fan-in 패턴 분석
- 12 folly::Future retry·window·via — 제어 흐름 조합자
- 13 folly::fibers 분석 — M:N stackful coroutine
- 14 folly::InlineExecutor — 호출자 thread에서 즉시 실행
- 15 folly::CPUThreadPoolExecutor — CPU-bound 작업의 표준 thread pool
- 16 folly::IOThreadPoolExecutor — libevent 기반 I/O pool
- 17 folly::ManualExecutor — 결정적 테스트를 위한 수동 진행
- 18 folly::EventBase 분석 — libevent 이벤트 루프의 핵심
- 19 folly::IOBuf 분석 — zero-copy buffer chain의 기본 단위
- 20 folly::IOBufQueue — chain의 push/pull 추상화
- 21 folly::io::Cursor·RWCursor — chain 위의 stream
- 22 folly Zero-copy 패턴 — IOBuf로 ScatterGather I/O 표현
- 23 folly::IOBuf shared semantics — clone·unshare·takeOwnership
- 24 folly::FBString 분석 — SSO + COW 구현
- 25 folly의 fmt::format 통합 — 모던 포맷팅 채택
- 26 folly::StringPiece — string_view 호환 분석
- 27 folly Join·Split utilities — 문자열 분해와 결합
- 28 folly::to·tryTo — text↔num 변환 분석
- 29 folly Conv Customization — 사용자 타입 지원
- 30 folly Conv 성능 비교 — sprintf·stringstream 대비
- 31 folly::F14ValueMap vs std::unordered_map
- 32 folly::F14NodeMap — stable pointer가 필요할 때
- 33 folly::F14VectorMap — cache-friendly iteration
- 34 folly::F14FastMap — auto-select 동작
- 35 folly F14 internals — SIMD probing 메커니즘
- 36 folly::small_vector — inline storage 분석
- 37 folly::FixedString — compile-time string
- 38 folly::AtomicHashMap — lock-free read 분석
- 39 folly::ConcurrentHashMap — sharded 동시 해시 맵
- 40 folly::EvictingCacheMap — LRU 구현 분석
- 41 folly::Synchronized — lock wrapper 패턴
- 42 folly::SharedMutex 분석
- 43 folly::Baton — one-shot wait 동기화
- 44 folly::RWSpinLock 분석
- 45 folly::PicoSpinLock — 1-byte spinlock
- 46 folly::ProducerConsumerQueue — SPSC 큐 분석
- 47 folly::MPMCQueue — multi-producer multi-consumer
- 48 folly::UnboundedQueue — 동적 크기 lock-free
- 49 folly::fibers::Channel — Go-like channel
- 50 folly::dynamic — JSON-like dynamic type 분석
- 51 folly JSON conversion — toJson·parseJson
- 52 folly dynamic ↔ struct — manual marshaling
- 53 folly dynamic Visitor pattern — type별 분기
- 54 folly::Singleton vs Meyers/static — 왜 Folly의 Singleton인가
- 55 folly::SingletonVault 분석 — 등록·소멸·의존성
- 56 folly::Singleton try_get·try_get_fast — TLS-cached 접근
- 57 folly::ExceptionWrapper — type-erased exception holder
- 58 folly::ScopeGuard·SCOPE_EXIT — RAII cleanup
- 59 folly::Optional vs std::optional
- 60 folly::Function vs std::function
- 61 folly::Lazy — 지연 초기화 wrapper
- 62 folly Meta 스타일 code review 패턴
- 63 folly anti-patterns — 잘못 쓰면 std보다 느림
- 64 folly vs std 선택 기준 분석
- 65 folly::coro 개요 — production C++20 코루틴 어댑터
- 66 folly::coro::Task — lazy single-shot 코루틴
- 67 folly::coro::AsyncGenerator — 비동기 스트림
- 68 folly coro blockingWait·collectAll — 동기 경계와 fan-in
- 69 folly::coro::Baton·Mutex — 코루틴-aware 동기화
- 70 folly::Expected — 결과 또는 오류
- 71 folly::Try — Future 결과 wrapper
- 72 folly::Try vs Expected 선택 기준
- 73 folly::Range — 일반 iterator pair
- 74 folly::Uri — URL 파서
- 75 folly Fingerprint64·128 — 분산 hash
- 76 folly SpookyHashV2 — fast non-crypto hash
- 77 folly::Init — main() 부트스트랩
- 78 folly::Indestructible — global lifetime 패턴
- 79 folly::MicroLock — 1-byte 락
- 80 folly::MicroSpinLock — 가장 좁은 spin lock
- 81 folly::format — legacy formatter 분석
- 82 folly::demangle — typeid 디망글링
- 83 folly::DynamicConverter — dynamic ↔ struct
- 84 folly::RecordIO — append-only 로그 파일 포맷
- 85 folly::io::Compression — zstd·lz4·snappy wrapper
- 86 folly::AsyncIO — io_uring·Linux AIO
- 87 folly::CancellationToken — 코루틴·Future 취소 전파
- 88 folly::observer — hot config의 atomic refresh
- 89 fbcode 패턴 모음 — folly 사용의 실전
관련 글
folly F14 internals — SIMD probing 메커니즘
F14 chunk 구조와 SIMD probing — SSE2/AVX/NEON dispatch, H1/H2 hash split, 14-slot 선택 이유.
같은 시리즈에서 이어 읽기
folly::F14FastMap — auto-select 동작
F14FastMap — key/value 크기로 ValueMap과 VectorMap 중 자동 선택, 사용자 trade-off 제거.
같은 시리즈에서 이어 읽기
folly::F14VectorMap — cache-friendly iteration
F14VectorMap — value를 contiguous vector에 두고 chunk에는 index만, 순회 cache-friendly.
같은 시리즈에서 이어 읽기
이 글을 참조하는 글 (6)
- absl::flat_hash_map — Swiss Table 기반 hash map — Abseil Code Review
- folly::dynamic — JSON-like dynamic type 분석 — Folly Code Review
- folly F14 internals — SIMD probing 메커니즘 — Folly Code Review
- folly::F14FastMap — auto-select 동작 — Folly Code Review
- folly::F14VectorMap — cache-friendly iteration — Folly Code Review
- folly::F14NodeMap — stable pointer가 필요할 때 — Folly Code Review