folly Join·Split utilities — 문자열 분해와 결합
#한 줄 요약
folly::split은 출력 컨테이너 타입에 따라 view(StringPiece)도 owned(std::string)도 채울 수 있다. folly::join은 단일 통과로 size 계산 후 한 번에 reserve 한다. abseil의 StrSplit/StrJoin과 사상은 같으나 syntax는 다르다.
#동기
문자열 split은 거의 모든 server에서 매 요청 호출되는 hot path다. naive 구현은 find + substr 루프로 매번 std::string을 할당한다. 큰 입력에서는 이게 hot point가 된다.
- key=value 페어 parsing.
- Cookie/header 분리.
- log 행 token화.
- CSV/TSV 한 줄.
Meta는 boundary view를 그대로 결과로 받는 split을 만들었다. 입력 buffer가 살아 있는 한 새 할당이 없다.
std::vector<folly::StringPiece> tokens;folly::split(',', "a,b,c,d", tokens); // 4개 StringPiece, 0 alloc#API & 사용법
#split
#include <folly/String.h>
// 1. view 결과 — 0 할당std::vector<folly::StringPiece> v;folly::split(',', "a,b,c", v); // view 3개
// 2. owned 결과 — 토큰별 std::stringstd::vector<std::string> v2;folly::split(',', "a,b,c", v2);
// 3. 빈 토큰 제거folly::split(',', "a,,b", v, /*ignoreEmpty=*/true);
// 4. multi-char delimiterfolly::split("::", "a::b::c", v);
// 5. splitTo — output iteratorfolly::splitTo<folly::StringPiece>( ',', "a,b,c", std::back_inserter(v));
// 6. split_step (StringPiece in-place)folly::StringPiece line = "k=v";auto key = line.split_step('=');// key="k", line="v"#join
std::vector<std::string> parts = {"a", "b", "c"};
std::string s = folly::join(",", parts); // "a,b,c"
// output iteratorstd::string out;folly::join(",", parts, out); // out에 append
// 임의 범위folly::join(", ", {1, 2, 3}); // "1, 2, 3" (folly::to)#내부 구현
#split의 dispatch
// 약식 — folly/String.htemplate <class Delim, class String, class OutputType>void split(const Delim& delim, const String& input, std::vector<OutputType>& out, bool ignoreEmpty = false) { detail::internalSplit( delim, StringPiece(input), out, ignoreEmpty);}OutputType이 StringPiece면 view를 그대로 push, std::string/fbstring이면 substring을 새 객체로 만든다. 컴파일 타임 분기로 동일 함수가 양쪽을 다룬다.
#internalSplit의 본체
// 약식void internalSplit(char delim, StringPiece in, std::vector<StringPiece>& out, bool skipEmpty) { const char* start = in.begin(); const char* end = in.end(); for (const char* p = start; p != end; ++p) { if (*p == delim) { if (!skipEmpty || start != p) { out.emplace_back(start, p); } start = p + 1; } } if (!skipEmpty || start != end) { out.emplace_back(start, end); }}단일 통과, 한 character delimiter는 inline 가능. 멀티 char delimiter는 memmem-like 검색을 쓴다.
#join의 두 번 통과
// 약식template <class Delim, class Iter>std::string join(const Delim& d, Iter begin, Iter end) { // 1차 — 총 길이 계산 size_t total = 0; size_t dLen = StringPiece(d).size(); for (auto it = begin; it != end; ++it) { total += StringPiece(*it).size(); } if (begin != end) { total += dLen * (std::distance(begin, end) - 1); }
// 2차 — reserve 후 append std::string result; result.reserve(total); bool first = true; for (auto it = begin; it != end; ++it) { if (!first) result.append(StringPiece(d).data(), dLen); result.append(StringPiece(*it).data(), StringPiece(*it).size()); first = false; } return result;}reserve 한 번으로 reallocation 0회. range가 forward iterable이어야 두 번 도는 게 가능하다. input iterator만 있는 경우 한 번 vector로 모은 뒤 join 한다.
#std/abseil 비교
// stdauto tokens = std::views::split(input, ','); // C++20, view 반환
// abseilstd::vector<absl::string_view> v = absl::StrSplit("a,b,c", ',');std::string s = absl::StrJoin({"a", "b", "c"}, ",");
// follystd::vector<folly::StringPiece> v2;folly::split(',', "a,b,c", v2);std::string s2 = folly::join(",", v2);| 항목 | std::ranges::split | absl::StrSplit | folly::split |
|---|---|---|---|
| C++ 표준 | C++20 | C++14 | C++14 |
| view/owned 선택 | view만 | 변환 가능 (std::vector<std::string> 등) | output container 타입으로 자동 분기 |
| Delimiter | char/range | char/string/Lambda/AnyOf | char/string |
| empty skip | | std::views::filter 추가 | SkipEmpty() | ignoreEmpty=true |
| 빠른 default | view만 빠름 | 매우 빠름 | 매우 빠름 |
abseil 쪽이 syntax는 더 함수형이다 (absl::StrSplit("a,,b", ',', absl::SkipEmpty())). folly는 더 명령형(bool 파라미터). 취향 차이.
#성능 비교
benchmark: split 100-byte string by ',' folly::split(view) 85 ns absl::StrSplit 80 ns std::ranges::split (g++) 110 ns std::string::find loop 420 nsview 결과는 모두 거의 같다. owned 결과는 어느 라이브러리든 할당 비용이 지배적이다.
#코드 리뷰 포인트
// Bad — 매번 vector<string> 할당std::vector<std::string> tokens;folly::split(',', input, tokens); // N개 string alloc
// Good — view면 충분할 때 view로std::vector<folly::StringPiece> tokens;folly::split(',', input, tokens); // 0 alloc// input이 살아 있는 범위에서만 사용소비자가 view로 충분하면 view를 받는다. 결과를 long-lived 저장소에 보관해야 하면 owned로.
// 위험 — input이 함수 종료 시 사라짐std::vector<folly::StringPiece> Tokenize() { std::string input = GetInput(); std::vector<folly::StringPiece> v; folly::split(',', input, v); return v; // input 소멸 → dangling}
// 안전 — view와 owner 함께 반환struct Tokens { std::string owner; std::vector<folly::StringPiece> view;};view의 lifetime은 owner와 묶어야 한다. 함수 경계를 넘으면 owner도 함께 넘긴다.
#안티패턴
- split 결과를 reserve 없이 사용:
std::vector::emplace_back의 grow는 amortized O(1)이지만 known size일 때reserve(count + 1)을 미리 호출하면 한 번에 끝난다. 입력에서 delimiter 개수를 빠르게 셀 수 있으면 reserve. - join에 list/forward_list 전달: 두 번 통과해야 하는데 forward iterator만 지원. 동작은 하나
std::distance가 O(n)이라 효율이 떨어진다. vector로 모은 뒤 join. - split + join을 trim에 사용:
folly::trimWhitespace(StringPiece)가 따로 있다. split/join 왕복은 불필요.
#정리
folly::split은 output 타입에 따라 view/owned를 컴파일 타임에 선택.folly::join은 두 번 통과 reserve로 reallocation 0.split_step은 in-place parser, 추가 vector 없이 한 token씩 잘라낸다.- abseil/std 비교에서 view 성능은 거의 동일, syntax 취향이 차이.
- view 결과는 input lifetime에 묶이므로 함수 경계에서 owner와 함께 전달.
#다음 편
Part 6의 첫 글에서 folly::to와 folly::tryTo의 변환 API, exception-free 디자인을 본다.
#관련 항목
- Part 5-03: StringPiece — split의 view 출력 타입
- Part 6-01: folly::to / tryTo — split 결과를 숫자로 변환
- 원문 — folly/String.h
- 원문 — abseil StrSplit
Folly Code Review · 27 of 89
- 1 Folly Code Review — Meta의 production-grade C++ 라이브러리 코드 분석
- 2 Folly 개요 — Meta가 production에서 검증한 utility 모음 분석
- 3 Folly vs Abseil 철학 비교 — performance-first vs std-compatible
- 4 Folly 빌드와 fbcode 환경 — monorepo의 그림자
- 5 Folly API stability 정책 — 어떤 보장도 없다는 솔직함
- 6 Folly production validation 문화 — peta-scale에서 단련된 코드
- 7 folly::Future 분석 — std::future의 한계를 넘는 composable async
- 8 folly::Promise·makeFuture — Future를 만드는 두 길
- 9 folly::SemiFuture vs Future — executor binding의 명시화
- 10 folly::Future thenValue·thenError·thenTry — continuation 체인 분석
- 11 folly::collect·collectAll·collectAny — fan-in 패턴 분석
- 12 folly::Future retry·window·via — 제어 흐름 조합자
- 13 folly::fibers 분석 — M:N stackful coroutine
- 14 folly::InlineExecutor — 호출자 thread에서 즉시 실행
- 15 folly::CPUThreadPoolExecutor — CPU-bound 작업의 표준 thread pool
- 16 folly::IOThreadPoolExecutor — libevent 기반 I/O pool
- 17 folly::ManualExecutor — 결정적 테스트를 위한 수동 진행
- 18 folly::EventBase 분석 — libevent 이벤트 루프의 핵심
- 19 folly::IOBuf 분석 — zero-copy buffer chain의 기본 단위
- 20 folly::IOBufQueue — chain의 push/pull 추상화
- 21 folly::io::Cursor·RWCursor — chain 위의 stream
- 22 folly Zero-copy 패턴 — IOBuf로 ScatterGather I/O 표현
- 23 folly::IOBuf shared semantics — clone·unshare·takeOwnership
- 24 folly::FBString 분석 — SSO + COW 구현
- 25 folly의 fmt::format 통합 — 모던 포맷팅 채택
- 26 folly::StringPiece — string_view 호환 분석
- 27 folly Join·Split utilities — 문자열 분해와 결합
- 28 folly::to·tryTo — text↔num 변환 분석
- 29 folly Conv Customization — 사용자 타입 지원
- 30 folly Conv 성능 비교 — sprintf·stringstream 대비
- 31 folly::F14ValueMap vs std::unordered_map
- 32 folly::F14NodeMap — stable pointer가 필요할 때
- 33 folly::F14VectorMap — cache-friendly iteration
- 34 folly::F14FastMap — auto-select 동작
- 35 folly F14 internals — SIMD probing 메커니즘
- 36 folly::small_vector — inline storage 분석
- 37 folly::FixedString — compile-time string
- 38 folly::AtomicHashMap — lock-free read 분석
- 39 folly::ConcurrentHashMap — sharded 동시 해시 맵
- 40 folly::EvictingCacheMap — LRU 구현 분석
- 41 folly::Synchronized — lock wrapper 패턴
- 42 folly::SharedMutex 분석
- 43 folly::Baton — one-shot wait 동기화
- 44 folly::RWSpinLock 분석
- 45 folly::PicoSpinLock — 1-byte spinlock
- 46 folly::ProducerConsumerQueue — SPSC 큐 분석
- 47 folly::MPMCQueue — multi-producer multi-consumer
- 48 folly::UnboundedQueue — 동적 크기 lock-free
- 49 folly::fibers::Channel — Go-like channel
- 50 folly::dynamic — JSON-like dynamic type 분석
- 51 folly JSON conversion — toJson·parseJson
- 52 folly dynamic ↔ struct — manual marshaling
- 53 folly dynamic Visitor pattern — type별 분기
- 54 folly::Singleton vs Meyers/static — 왜 Folly의 Singleton인가
- 55 folly::SingletonVault 분석 — 등록·소멸·의존성
- 56 folly::Singleton try_get·try_get_fast — TLS-cached 접근
- 57 folly::ExceptionWrapper — type-erased exception holder
- 58 folly::ScopeGuard·SCOPE_EXIT — RAII cleanup
- 59 folly::Optional vs std::optional
- 60 folly::Function vs std::function
- 61 folly::Lazy — 지연 초기화 wrapper
- 62 folly Meta 스타일 code review 패턴
- 63 folly anti-patterns — 잘못 쓰면 std보다 느림
- 64 folly vs std 선택 기준 분석
- 65 folly::coro 개요 — production C++20 코루틴 어댑터
- 66 folly::coro::Task — lazy single-shot 코루틴
- 67 folly::coro::AsyncGenerator — 비동기 스트림
- 68 folly coro blockingWait·collectAll — 동기 경계와 fan-in
- 69 folly::coro::Baton·Mutex — 코루틴-aware 동기화
- 70 folly::Expected — 결과 또는 오류
- 71 folly::Try — Future 결과 wrapper
- 72 folly::Try vs Expected 선택 기준
- 73 folly::Range — 일반 iterator pair
- 74 folly::Uri — URL 파서
- 75 folly Fingerprint64·128 — 분산 hash
- 76 folly SpookyHashV2 — fast non-crypto hash
- 77 folly::Init — main() 부트스트랩
- 78 folly::Indestructible — global lifetime 패턴
- 79 folly::MicroLock — 1-byte 락
- 80 folly::MicroSpinLock — 가장 좁은 spin lock
- 81 folly::format — legacy formatter 분석
- 82 folly::demangle — typeid 디망글링
- 83 folly::DynamicConverter — dynamic ↔ struct
- 84 folly::RecordIO — append-only 로그 파일 포맷
- 85 folly::io::Compression — zstd·lz4·snappy wrapper
- 86 folly::AsyncIO — io_uring·Linux AIO
- 87 folly::CancellationToken — 코루틴·Future 취소 전파
- 88 folly::observer — hot config의 atomic refresh
- 89 fbcode 패턴 모음 — folly 사용의 실전
관련 글
folly::StringPiece — string_view 호환 분석
StringPiece의 역사적 배경, std::string_view와의 호환 layer, Range<const char*>로서의 일반화.
같은 시리즈에서 이어 읽기
folly의 fmt::format 통합 — 모던 포맷팅 채택
Folly가 fmt 라이브러리를 채택한 이유, formatter customization, sformat/format 차이.
같은 시리즈에서 이어 읽기
fbcode 패턴 모음 — folly 사용의 실전
Meta fbcode 코드 리뷰에서 반복적으로 등장하는 folly 사용 패턴 — overview + 시리즈 마무리.
같은 시리즈에서 이어 읽기