본문으로 건너뛰기
Folly Code Review · 21/89

folly Zero-copy 패턴 — IOBuf로 ScatterGather I/O 표현

· Hawk · 4분 읽기

한 줄 요약: IOBuf chain은 그 자체로 iovec다. writev/readv/sendmsg에 직접 넘겨 user-space copy를 0회로 만든다.

#동기 — copy가 비용이다

10Gbps 네트워크에서 매초 1GB의 byte가 흐른다. user-space에서 1번 복사하면 추가 1GB/s memcpy다. CPU 한 코어를 통째로 잡아먹는다.

전통적 흐름 — kernel↔user 사이에 user buf1/buf2/socket buf 거치며 여러 번 memcpy

zero-copy 목표는 user-space에서 0번 copy다.

zero-copy 흐름 — IOBuf가 pointer만 wrap해 chain으로 연결되고 writev/sendmsg에 직접 전달

IOBuf의 ref-count와 chain 구조가 이를 자연스럽게 표현한다.

#패턴 1 — recv + IOBufQueue

folly::IOBufQueue q{folly::IOBufQueue::cacheChainLength()};
while (running) {
auto [data, cap] = q.preallocate(4096, 65536);
ssize_t n = ::recv(fd, data, cap, 0);
if (n <= 0) break;
q.postallocate(n);
// q의 chain은 추가 copy 없이 frame parser로 흐름
while (auto frame = parseFrame(q)) {
handle(std::move(frame));
}
}

recv가 직접 IOBuf의 buffer에 쓴다. user-space copy 0회.

#패턴 2 — writev로 chain 전체 송신

ssize_t writeChain(int fd, folly::IOBuf const* head) {
std::array<iovec, 64> iov;
size_t count = 0;
size_t total = 0;
auto cur = head;
do {
iov[count].iov_base = const_cast<uint8_t*>(cur->data());
iov[count].iov_len = cur->length();
total += cur->length();
++count;
cur = cur->next();
} while (cur != head && count < iov.size());
ssize_t n = ::writev(fd, iov.data(), count);
return n; // partial write 처리는 별도
}

writev 한 번에 chain 전체가 송신된다. 각 IOBuf를 별도 copy하지 않는다.

Folly의 AsyncSocket::writeChain()이 이 패턴을 추상화한다.

#패턴 3 — protocol layer stack

// HTTP response = header + body
auto header = serializeHeader(...); // IOBuf
auto body = std::move(bodyChain); // IOBuf chain (file에서 읽음)
// prepend → 복사 없이 chain 앞에 잇기
header->prependChain(std::move(body));
socket->writeChain(std::move(header));

header를 body 앞에 prepend할 때 copy가 0회다. linked list에 노드를 잇는 것뿐이다.

#패턴 4 — file → socket (sendfile 보완)

sendfile은 kernel 안에서 file → socket을 보낸다. user-space를 전혀 거치지 않는다.

// sendfile은 raw fd로 — IOBuf와 무관
ssize_t n = ::sendfile(socketFd, fileFd, &offset, count);

그러나 header를 함께 보내야 한다면 IOBuf 패턴이 유용하다.

// header는 IOBuf로, body는 sendfile로 분리
socket->writeChain(std::move(headerBuf));
// 다음으로
::sendfile(socketFd, fileFd, &offset, bodySize);

또는 mmap된 file을 IOBuf로 wrap한다.

void* mapped = mmap(nullptr, size, PROT_READ, MAP_PRIVATE, fileFd, 0);
auto buf = folly::IOBuf::takeOwnership(
mapped, size, [mapped, size] { munmap(mapped, size); });
// buf는 file의 page를 직접 가리킴, copy 없음
header->prependChain(std::move(buf));
socket->writeChain(std::move(header));

#패턴 5 — broadcast/fan-out

같은 buffer를 N개 receiver에 보낼 때.

auto data = ...; // 큰 message
for (auto& client : clients) {
auto cloned = data->clone(); // ref-count++, data 공유
client->writeChain(std::move(cloned));
}

clone은 ref-count만 늘린다. N개 copy 대신 N개 reference다. memory도 시간도 절약된다.

#패턴 6 — pipe through transform

folly::IOBufQueue in_q, out_q;
void onDataReceived(folly::IOBuf data) {
in_q.append(std::move(data));
while (auto frame = parseFrame(in_q)) {
auto transformed = transform(std::move(frame)); // 가능하면 IOBuf 반환
out_q.append(std::move(transformed));
}
flushOut();
}

transformation이 byte 단위로 새 buffer를 만들지 않는 한, 전체 파이프라인이 zero-copy를 유지한다.

#SO_ZEROCOPY (Linux)

Linux 4.14+의 MSG_ZEROCOPY 플래그는 send()/sendmsg()가 user-space buffer를 kernel page에 직접 매핑해 보낸다. user → kernel copy도 0이 된다.

int one = 1;
setsockopt(fd, SOL_SOCKET, SO_ZEROCOPY, &one, sizeof(one));
iovec iov = {data, len};
msghdr msg = {.msg_iov = &iov, .msg_iovlen = 1};
sendmsg(fd, &msg, MSG_ZEROCOPY);
// 완료는 cmsg로 비동기 통보

Folly의 AsyncSocketsetZeroCopy(true)로 이를 활성화한다. IOBuf chain이 그대로 kernel에 매핑된다.

#단점 — zero-copy의 비용

zero-copy가 항상 좋지는 않다.

  • 작은 buffer(<4KB)는 copy 비용이 zero-copy setup 비용보다 낮다.
  • ref-count atomic operation 자체도 비용이다.
  • mmap/munmap 오버헤드가 크다.

벤치마크해서 실제 이득이 있는 임계점을 찾는다. 일반적으로 1KB 이상의 buffer에서 의미가 있다.

#코드 리뷰 포인트

  • writev/sendmsg가 IOBuf chain을 직접 받는가? 별도 buffer로 합치면 copy 발생.
  • header가 prepend되는가? chain 앞에 노드만 잇는다.
  • broadcast가 N copy? clone으로 ref-count 공유.
  • chain length가 너무 길지 않은가? iovec 한계(보통 1024) 초과면 multi-call 필요.

#자주 보는 안티패턴

// 1. chain을 single buffer로 합쳐서 write
auto coalesced = chain->coalesce(); // 전체 copy 1회
write(fd, coalesced.data(), coalesced.size());
// 옳음: writev에 chain 직접
// 2. clone 대신 copy
auto data = original->clone(); // ref-count
// vs
auto data = folly::IOBuf::copyBuffer(original->data(), original->length()); // copy
// 3. wrapBuffer 후 lifetime 미관리
std::string tmp = ...;
auto buf = folly::IOBuf::wrapBuffer(tmp.data(), tmp.size());
return buf; // tmp 소멸 — dangling
// 4. zero-copy를 작은 message에 적용
for (auto& msg : small_messages) { // 100B 짜리
socket->writeChain(folly::IOBuf::takeOwnership(...));
// 작은 메시지는 copy가 더 싸다
}

#std와 비교

표준에는 byte buffer chain이 없다. std::vector<std::span<std::byte>> 비슷한 구조를 만들 수 있지만 ref-count, prepend, splitting을 직접 구현해야 한다.

C++23의 std::span과 P2300 senders/receivers가 결합되면 비슷한 패턴이 표준화될 수 있다. 그러나 IOBuf만큼 풍부한 primitive는 당분간 표준에 없다.

#정리

  • IOBuf chain은 그 자체로 iovec다. writev/readv가 chain을 직접 처리한다.
  • recv는 IOBufQueue::preallocate로 zero-copy, send는 AsyncSocket::writeChain으로 zero-copy.
  • protocol layer stack은 prepend로 header를 복사 없이 잇는다.
  • broadcast는 clone()으로 ref-count 공유. N copy를 N ref로 바꾼다.
  • mmap된 file은 takeOwnership으로 IOBuf chain에 섞을 수 있다.
  • Linux SO_ZEROCOPY와 결합하면 user→kernel copy도 0이 된다.
  • 작은 buffer는 zero-copy가 오히려 비싸다. 벤치마크로 확인.

#다음 편

Part 4-05: IOBuf shared semantics에서 ref-count의 자세한 의미를 본다.

#관련 항목

Folly Code Review · 22 of 89

  1. 1 Folly Code Review — Meta의 production-grade C++ 라이브러리 코드 분석
  2. 2 Folly 개요 — Meta가 production에서 검증한 utility 모음 분석
  3. 3 Folly vs Abseil 철학 비교 — performance-first vs std-compatible
  4. 4 Folly 빌드와 fbcode 환경 — monorepo의 그림자
  5. 5 Folly API stability 정책 — 어떤 보장도 없다는 솔직함
  6. 6 Folly production validation 문화 — peta-scale에서 단련된 코드
  7. 7 folly::Future 분석 — std::future의 한계를 넘는 composable async
  8. 8 folly::Promise·makeFuture — Future를 만드는 두 길
  9. 9 folly::SemiFuture vs Future — executor binding의 명시화
  10. 10 folly::Future thenValue·thenError·thenTry — continuation 체인 분석
  11. 11 folly::collect·collectAll·collectAny — fan-in 패턴 분석
  12. 12 folly::Future retry·window·via — 제어 흐름 조합자
  13. 13 folly::fibers 분석 — M:N stackful coroutine
  14. 14 folly::InlineExecutor — 호출자 thread에서 즉시 실행
  15. 15 folly::CPUThreadPoolExecutor — CPU-bound 작업의 표준 thread pool
  16. 16 folly::IOThreadPoolExecutor — libevent 기반 I/O pool
  17. 17 folly::ManualExecutor — 결정적 테스트를 위한 수동 진행
  18. 18 folly::EventBase 분석 — libevent 이벤트 루프의 핵심
  19. 19 folly::IOBuf 분석 — zero-copy buffer chain의 기본 단위
  20. 20 folly::IOBufQueue — chain의 push/pull 추상화
  21. 21 folly::io::Cursor·RWCursor — chain 위의 stream
  22. 22 folly Zero-copy 패턴 — IOBuf로 ScatterGather I/O 표현
  23. 23 folly::IOBuf shared semantics — clone·unshare·takeOwnership
  24. 24 folly::FBString 분석 — SSO + COW 구현
  25. 25 folly의 fmt::format 통합 — 모던 포맷팅 채택
  26. 26 folly::StringPiece — string_view 호환 분석
  27. 27 folly Join·Split utilities — 문자열 분해와 결합
  28. 28 folly::to·tryTo — text↔num 변환 분석
  29. 29 folly Conv Customization — 사용자 타입 지원
  30. 30 folly Conv 성능 비교 — sprintf·stringstream 대비
  31. 31 folly::F14ValueMap vs std::unordered_map
  32. 32 folly::F14NodeMap — stable pointer가 필요할 때
  33. 33 folly::F14VectorMap — cache-friendly iteration
  34. 34 folly::F14FastMap — auto-select 동작
  35. 35 folly F14 internals — SIMD probing 메커니즘
  36. 36 folly::small_vector — inline storage 분석
  37. 37 folly::FixedString — compile-time string
  38. 38 folly::AtomicHashMap — lock-free read 분석
  39. 39 folly::ConcurrentHashMap — sharded 동시 해시 맵
  40. 40 folly::EvictingCacheMap — LRU 구현 분석
  41. 41 folly::Synchronized — lock wrapper 패턴
  42. 42 folly::SharedMutex 분석
  43. 43 folly::Baton — one-shot wait 동기화
  44. 44 folly::RWSpinLock 분석
  45. 45 folly::PicoSpinLock — 1-byte spinlock
  46. 46 folly::ProducerConsumerQueue — SPSC 큐 분석
  47. 47 folly::MPMCQueue — multi-producer multi-consumer
  48. 48 folly::UnboundedQueue — 동적 크기 lock-free
  49. 49 folly::fibers::Channel — Go-like channel
  50. 50 folly::dynamic — JSON-like dynamic type 분석
  51. 51 folly JSON conversion — toJson·parseJson
  52. 52 folly dynamic ↔ struct — manual marshaling
  53. 53 folly dynamic Visitor pattern — type별 분기
  54. 54 folly::Singleton vs Meyers/static — 왜 Folly의 Singleton인가
  55. 55 folly::SingletonVault 분석 — 등록·소멸·의존성
  56. 56 folly::Singleton try_get·try_get_fast — TLS-cached 접근
  57. 57 folly::ExceptionWrapper — type-erased exception holder
  58. 58 folly::ScopeGuard·SCOPE_EXIT — RAII cleanup
  59. 59 folly::Optional vs std::optional
  60. 60 folly::Function vs std::function
  61. 61 folly::Lazy — 지연 초기화 wrapper
  62. 62 folly Meta 스타일 code review 패턴
  63. 63 folly anti-patterns — 잘못 쓰면 std보다 느림
  64. 64 folly vs std 선택 기준 분석
  65. 65 folly::coro 개요 — production C++20 코루틴 어댑터
  66. 66 folly::coro::Task — lazy single-shot 코루틴
  67. 67 folly::coro::AsyncGenerator — 비동기 스트림
  68. 68 folly coro blockingWait·collectAll — 동기 경계와 fan-in
  69. 69 folly::coro::Baton·Mutex — 코루틴-aware 동기화
  70. 70 folly::Expected — 결과 또는 오류
  71. 71 folly::Try — Future 결과 wrapper
  72. 72 folly::Try vs Expected 선택 기준
  73. 73 folly::Range — 일반 iterator pair
  74. 74 folly::Uri — URL 파서
  75. 75 folly Fingerprint64·128 — 분산 hash
  76. 76 folly SpookyHashV2 — fast non-crypto hash
  77. 77 folly::Init — main() 부트스트랩
  78. 78 folly::Indestructible — global lifetime 패턴
  79. 79 folly::MicroLock — 1-byte 락
  80. 80 folly::MicroSpinLock — 가장 좁은 spin lock
  81. 81 folly::format — legacy formatter 분석
  82. 82 folly::demangle — typeid 디망글링
  83. 83 folly::DynamicConverter — dynamic ↔ struct
  84. 84 folly::RecordIO — append-only 로그 파일 포맷
  85. 85 folly::io::Compression — zstd·lz4·snappy wrapper
  86. 86 folly::AsyncIO — io_uring·Linux AIO
  87. 87 folly::CancellationToken — 코루틴·Future 취소 전파
  88. 88 folly::observer — hot config의 atomic refresh
  89. 89 fbcode 패턴 모음 — folly 사용의 실전