Claude Code vs Codex 비교, 3개월 직접 써보고 내린 결론

새벽 두 시에 vLLM 서버가 또 죽었다. Azure GPU 인스턴스 로그를 열어보니 텐서 병렬 설정이 꼬여서 워커 프로세스끼리 서로 못 찾고 있었다. 이런 순간에 손이 가는 도구가 무엇인지가, 그 도구의 진짜 실력을 말해준다고 생각한다. 나는 그날 Claude Code를 켰다. 다음 날 비슷한 유형의 FastAPI 비동기 버그가 났을 때는 Codex를 열었다. 그렇게 3개월을 두 도구를 번갈아 … Read more

제미나이 3.6 플래시 뜯어보니, 결국 문제는 에이전트 운영비였다

제미나이 3.6 플래시 뜯어보니, 결국 문제는 에이전트 운영비였다 지난주에 LangGraph로 돌리던 멀티 에이전트 파이프라인 하나가 새벽에 갑자기 API 비용을 두 배로 잡아먹은 적이 있다. 원인을 추적해보니 에이전트가 판단을 못 내리고 도구 호출을 반복하면서 토큰을 계속 태운 거였다. 그날 이후로 나는 모델 선택 기준에서 순수 추론 성능보다 토큰 효율과 도구 호출 안정성을 더 위에 두게 됐다. … Read more

멀티모달 RAG 이미지 캡셔닝부터 vLLM 서빙, 실시간 질의까지

몇 달 전만 해도 멀티모달 RAG라는 말을 들으면 그냥 이미지 업로드 버튼 하나 붙이면 되는 줄 알았다. 실제로 손대보니 완전히 다른 이야기였다. 문서 안의 표와 다이어그램을 검색 가능하게 만드는 것부터, 어떤 VLM을 골라서 어떻게 서빙할지, 그리고 사용자가 실제로 사진을 찍어 들고 와서 묻는 순간까지, 각 단계마다 텍스트 RAG에서는 겪어보지 못한 문제들이 쌓여 있었다. 세 편에 … Read more

멀티모달 RAG 실시간 이미지 질의 구현 – FastAPI로 이미지 업로드부터 답변 합성까지

실시간_이미지_질의

2편까지 정리하고 나니 인덱싱 쪽은 어느 정도 자신이 붙었다. 그런데 정작 데모 날짜가 다가오면서 진짜 부담스러웠던 건 따로 있었다. 현장 엔지니어가 설비 사진을 찍어서 바로 질문하는 시나리오였다. 사용자가 이미지를 올리는 순간부터 답변이 나오기까지, 텍스트 전용 RAG에서는 신경 쓸 필요 없던 문제들이 줄줄이 튀어나왔다. 이미지를 받는 엔드포인트를 어떻게 설계할지, 이미지에서 뽑은 정보와 벡터 검색 결과를 어떻게 … Read more

VLM 모델 선정부터 vLLM 멀티모달 서빙까지 – 실무에서 겪은 시행착오

vlm모델선정_vLLM멀티모달서빙

1편에서 캡셔닝과 임베딩의 차이를 정리하고 나서, 바로 다음에 부딪힌 질문이 있었다. 그래서 어떤 VLM을 쓸 건데. 처음에는 이 질문을 너무 가볍게 봤다. 어차피 비슷한 모델들일 텐데 인기 많은 걸로 고르면 되겠지 싶었다. 그런데 실제로 후보군을 놓고 벤치마크를 돌려보니, 같은 회로도 이미지를 넣어도 모델에 따라 캡션 품질이 확연히 갈렸다. 어떤 모델은 다이어그램 안의 화살표 방향을 완전히 … Read more