반응형

전체 글 42

KV Cache를 Redis처럼 이해하고 있었던 나의 이야기

LLM(거대언어모델) 서빙 최적화를 공부하다 보면 KV Cache(Key-Value Cache)라는 용어를 마주하게 됩니다.저는 캐시(Cache)라는 단어를 보고 자연스럽게 제가 알고 있는 캐싱 개념이랑 매핑하여 아, Redis나 HTTP Cache 같은 거구나! 한 번 연산한 결과를 저장해두고, 나중에 똑같은 요청이 오면 꺼내 쓰는 거네.라고 가볍게 이해하고 넘어갔었습니다. 얕게 이해하고 넘어갔다보니, 서비스를 개발하거나, 개인적으로 공부를 할수록 이상한 의문들이 꼬리를 물기 시작했습니다."KV캐시가 캐싱된 데이터를 저장한다면, 사용자 요청이 계속 들어오면 KV 캐시가 무한정 쌓여서 VRAM이 터지지 않나?""그럼 주기적으로 배치를 돌려서 캐시를 비워줘야(Flush) 하나?" (그동안은 내가 모르게 라..

chat 2025.12.22

APO 실 적용 후기

안녕하세요! 오늘은 최근 진행했던 텍스트 기반 행운 부적 생성 서비스에서 APO를 적용했던 경험담을 적어볼까 합니다.NFC 굿즈를 구매하여 사이트에 접근하면 귀여운 뽀송즈 캐릭터들이 말아주는(?) 오늘의 운세와 소원을 이뤄주는 행운카드를 확인할수 있는 소소한 심심풀이 서비스입니다. 핵심 목표: 텍스트와 가장 '어울리는' 카드 찾기 이 서비스의 개발 과제중 하나는 사용자가 입력한 텍스트(소원)의 성격을 분석하여 가장 적합한 이미지를 표출하는 것이었습니다. 하지만 개발 과정에서 마주한 가장 큰 난관은 바로 맥락의 모호함이었습니다. 예를 들어, "돈 많이 벌게 해주세요"나 "로또 당첨되게 해주세요." 같은 문장은 '금전' 카테고리로 분류하기 쉽습니다. 하지만 "올해는 따뜻하게 보내고 싶어요"라는 문장은 어떨..

Contents 2025.12.05

Automatic Prompt Optimization with Gradient Descent and Beam Search 리뷰

안녕하세요. 무려 3달만에 논문리뷰를 하게 되었습니다...... (정말 게을러졌네요...)회사에서 프로젝트 문제 해결 과정에서 우연히 읽게된 눈문인데 사실 논문 리뷰까지 할 생각은 없었지만, 프로젝트에 이 과정을 녹여내어 유의미한 결과를 얻기도 하였고, 나름의 인사이트도 얻어서 정말 간만에 시간을 내어 리뷰를 해봅니다. 참고 문헌: Automatic Prompt Optimization with Gradient Descent and Beam Searchhttps://arxiv.org/pdf/2305.03495 서론: 왜 프롬프트 최적화가 필요한가? 거대 언어 모델(LLM)은 강력한 Zero-shot 성능을 보여주지만, 실무에서 최상의 결과를 얻기 위해서는 정교한 프롬프트 엔지니어링이 필수적입니다. 하지..

paper review 2025.12.03

WaDiff: Watermark-Conditioned Diffusion for AI Content Protection 리뷰

안녕하세요. 오랜만에 논문 한편 리뷰를 해보려고 합니다.오늘 리뷰할 논문은 "WaDiff: Watermark-Conditioned Diffusion for AI Content Protection" 입니다. 생성형 AI 모델을 통한 콘텐츠들이 무분별하게 확산되면서 각 콘텐츠의 출처를 알 수 없는 문제가 있었고, 이를 해결하고자 latent space에 특정 값을 삽입하여 사람의 눈에는 보이지 않는 워터마크를 심는 방식이 제안되고, 관련 연구가 이뤄지고 있습니다.이번 논문은 특히 사용자별로 서로 다른 비트열을 조건으로 적용하여, 생성된 결과물에 고유한 워터마크를 삽입하고 이를 통해 사후에 특정 사용자로부터 생성된 콘텐츠임을 검증할 수 있는 방법론을 제안합니다. https://arxiv.org/abs/240..

paper review 2025.09.22

s3: You Don’t Need That Much Data to Train a Search Agent via RL 리뷰

안녕하세요. 오랜만에 논문 한편 리뷰를 해보려고 합니다.오늘 리뷰할 논문은 "s3: Simple, Scalable, and Streamlined Search-only Agent for Retrieval Augmented Generation"입니다. 최근 RAG의 발전 속도가 정말 빠른데, 요즘 트렌드는 강화학습을 RAG에 적용하는 연구들이 점점 늘어나고 있는것 같습니다.https://arxiv.org/abs/2505.14146 s3: You Don't Need That Much Data to Train a Search Agent via RLRetrieval-augmented generation (RAG) systems empower large language models (LLMs) to access e..

paper review 2025.06.16

FLUX - kontext pro모델 리뷰

FLUX - kontext란?FLUX - kontext는 Black Forest Labs에서 개발한 이미지 생성 및 편집 AI 모델 입니다텍스트와 이미지를 함께 프롬프트로 활용할 수 있는 in-context 이미지 생성 기술을 적용하여, 기존 텍스트-투-이미지 모델보다 더욱 정교하고 유연한 이미지 편집을 가능하게 합니다.https://flux-ai.io/flux-kontext/1930061283246641154/ Flux AI - Free Online Advanced Flux.1 AI Image GeneratorFree online advanced Flux AI image generator for various styles of image creation, powered by Flux 1.1 AI mod..

Contents 2025.06.05

ChatGPT는 왜 일관되지 않는 답변을 할까?

누구나리포터 LAB에서 AI Engineer로 활동하며, graph 기반의 의사결정 모델을 개발하면서 겪은 흥미로운 이슈를 공유하려고 합니다. 위와 같이 똑같은 질문을 여러번해도 약간의 포멧 차이만 있을뿐, 일관성 있게 응답해주지만일부 케이스들에서는 사용자 경험이 완전히 달라지는 답변을 하기도 합니다. "분명 temperature값고 0.0으로 하고, 완전히 똑같은 질문을 했는데 왜 결과가 달라지지? 누가 코딩 이상하게 한거 아니야?"프롬프트의 온도를 temperature=0.0으로 설정했는데도 같은 질문을 여러 번 반복하면 미세하게 다른 답변이 나오는 현상을 발견했습니다. 처음엔 코드나 설정의 문제라고 생각했지만, 실제로는 ChatGPT와 같은 대규모 언어모델(LLM)의 비결정적(non-determin..

Contents 2025.04.16

FFN FUSION: RETHINKING SEQUENTIAL COMPUTATION INLARGE LANGUAGE MODELS 리뷰

원문 https://arxiv.org/abs/2503.18908 FFN Fusion: Rethinking Sequential Computation in Large Language ModelsWe introduce FFN Fusion, an architectural optimization technique that reduces sequential computation in large language models by identifying and exploiting natural opportunities for parallelization. Our key insight is that sequences of Feed-Forward Networkarxiv.org Abstract대규모 언어 모델(LLM)의 확장..

paper review 2025.04.01

Multi-Concept Customization of Text-to-Image Diffusion 실습

Githubhttps://github.com/HelloAcorn/custom-diffusion-pogny custom-diffusion-pogny/outputs/txt2img-samples/samples at main · HelloAcorn/custom-diffusion-pognypogny 캐릭터로 학습 돌린 컨텐츠. Contribute to HelloAcorn/custom-diffusion-pogny development by creating an account on GitHub.github.com  참고 블로그Custom Diffusion 실습 Custom Diffusion 실습일단은 먼저 가상환경을 pyenv로 만들어 보자 conda가 default 로 설정 되었기 때문에 밑에 명령어를 통해 비활성..

paper review 2025.03.19

DREAMBENCH++: A Human-Aligned Benchmark for Personalized Image Generation 리뷰

Abstract 대규모 텍스트-이미지 모델 발전텍스트 프롬프트와 레퍼런스 이미지를 활용한 이미지 생성 기술이 주목받음평가 기준의 필요성이미지가 프롬프트의 핵심 개념과 레퍼런스 이미지의 특성을 정확히 반영해야 함기존 평가 지표의 한계DINO, CLIP: 전체 유사성은 측정하지만, 질감이나 얼굴 특징 등 세부 부분에서 인간 평가와 불일치우리의 아이디어: DREAMBENCH++인간 평가와 일치하는 평가 지표로 제시됨멀티모달 GPT 모델(예: GPT-4o)을 활용하여 자세한 평가 지침과 내부 사고 과정을 통해 점수를 산출개인화된 이미지 생성 평가의 한계를 극복하며, 인간 선호도에 가까운 결과 제공  Contribution & Method  DINO의 한계점 시각화: 전체적인 형태나 색상은 잘 보존하는 이미지에 ..

paper review 2025.03.18
반응형