YADRO · ML Engineer · 08.2024 — 11.2025
RAG-ассистент по технической документации
Задача
Большая, регулярно обновляемая документация с похожими терминами, версиями и конфигурациями. Ответ должен опираться на актуальный источник, а не на общие знания модели.
Что я построил
- Ingestion со смысловым чанкингом и метаданными (продукт, версия, компонент); размер и overlap подобраны на eval-наборе.
- Гибридный поиск: dense + BM25, RRF, cross-encoder reranker на top-N, фильтры по продукту и версии.
- Grounded-генерация со ссылками на источники и fallback при слабом контексте.
- LoRA/PEFT-адаптация и claim-level оценка на регрессионном наборе.
Инженерные решения
- Latency разложена по этапам; кэш эмбеддингов, retrieval и контекста, лимит кандидатов для reranker.
- Каждое изменение — через регрессионный прогон и shadow mode.
- Воспроизводимые эксперименты в ClearML.
Результат
Заметный рост Recall@5 относительно бейзлайна, меньше неподтверждённых утверждений на регрессионном наборе, latency в целевом SLA.
Что это показывает → Полный цикл production RAG: retrieval, генерация, fine-tuning, оценка и latency.
Python · Transformers · Sentence Transformers · PEFT/LoRA · BM25 · cross-encoder · FastAPI · ClearML · Docker · Prometheus · Grafana