Проект: Колобок400k и идея перевода словарей  Публичный пост
16 августа 2026  76
Колобок400k и идея перевода словарей
https://ganqqwerty.github.io/jp-ru-kolobok-dictionary/

Суть проекта - перевел большущий яп-англ словарик ИИшкой чтобы он стал яп-рус словариком. Назвал гордым словом Колобок. Подумал, что так можно делать с любыми языками и решил, что вдруг кому будет интересно воспроизвести то же самое.

Мотивация

Я с друзьями собрал маленькое сообщество любителей японского языка, тысячи на три человек, где попадаются люди, слишком уж юные для того, чтобы знать английский. Для них японский - это второй язык, а мы им даём англоинструменты.

Самый главный инструмент для изучения языка - это доступный за миллисекунды словарь. С японского на русский словарное покрытие было так себе, поэтому раньше мы просто стыдили всех, кто не знал английский, напоминая, что на этой планете положено балакать на англе.

Видел, что раньше кто-то пытался переводить большие яп-англ словари, но выходило фигово. "Ну, у меня-то получится не фигово", подумал я, "во-первых, я ж самый умный, да и к тому же сейчас чатгпт навыпускал умных моделек, к которым можно подобрать хорошие промпты, и у них все получится".

Методика

Пара недель и 5-6 ресетов чата-гпт и у нас есть Колобок - автоперевод популярнейшего словаря Jitendex, на 400 тыщ статей.

Методика была такая:

  • набрал народа, который знает япчик и готов выверять статьи вручную,
  • взял частотный словарь, где есть 1.5к самых частых слов
  • прогнал исходный яп-англ словарик через разные ИИшки
  • поглядел, где какая косячит
  • подрихтовал промпты
  • помаленьку навайбкодил систему, которая бы умела запускать 100 агентов-переводчиков одновременно, чтобы они перевели пару статей и сдохли

Ревьюеры должны были взять из переводных статей немножко себе на ревизию и написать претензии. Если претензию удавалось перессказать в промпте агенту, то перезапускал процесс. В оконцовке у нас получилось, что промпт вышел довольно точным для того, чтобы Луна (самая тупенькая моделька у чатагпт) вполне справлялась с переводом на уровне качества модельки Терра (менее тупенькая и сильно более дорогая).


Одна из сложностей состояла в том, что английский и русский устроены по-разному. У них begin, commence, start и kick off - это очень часто и по-разному употребимые слова. Мы же говорим "начать, начать, начать, начать", а всякие там инициировать, стартовать, приступить - уже слова второго эшелона и надо было растолковать это нашим ИИшкам.

Агенты вызывались из codex-cli. Таким образом не задейстовалось дорогущее кодексовое API, а вместо это использовалась тарификация по кодексовой подписке. Как я понял, оплата по API - это ты прям честно за каждое посланное и полученное слово платишь и выходит в разы дороже.

Я делал переводы пачками по десять тысяч статей. После первых таких батчей я отдавал результаты на ревизию ребяткам. Ребятки брали и лениво отсматривали пару десятков, может сотню статеек и говорили, от чего у них дергается глаз. Ближе к 50к статей я уже и забил отдавать результат на ревизию человеку, потому что качество было довольно стабильным.

Исходный словарь был не стеной текста, а структурированной как-бы-базой-данных. Например, если там были части речи, то они выделялись в отдельные тэги, и их легко было изолировать в отдельную кучку. Подобные структурирвоанные данные ЛЛМ-переводчики переводили как бог на душу положит, поэтому мы в итоге взяли и всё унифицировали ручками (там буквально полтысячи разных тэгов получилось). Исходный словарик и перевод хранились в postgresql базе данных, чтобы ничего не потерялось, и можно было восстанавливать прогресс.

Итог и польза

Итог вышел отличный - вполне можно предположить, что дали бы мне кафедру японистики в управление на четыре годика - я бы лучше не смог сделать.

Ну так я о чем. Вам-то нафиг не нужен японский, да? Но методика-то работает с любыми другими языками. Не обязательно, чтобы у вас был тамильско-русский словарь, главное чтобы где-то нашелся тамильско-хинди или тамильско-английский. Автоперевод стал более-менее неплохим, можно собирать словарики на родном языке.

Сколько я заработал

Связать свою жизнь с японистикой - лучший способ провести жизнь в нищете, поэтому я заработал примерно минус двести баксов на два месяца подписки на чатгпт. Повезло что было много сбросов лимитов, иначе процесс бы занял не 2-3 недели, а 3-5 месяцев.

Что дальше?

Можно японо-немецкий словарик перевести и влить его в нашего колобка. Наверяка там есть некоторые статьи, которых нет у англов, или какие-то оттенки, которые не включены в основной словарь. В оконцовке создать мега-гига словарь, где всё будет без самоповторов.

Также можно пытаться улучшать качество колобка, например натравливать более дорогие модели на более часто встречаемые слова. Пока я не вижу от этого явного прироста, но надо держать ухо востро и пробовать разные модельки, а ну как найдутся совсем умные.

Если учите языки и испытываете нехватку русскоязычных материалов - делайте так же.

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб