«Лаборатория черновика» изучает не идеальные финальные тексты, а то, как текст реально менялся:
задача → первый черновик → правки и споры → новые версии → финал.
Сейчас ищем владельцев русскоязычных архивов, где этот путь сохранился. Это могут быть редакции, агентства, книжные редакторы, авторы, школы и команды, которые работают со статьями, коммерческими материалами, лендингами, рассылками, личными историями или нон-фикшеном.
Цель — проверить конкретную гипотезу: сможет ли экспериментальная языковая модель писать живее и менее шаблонно, если учить её не только на готовых текстах, а на настоящих решениях автора и редактора — что добавить, удалить, вернуть, переставить, не исправлять и когда остановиться.
Это частный исследовательский проект. Сырые тексты не собираются для публикации, перепродажи или передачи третьим лицам как корпус.
Полезный эпизод содержит большую часть этой цепочки:
- реальную задачу, бриф или исходные материалы;
- первый человеческий черновик;
- промежуточные версии в понятном порядке;
- комментарии редактора и ответы автора, если они были;
- принятые и отклонённые правки;
- финальный текст;
- отметку, использовались ли нейросети.
Основной диапазон финала — примерно 600–1 200 слов. Для первого опыта нужен
не один автор и не одна редакционная школа, а минимум две разные семьи текстов.
- исходники не публикуются как открытый датасет;
- до передачи удаляются имена клиентов, контакты, доступы, внутренние ссылки, коммерческие секреты и лишние персональные данные;
- сначала можно показать только структуру архива или
3–5обезличенных эпизодов; - локальная проверка не означает автоматического допуска к обучению;
- возможная облачная загрузка, обучение экспериментальной модели, производные веса и будущая практическая/коммерческая применимость согласуются отдельно и прямо;
- до этого владелец получит название конкретного облачного провайдера и границы хранения;
- после начала обучения гарантировать удаление влияния данных из весов нельзя, поэтому согласие оформляется до запуска, а не задним числом.
Подробнее: какие данные нужны и как устроены права и приватность.
Создайте короткую заявку через Issues. Не прикладывайте туда тексты, архивы, личные данные или приватные ссылки. Достаточно указать тип материалов, примерное число полных историй и ссылку на официальный канал связи владельца.
В ответ проект сначала проверит, подходит ли сам формат. До письменного согласия никакие приватные документы не запрашиваются и не загружаются.
После пилота владелец может получить частный агрегированный разбор архива: какие виды правок в нём встречаются, где теряется история и насколько материал подходит для исследования процесса письма. Публичное упоминание владельца — только по его желанию.
Проект: «Лаборатория черновика».