ИИ-сервис ускорения разработки катализаторов в дипломе: от анализа до реализации
В начале 2026 года учёные Университета Иннополис заявили о создании полностью отечественного программного комплекса на базе ИИ, который ускоряет разработку катализаторов для нефтегазовой и водородной энергетики в 5 раз. Для студента технической специальности это не просто новость — это готовая рамка для сильной ВКР. Кейс даёт свежий материал для аналитики, проектирования ML-системы и оценки экономического эффекта. В этой статье разбираем, как превратить сюжет из статьи в полноценный диплом: какие темы брать, как выстроить главы, какие метрики и стандарты использовать, и какие ошибки чаще всего губят работу на защите.
Основная часть: переносим кейс в структуру ВКР
Статья о ИИ-сервисе для катализаторов — не просто прецедент, а источник для формирования целей, задач и практической части дипломной работы. В зависимости от специальности и уровня (бакалавр/магистр) её можно встроить в три разных типа работ: аналитическую, проектную или исследовательскую. Ниже — три конкретные темы ВКР с актуальностью, целями, задачами и структурой по главам.
Темы ВКР на основе кейса Иннополиса
| Тема ВКР | Актуальность (отсылка к статье) | Цель | Задачи | Структура |
|---|---|---|---|---|
| 1. Разработка ИИ-сервиса для прогнозирования активности катализаторов (на примере гидроочистки) | ИИ-сервис Иннополиса показал пятикратное ускорение, значит, рыночная потребность в таких системах подтверждена; можно взять более узкую задачу. | Спроектировать и реализовать прототип ИИ-сервиса, предсказывающего ключевую характеристику катализатора (например, конверсию сырья). | Анализ предметной области и сбор открытых данных; выбор ML-модели (градиентный бустинг, нейросеть); разработка REST API; оценка точности и сравнение с экспертной оценкой. | Гл. 1 — анализ каталитических процессов и существующих ИИ-решений; Гл. 2 — проектирование и программная реализация; Гл. 3 — тестирование, метрики, расчёт ускорения. |
| 2. Оптимизация пайплайна данных для обучения моделей машинного обучения в материаловедении | Создание полностью отечественного ПО означает значимость импортонезависимых решений; пайплайны данных — критическая часть ML-системы. | Разработать конвейер предобработки и валидации данных о катализаторах для повышения точности модели. | Исследовать источники данных; построить ETL-процесс (Python + Pandas); реализовать автоматическую очистку (выбросы, пропуски); провести эксперименты по влиянию фичей на метрики. | Гл. 1 — обзор способов хранения и обработки хим. данных; Гл. 2 — проектирование пайплайна; Гл. 3 — результаты экспериментов и сравнение метрик до/после оптимизации. |
| 3. Проектирование архитектуры отечественного ИИ-сервиса для моделирования катализаторов | Иннополис подчёркивает полную отечественность комплекса. В дипломе можно спроектировать аналог с обоснованием выбора стека и архитектурного стиля. | Создать архитектурный проект распределённого ИИ-сервиса с учётом требований ГОСТ 34.602 и ISO/IEC 25010. | Сформировать функциональные и нефункциональные требования; описать компоненты (модуль данных, ML-ядро, API-шлюз); построить диаграммы C4/UML; рассчитать нагрузку и отказоустойчивость. | Гл. 1 — анализ аналогов и стандарты архитектуры ПО; Гл. 2 — проектирование (диаграммы C4, UML, ERD); Гл. 3 — прототип, нагрузочное тестирование, оценка качеств по ISO/IEC 25010. |
Как видно, в каждой теме мы опираемся на факт из статьи — ускорение в 5 раз и полностью отечественная разработка. Это делает работу привязанной к реальности, а не «модели ради модели».
Как встроить кейс в главы 1–3: советы практика
Для любой темы обязательна первая глава — аналитическая. Здесь важно раскрыть физико-химические основы: почему катализаторы важны для нефтегаза, как их подбор выглядел до ИИ, какие точки торможения несёт ручной подбор. Подкрепите это цифрами из статьи: 5-кратное ускорение — ваша отправная точка. Далее опишите существующие решения: Gaussian Process, нейросети, коммерческий софт и, конечно, разработку Иннополиса.
Во второй главе — проектирование. Если вы делаете ML-сервис, обязательно добавьте схему пайплайна в нотации C4 (Context, Container, Component). Например:
+------------------+ +------------------+ +------------------+
| Пользователь | -> | API Gateway | -> | ML Engine |
| (химик) | | (FastAPI) | | (PyTorch) |
+------------------+ +------------------+ +------------------+
|
v
+------------------+
| Feature Store |
| (ClickHouse) |
+------------------+
Отразите в тексте, почему выбран именно такой стек, как обрабатываются данные по катализаторам, какие модели сравниваются. Для защиты обязательно покажите early-example: обучение модели на открытом наборе данных (например, из каталитической базы NREL) и расчёт метрик.
В третьей главе — оценка эффективности. Здесь недостаточно просто вывести R². По аналогии со статьёй нужно посчитать временной эффект: на сколько процентов сокращается срок подбора катализатора по сравнению с ручным методом. Замерьте время обучения, инференса, доли автоматизированных шагов. Оформите это таблицей:
| Метрика | Базовый вариант (ручной подбор) | ИИ-сервис | Прирост |
|---|---|---|---|
| Среднее время поиска кандидата, дней | 50 | 10 | 5× (как в статье) |
| Число испытанных композиций | 120 | 30 | −75% |
| Точность прогноза (R²) | — | 0.87 | — |
В приложении размещайте листинги кода, скриншоты интерфейса и полностью оформленное ТЗ по ГОСТ 34.602-2020.
Пример: минимальный код для ML-эксперимента
Чтобы показать комиссии «живость» работы, включите во вторую главу небольшой пайплайн обучения модели на синтетических или реальных данных. Например:
# Скрипт быстрой проверки гипотезы предсказания активности катализатора
import pandas as pd
from sklearn.ensemble import GradientBoostingRegressor
from sklearn.metrics import mean_absolute_error, r2_score
# X — признаки: состав, температура, давление; y — наблюдаемая активность
df = pd.read_csv('catalysts.csv')
X = df[['Ni_percent', 'Mo_percent', 'temp_C', 'pressure_atm']]
y = df['conversion'] # целевая переменная
model = GradientBoostingRegressor(n_estimators=200, max_depth=5)
model.fit(X, y)
pred = model.predict(X)
print(f'MAE: {mean_absolute_error(y, pred):.3f}')
print(f'R²: {r2_score(y, pred):.3f}')
# Сохраняем модель для REST-API
import joblib
joblib.dump(model, 'model_catalyst.joblib')
Этот фрагмент — отличная иллюстрация, но не забывайте про разделение train/test и кросс-валидацию в реальной работе.
Практические выводы: чему вы научитесь
Работа над такой ВКР даёт студенту не только отметку о защите, но и вполне реальные навыки, которые пригодятся на работе:
- строить полные ML-пайплайны: от сырых данных до REST API;
- проектировать архитектуру сервиса в C4 и UML, согласовывая её с ГОСТ 34.602;
- оценивать качество ПО по ISO/IEC 25010: функциональность, производительность, переносимость;
- считать продуктовую эффективность: время разработки, экономию ресурсов, ROC-кривые и бизнес-метрики;
- оформлять документацию в соответствии с нормами вуза и ГОСТ.
FAQ: частые вопросы студентов
1. Какую тему выбрать, если я учусь на бизнес-информатике, а не на Data Science?
Тема №3 из таблицы — «Проектирование архитектуры ИИ-сервиса» — подойдёт идеально, если сделать упор на технико-экономическое обоснование, анализ требований и оценку рисков. Можно добавить PMBOK 7 для описания жизненного цикла проекта.
2. Где взять данные о катализаторах, если это закрытая область?
Используйте открытые датасеты: Catalysis-Hub, NREL, материалы из OpenCatalyst. Если их мало — допустимо сгенерировать синтетические данные на основе физико-химических закономерностей и явно оговорить это в работе.
3. Как правильно оформить схемы в ВКР, чтобы не придрался нормоконтроль?
Для диаграмм используйте нотацию UML и C4. Каждая схема должна иметь номер, подпись и описание в тексте. Если вуз требует определенный ГОСТ на документы, сверяйтесь с методичкой, но универсальные стандарты — ГОСТ 34.601-90 (информационные технологии).
4. Какие метрики считаются хорошими для доказательства эффективности ИИ-решения?
Для катализаторов важны регрессионные метрики: MAE, RMSE, R², а также бизнес-метрика — ускорение в X раз. Покажите сравнение с базовым регрессором и с ручным методом подбора. Метрика «в точности как у Иннополиса» не обязательна, важно обосновать свой результат.
Чек-лист: что проверить перед сдачей
☐ Все задачи из введения соответствуют выводам в заключении.
☐ Ссылка на статью Иннополиса корректно оформлена в списке источников.
☐ Диаграммы C4/UML подписаны и связаны с text-описанием.
☐ Код в приложении работает и содержит комментарии на русском.
☐ Метрики рассчитаны по честным данным, есть вывод об ускорении.
☐ Оформление соответствует ГОСТ 34.602 (для ТЗ) и ГОСТ 7.32 (для отчёта).
☐ Уникальность текста не ниже порога вуза (обычно 70–75%).
Типичные ошибки студентов
- Игнорирование предобработки данных. Многие сразу пишут модель, забывая, что данные о катализаторах содержат пропуски, выбросы и физически невозможные сочетания. Из-за этого R² получается низким, и работа выглядит неубедительно. Решение — описать процесс очистки и доказать его необходимость.
- Нет формального описания требований. Если проектируете сервис, вы обязаны выделить функциональные и нефункциональные требования (по ГОСТ 34.602). Без этого комиссия справедливо скажет, что система «висит в воздухе».
- Сравнение метрик «в вакууме». Нельзя просто написать «R²=0.87, всё отлично». Нужно сравнить с базовыми моделями и с ручным подбором, как это сделали авторы статьи из Иннополиса. Иначе непонятно, в чём ваша заслуга.
Мягкий CTA
Эксперт
Источник: В России создали ИИ-сервис, который ускоряет разработку катализаторов для нефтегаза и водородной энергетики в 5 раз (опубликовано 2026-03-18)