SMILES (Simplified Molecular Input Line Entry System — «Спрощена лінійна система вводу молекулярних структур») — стандартизована текстова нотація для подання хімічних структур у вигляді рядка ASCII‑символів, що дозволяє зберігати інформацію про атоми й зв’язки в молекулі для комп’ютерної обробки та передачі.
Історія створення
SMILES був розроблений у 1980‑х роках американським хіміком Девідом Вайнігером (David Weininger) та колегами в рамках проєкту з обробки хімічної інформації під фінансуванням USEPA. Пізніше формат був стандартизований і доповнений відкритим стандартом OpenSMILES у 2007 році.
Призначення та застосування
SMILES використовується для:
- представлення молекул у текстовому вигляді;
- введення структур у хімічні бази даних та програмне забезпечення для моделювання;
- обміну та публікацій у наукових журналах;
- побудови і візуалізації молекул у ChemDraw, RDKit, Open Babel.
Це один із головних стандартів у хемінформатиці та комп’ютерній хімії.
Основні правила та синтаксис
- Атоми позначаються символами елементів:
C— вуглець,O— кисень,N— азот (водні атоми зазвичай не пишуть). - Зв’язки: одинарний —
-або опущений, подвійний —=, потрійний —#. - Розгалуження: дужки
(і); - Цикли: цифри, що з’єднують відповідні атоми;
- Ароматичні системи: малі літери (
c1ccccc1— бензол).
Приклади SMILES:
O— вода (H₂O)CCO— етанол (C₂H₅OH)C1CCCCC1— циклогексанc1ccccc1— бензол
Варіанти та розширення
- Canonical SMILES — унікальний рядок для певної молекули;
- Isomeric SMILES — включає інформацію про стереохімію;
- CurlySMILES — для надмолекулярних структур і анотацій.
Переваги та обмеження
Переваги: компактність, легкість для обробки, широка підтримка у програмному забезпеченні.
Обмеження:
- одна молекула може мати кілька SMILES‑рядків;
- не завжди кодує повну 3D‑структуру;
- складні молекули важко записати вручну.
Формат у базах даних
SMILES широко використовується у хімічних базах даних (PubChem, ChemSpider, ChEMBL), де кожна молекула має поле SMILES для пошуку за подібністю або підструктурою.
Значення для науки
SMILES ключовий у хемінформатиці, моделюванні та машинному навчанні з хімічними структурами. Він дозволяє ефективно представляти молекулярні дані для QSAR, віртуального скринінгу та прогнозування властивостей сполук.
