AI Safety Researcher

Уровень зарплаты: от 60 000 руб.
Местоположение: Россия, Приморский край (МСК +7ч)

Резюме: AI Safety Researcher

Исследователь с фокусом на AI Safety, поведении языковых моделей и эмпирической оценке сложных систем. Моя основная компетенция - не разработка как таковая, а исследовательская работа: поиск и разбор литературы, формулирование исследовательских вопросов и гипотез, построение методологии оценки, анализ результатов и подготовка ясных письменных материалов.

Основные навыки

Поиск, чтение и критический разбор научной и технической литературы на английском языке.
— Literature review: сопоставление работ, выделение противоречий, ограничений методов и открытых исследовательских вопросов.
— Формулирование исследовательских гипотез и перевод абстрактных вопросов в проверяемые эксперименты и evaluation-процедуры.
— Анализ поведения LLM: robustness, calibration, self-correction, prompt injection, red teaming, различие между фактическим улучшением поведения модели и поверхностной адаптацией к обратной связи.
— Разработка критериев и рубрик для качественной и количественной оценки ответов моделей.
— Анализ сложных и неоднозначных результатов; внимание к confounders, false positives / false negatives и ограничениям используемых метрик.
— Написание исследовательских заметок, аналитических текстов, технической документации и структурированных отчётов.
— Уверенная письменная и устная коммуникация на английском языке; могу работать непосредственно с англоязычными статьями, документацией и международными командами.

Исследовательские интересы

AI Safety и AI Alignment; empirical evaluations; human–AI interaction; trust calibration; поведение адаптивных систем; когнитивные науки; безопасность агентных систем.

Один из вопросов, над которыми я работал: как отличить реальное увеличение компетентности системы после получения обратной связи от увеличения лишь воспринимаемой компетентности. Рассматривал способы проверять перенос self-correction на перефразированные и структурно аналогичные ситуации, устойчивость поведения при удалении поверхностных триггеров и пригодность embedding-based similarity как метрики тематического и семантического изменения.

Практический опыт

— Эксперименты с red teaming и prompt injection языковых моделей.
— Работа с агентными системами и создание агентов для CTF/red-team задач.
— Небольшие проекты по автоматизации и обработке информации с использованием LLM.
— Python использую как исследовательский и автоматизационный инструмент; разработка программного обеспечения не является моей основной специализацией.
— Опыт самостоятельной работы с исследовательскими задачами, где нет заранее известного правильного ответа и необходимо самому определить метод проверки.

Что ищу

Удалённую работу, где полезны аналитическое мышление, исследование, работа с текстами и данными, английский язык и опыт с современными AI-системами. Рассматриваю позиции Research Assistant / Research Analyst, AI Evaluator / AI Trainer, LLM Quality Specialist, AI Safety / Trust & Safety, Technical Writer, а также смежные исследовательские и аналитические роли.

Мне особенно интересна работа, где требуется не механическое выполнение инструкций, а понимание проблемы, поиск информации, проверка гипотез и ясное изложение результатов.