Результаты работы опубликованы 19 августа 2026 года в журнале Nature Sensors. Авторы продемонстрировали массив размером 32×32 элемента на основе фототранзисторов с плавающим затвором из однослойного дисульфида молибдена (MoS₂). В эксперименте с моделью Vision Transformer такая архитектура обеспечила точность распознавания 87,3% на модифицированном наборе CIFAR-10 и снизила энергопотребление операции токенизации в 14,3 раза по сравнению с цифровым вариантом.
От пикселей к токенам без лишнего перемещения данных
В традиционной системе машинного зрения путь от фотонов до входных данных нейросети включает несколько последовательных операций. Свет преобразуется сенсором в электрический сигнал, затем данные оцифровываются, записываются в память и передаются вычислительному блоку. Если используется Vision Transformer (ViT), изображение дополнительно разбивается на небольшие фрагменты — patches, после чего для каждого из них формируется embedding, или токен.
Каждый этап требует передачи данных между различными узлами системы. Для компактных устройств, где вычислительные ресурсы и ёмкость аккумулятора ограничены, такие перемещения могут оказаться значительной частью энергетического бюджета.
LightTok предлагает изменить саму архитектуру этого процесса. Фототранзисторы из однослойного MoS₂ одновременно воспринимают свет и сохраняют полученное состояние. Затем сохранённая аналоговая информация используется для формирования признакового представления изображения непосредственно в сенсорном массиве.
По сути, исследователи попытались объединить несколько операций, которые обычно выполняются последовательно: получение визуальной информации, её хранение, разбиение изображения на области и формирование embedding для последующей обработки Vision Transformer.
«Наша идея заключалась в том, чтобы перенести генерацию токенов непосредственно на сам сенсор, позволяя чипу напрямую создавать токены, которые модели ИИ могут обрабатывать, когда свет достигает датчика», — пояснил Фэн Мяо, один из руководителей исследования и директор Института интеллекта, вдохновлённого мозгом Нанкинского университета.
Ключевую роль в конструкции играет фототранзистор с плавающим затвором. Такой затвор способен удерживать электрический заряд после прекращения воздействия света, благодаря чему сенсор получает функцию памяти. В LightTok эта особенность используется не просто для хранения изображения, а непосредственно для аналоговой обработки визуальной информации.
Дисульфид молибдена относится к двумерным материалам и может формировать атомарно тонкие слои. Его фоточувствительные свойства делают MoS₂ интересным материалом для совмещения функций сенсора и вычислительного элемента. В разработанном массиве именно фототранзисторы выполняют преобразование светового сигнала и участвуют в последующем формировании признаков изображения.
«Чип физически устраняет перемещение данных, которое является основным источником энергетических потерь», — отметил профессор Нанкинского университета Ши-цзюнь Лян.
Название LightTok отражает сам принцип работы: свет непосредственно преобразуется в представление, пригодное для передачи в модель машинного зрения.
Экономия достигается не ускорением вычислений
Главное преимущество прототипа заключается не в том, что он выполняет обычные операции быстрее традиционного процессора. Исследователи меняют саму последовательность обработки данных.
В цифровой архитектуре сенсор сначала должен сформировать изображение, после чего изображение необходимо передать вычислительной системе. Там оно преобразуется в набор patches, а затем — в токены. LightTok старается выполнить эти операции до того, как визуальные данные превратятся в обычный цифровой поток пикселей.
В экспериментальной системе массив LightTok подключался к периферийной схеме адресации, управляемой FPGA. Полученные аналоговые данные затем использовались в стандартном конвейере Vision Transformer. При этом авторы получили точность, сопоставимую с цифровой обработкой, но при значительно меньшем энергопотреблении токенизации.
Именно здесь находится наиболее интересная особенность технологии для периферийного ИИ. Чем ближе вычисление к месту возникновения данных, тем меньше информации требуется перемещать между сенсором, памятью и процессором. Для автономного оборудования это особенно важно: камера беспилотника, робота или другого устройства постоянно генерирует визуальный поток, однако далеко не вся информация из этого потока нужна нейросети в исходном виде.
Вместо передачи полного изображения система может сразу формировать представление, необходимое конкретной модели.
До камеры смартфона LightTok пока далеко
Несмотря на впечатляющее снижение энергопотребления, до практической замены современных сенсоров разработке ещё далеко. Продемонстрированный массив имеет всего 32×32 фоточувствительных элемента. Это экспериментальный масштаб, существенно уступающий разрешению современных камер смартфонов и специализированных систем машинного зрения.
Кроме того, результат 87,3% нельзя интерпретировать как универсальную точность системы распознавания изображений. Это показатель конкретного экспериментального конвейера Vision Transformer на модифицированном наборе CIFAR-10. Перенос результатов на реальные сцены, сложное освещение, динамические объекты и существенно более высокое разрешение ещё предстоит исследовать.
Есть и инженерные вопросы масштабирования самого двумерного материала, формирования больших массивов фототранзисторов, периферийной схемотехники, стабильности аналоговых вычислений и совместимости такого сенсора с реальными системами обработки данных.
Тем не менее принцип LightTok показывает направление, которое может оказаться важным для будущего периферийного ИИ. Вместо последовательной цепочки «сенсор → АЦП → память → процессор → нейросеть» разработчики стремятся объединить восприятие и предварительное вычисление в одном аппаратном узле.
Для дронов и автономных роботов это потенциально означает возможность дольше работать от аккумулятора при сохранении локального анализа изображения. Для распределённых сенсорных систем — уменьшение объёма данных, которые необходимо передавать на периферийный или облачный вычислитель. А для носимой электроники — возможность выполнять часть задач машинного зрения при значительно меньшем энергопотреблении.
Исследование LightTok показывает, что следующий этап развития машинного зрения может быть связан не столько с созданием всё более мощных процессоров, сколько с отказом от необходимости передавать им весь поток необработанных данных.
Но здесь возникает принципиальный вопрос: если сенсор уже сам выполняет токенизацию и часть вычислений ИИ, где должна проходить граница между камерой и процессором — и не станет ли в будущем сам сенсор полноценным вычислительным устройством? А что об этом думаете вы?Источник: https://www.livescience.com/technology/electronics/new-lighttok-chip-converts-light-directly-into-to...
Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!

