FreeToken은 소비자 하드웨어에서 Mixture-of-Experts 모델을 최적화하는 오픈소스 추론 엔진이다.
UC 버클리와 MIT의 연구자들이 소비자 하드웨어에서 Mixture-of-Experts 모델의 유용성을 향상시키는 FreeToken이라는 오픈소스 추론 엔진을 개발하였다. 동적 스케줄링 정책과 가중치 관리 최적화를 통해 FreeToken은 엣지 AI 애플리케이션에서의 디코딩 속도와 실행 효율성을 개선한다. 이를 통해 자가 호스팅 추론 시스템을 촉진한다.
FreeToken is an open-source inference engine that optimizes Mixture-of-Experts models on consumer hardware.
Researchers from UC Berkeley and MIT have developed FreeToken, an open-source inference engine that enhances the utility of Mixture-of-Experts models on consumer hardware. By implementing a dynamic scheduling policy and optimizing weight management, FreeToken improves decoding speeds and execution efficiency in edge AI applications. This fosters self-hosted reasoning systems.