負責大語言模型(LLM)微調與對齊演算法(DPO/RLHF)研發;設計多維度Chain-of-Thought推理架構以提升模型評估準確度;應用非監督式聚類演算法進行文本特徵分析;進行模型性能評測與優化,並撰寫研發技術報告
僱主︰ 願意教育有限公司
刊登日期︰ Aug 18, 2026