feat(furc): implement lexer

This commit is contained in:
2026-08-05 12:34:58 +02:00
parent 4604f5186e
commit 3faafe371f
5 changed files with 297 additions and 8 deletions
+46
View File
@@ -0,0 +1,46 @@
#ifndef FURC_FRONT_LEXER_HPP
#define FURC_FRONT_LEXER_HPP
#include "furc/front/token.hpp"
#include <cstddef>
#include <optional>
#include <string_view>
namespace furc {
class lexer {
public:
lexer(std::string_view filepath, std::string_view content)
: m_filepath(filepath), m_content(content) {}
~lexer() = default;
lexer(lexer&&) noexcept = default;
lexer& operator=(lexer&&) noexcept = default;
lexer(const lexer&) = delete;
lexer& operator=(const lexer&) = delete;
public:
token next_token();
token peek_token();
token skip_token();
private:
void next();
constexpr char get(std::size_t offset = 0) const;
void skip_spaces();
constexpr token::location location() const;
private:
std::string_view m_filepath;
std::string_view m_content;
std::size_t m_cursor = 0;
std::size_t m_row = 0;
std::size_t m_lineStart = 0;
std::optional<token> m_peekToken;
};
} // namespace furc
#endif // FURC_FRONT_LEXER_HPP
+82 -4
View File
@@ -3,6 +3,7 @@
#include <cstddef>
#include <cstdint>
#include <ostream>
#include <string_view>
namespace furc {
@@ -12,6 +13,7 @@ struct token {
Identifier = 0,
Integer,
String,
Char,
LParen, /**< `(` */
RParen, /**< `)` */
@@ -87,6 +89,7 @@ struct token {
// Errors:
UnexpectedCharacter,
UnexpectedEOF,
EndOfFile,
} type;
union value {
@@ -110,15 +113,90 @@ struct token {
value.integer = integer;
}
token(location loc, std::string_view string)
: loc(loc), type(String) {
token(location loc, enum type type, std::string_view string)
: loc(loc), type(type) {
value.string = string;
}
token(location loc, char character)
: loc(loc), type(UnexpectedCharacter) {
token(location loc, enum type type, char character)
: loc(loc), type(type) {
value.character = character;
}
friend std::ostream& operator<<(std::ostream& os, const token& token) {
switch (token.type) {
case token::Identifier: return os << token.value.string;
case token::String: return os << '"' << token.value.string << '"';
case token::Char: return os << '\'' << token.value.character << '\'';
case token::Integer: return os << token.value.integer;
case token::LParen: return os << "(";
case token::RParen: return os << ")";
case token::LBrace: return os << "{";
case token::RBrace: return os << "}";
case token::LBracket: return os << "[";
case token::RBracket: return os << "]";
case token::Semicolon: return os << ";";
case token::Colon: return os << ":";
case token::Comma: return os << ",";
case token::Dot: return os << ".";
case token::Plus: return os << "+";
case token::Minus: return os << "-";
case token::Star: return os << "*";
case token::Slash: return os << "/";
case token::Percent: return os << "%";
case token::Ampersand: return os << "&";
case token::Pipe: return os << "|";
case token::Hat: return os << "^";
case token::DblAmpersand: return os << "&&";
case token::DblPipe: return os << "||";
case token::DblPlus: return os << "++";
case token::DblMinus: return os << "--";
case token::ExMark: return os << "!";
case token::CatEars: return os << "^^";
case token::Equals: return os << "=";
case token::PlusEquals: return os << "+=";
case token::MinusEquals: return os << "-=";
case token::StarEquals: return os << "*=";
case token::SlashEquals: return os << "/=";
case token::PercentEquals: return os << "%=";
case token::AmpersandEquals: return os << "&=";
case token::PipeEquals: return os << "|=";
case token::HatEquals: return os << "^=";
case token::DblEquals: return os << "==";
case token::ExEquals: return os << "!=";
case token::LessThan: return os << "<";
case token::LessEquals: return os << "<=";
case token::GreaterThan: return os << ">";
case token::GreaterEquals: return os << ">=";
case token::SlimArrow: return os << "->";
case token::FatArrow: return os << "=>";
case token::Monkey: return os << "@";
case token::Sha256: return os << "#";
case token::Func: return os << "func";
case token::Return: return os << "return";
case token::If: return os << "if";
case token::Else: return os << "else";
case token::While: return os << "while";
case token::Public: return os << "public";
case token::Private: return os << "private";
case token::Pointerof: return os << "pointerof";
case token::Sizeof: return os << "sizeof";
case token::Lengthof: return os << "lengthof";
case token::S8: return os << "s8";
case token::U8: return os << "u8";
case token::S16: return os << "s16";
case token::U16: return os << "u16";
case token::S32: return os << "s32";
case token::U32: return os << "u32";
case token::S64: return os << "s64";
case token::U64: return os << "u64";
case token::UnexpectedCharacter: return os << "Unexpected character `" << token.value.character << "`";
case token::UnexpectedEOF: return os << "Unexpected End Of File";
case token::EndOfFile: return os << "End Of File";
}
return os;
}
};
using token_t = enum token::type;