COMMITS
/ examples/server/server.cpp December 10, 2024
Y
December 8, 2024
X
server : fix format_infill (#10724)
Xuan Son Nguyen committed
X
server : bring back info of final chunk in stream mode (#10722)
Xuan Son Nguyen committed
December 7, 2024
X
server : (refactor) no more json in server_task input (#10691)
Xuan Son Nguyen committed
G
server : various fixes (#10704)
Georgi Gerganov committed
G
server : fix free of spec context and batch (#10651)
Georgi Gerganov committed
December 6, 2024
X
server : (refactoring) do not rely on JSON internally (#10643)
Xuan Son Nguyen committed
December 4, 2024
G
server : fix speculative decoding with context shift (#10641)
Georgi Gerganov committed
December 3, 2024
X
server : (web ui) Various improvements, now use vite as bundler (#10599)
Xuan Son Nguyen committed
G
server : fix default draft model parameters (#10586)
Georgi Gerganov committed
December 2, 2024
H
server: Add "tokens per second" information in the backend (#10548)
haopeng committed
December 1, 2024
A
server : bind to any port when specified (#10590)
alek3y committed
November 26, 2024
G
server : fix parallel speculative decoding (#10513)
Georgi Gerganov committed
November 25, 2024
G
server : enable cache_prompt by default (#10501)
Georgi Gerganov committed
D
llama : accept a list of devices to use to offload a model (#10497)
Diego Devesa committed
G
server : add speculative decoding support (#10455)
Georgi Gerganov committed
G
speculative : refactor and add a simpler example (#10362)
Georgi Gerganov committed
November 16, 2024
M
server: (web UI) Add samplers sequence customization (#10255)
MaggotHATE committed
November 15, 2024
X
server : (web UI) add copy button for code block, fix api key (#10242)
Xuan Son Nguyen committed
November 13, 2024
J
server : fix incorrect res in validate_model_chat_template (#10272)
Jhen-Jie Hong committed
November 7, 2024
X
server : revamp chat UI with vuejs and daisyui (#10175)
Xuan Son Nguyen committed
November 6, 2024
G
server : remove hack for extra parallel slot (#10187)
Georgi Gerganov committed
November 4, 2024
X
server : clarify /slots endpoint, add is_processing (#10162)
Xuan Son Nguyen committed
November 2, 2024
S
server : fix slot selection by lru (#10126)
sasha0552 committed
G
server : fix endpoint checks (#10135)
Georgi Gerganov committed
November 1, 2024
S
server : fix smart selection of available slot (#10120)
sasha0552 committed
October 31, 2024
K
server : include scheme when printing URL (#10106)
Kevin Gibbons committed
October 29, 2024
G
llama : remove Tail-Free sampling (#10071)
Georgi Gerganov committed
October 28, 2024
G
server : don't overfill the batch during infill (#10018)
Georgi Gerganov committed
October 25, 2024
W
llama : add DRY sampler (#9702)
wwoodsTM committed
M
llama: string_split fix (#10022)
Michael Podvitskiy committed
G
server : check that the prompt fits in the slot's context (#10030)
Georgi Gerganov committed
October 24, 2024
X
server : refactor slot input data, move tokenizer to HTTP thread (#10023)
Xuan Son Nguyen committed
October 23, 2024
W
server : samplers accept the prompt correctly (#10019)
wwoodsTM committed
October 18, 2024
X
llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745)
Xuan Son Nguyen committed
G
server : add n_indent parameter for line indentation requirement (#9929)
Georgi Gerganov committed
October 16, 2024
A
server : fix the disappearance of the end of the text (#9867)
Alexey Parfenov committed
October 15, 2024
G
server : improve infill context reuse (#9894)
Georgi Gerganov committed
M
sampling : add XTC sampler (#9742)
MaggotHATE committed
October 13, 2024
G
server : accept extra_context for the infill endpoint (#9874)
Georgi Gerganov committed
G
server : reuse cached context chunks (#9866)
Georgi Gerganov committed
October 12, 2024
G
server : add option to time limit the generation phase (#9865)
Georgi Gerganov committed
G
server : remove self-extend features (#9860)
Georgi Gerganov committed
G
server : remove legacy system_prompt feature (#9857)
Georgi Gerganov committed
G
llama : improve infill support and special token detection (#9798)
Georgi Gerganov committed
October 10, 2024
D
common : use common_ prefix for common library functions (#9805)
Diego Devesa committed
October 8, 2024
X
server : better security control for public deployments (#9776)
Xuan Son Nguyen committed
October 5, 2024
G
rerank : use [SEP] token instead of [BOS] (#9737)
Georgi Gerganov committed
September 28, 2024
G
llama : add reranking support (#9510)
Georgi Gerganov committed
September 25, 2024
X
server : add more env vars, improve gen-docs (#9635)
Xuan Son Nguyen committed